Блог
Текстовые утилиты

Очистка HTML тегов онлайн

Вставьте фрагмент HTML-кода или скопированный с веб-страницы текст с разметкой — инструмент уберёт все теги, оставив только читаемый текст. По желанию декодирует HTML-сущности и убирает лишние пустые строки, образовавшиеся на месте удалённых блочных тегов.

Результат

Тегов удалено

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

Способ очистки Регулярное выражение, а не разбор через DOM — HTML не подключается к странице
Что считается тегом Любая последовательность от «<» до ближайшего «>»
Декодируемые сущности &amp; &lt; &gt; &quot; &#39; &apos; &nbsp;
Схлопывание пустых строк Три и более переноса строки подряд сводятся к двум

Когда этот метод вводит в заблуждение

Как это считается

Инструмент ищет в тексте все последовательности от символа «<» до ближайшего «>» регулярным выражением и удаляет их — это не разбор через DOM-парсер, поэтому потенциально опасный HTML (скрипты) никогда не подключается к самой странице.

Если включена опция декодирования сущностей, после удаления тегов оставшийся текст проверяется на вхождение семи стандартных HTML-сущностей, каждая заменяется на соответствующий символ.

Если включена опция схлопывания пустых строк, три и более переноса строки подряд (обычно образующиеся на месте удалённых блочных тегов вроде &lt;div&gt; или &lt;p&gt;) сводятся к двум переносам.

Счётчик показывает, сколько отдельных тегов было найдено и удалено — не элементов разметки, а именно совпадений с шаблоном «<...>».

Вопросы и ответы

Это безопасно — вставлять чужой HTML в это поле?

Да, для очистки не используется innerHTML или разбор через DOM — вставленный текст никогда не превращается в исполняемую разметку на странице, он обрабатывается как обычная строка.

Почему в результате остались какие-то сущности вроде &copy;?

Декодируется только фиксированный список из семи самых распространённых сущностей (&amp;, &lt;, &gt;, &quot;, &#39;, &apos;, &nbsp;). Именованные и числовые сущности за пределами этого списка остаются как есть.

Скрипты и стили удаляются целиком?

Только сами теги &lt;script&gt; и &lt;style&gt;. Код между ними остаётся в результате как обычный текст — инструмент не распознаёт содержимое этих тегов как единый блок для удаления.

Мой текст куда-то отправляется?

Нет, вся обработка выполняется в вашем браузере.

Похожие утилиты

Все утилиты