HTML to Markdown
НовоеConvert HTML to clean Markdown — pastes, imports files, and handles lists, tables and code.
Runs entirely in your browser. Nothing is uploaded.
Зачем конвертировать HTML в Markdown?
Markdown стал стандартным текстовым форматом для технической документации, разработки и работы с контентом. В отличие от HTML, он легко читается в сыром виде, работает в любом текстовом редакторе, корректно версионируется через Git и нативно поддерживается такими платформами, как GitHub, GitLab, Notion, Obsidian и всеми популярными генераторами статических сайтов. Когда контент уже существует в HTML — из CMS, скачанной статьи, письма или устаревшей документации — конвертация в Markdown открывает доступ ко всем этим рабочим процессам без ручного форматирования.
В 2026 году появилась ещё одна практическая причина: ИИ и LLM-конвейеры предпочитают Markdown сырому HTML. Исследования показывают, что чистый Markdown сокращает расход токенов на 68–87% по сравнению с HTML при том же содержимом. При подаче документации в систему RAG (поиск с дополненной генерацией) или при подготовке обучающих данных для дообучения модели предварительная конвертация HTML в Markdown стала стандартной практикой. Perplexity, ChatGPT и Gemini внутренне преобразуют веб-контент в Markdown-подобные представления перед обработкой — поэтому передача Markdown напрямую избавляет от лишнего шага преобразования.
Как работает конвертация HTML в Markdown на основе DOM
Вместо применения ненадёжных регулярных выражений к строкам HTML — подхода, который ломается на неверных тегах, вложенных элементах и граничных случаях — этот инструмент разбирает HTML во внутреннее DOM-дерево, используя встроенный парсер браузера. Затем он рекурсивно обходит каждый узел, сопоставляя типы элементов их Markdown-эквивалентам. Блочные элементы (заголовки, абзацы, списки, блоки кода) получают двойные переносы строк для корректного отображения. Строчные элементы (жирный, курсив, код, ссылки) формируют Markdown-синтаксис прямо внутри окружающего текста.
Этот DOM-подход используется в Turndown.js — ведущей JavaScript-библиотеке для конвертации HTML в Markdown с более чем 2,5 миллиона еженедельных загрузок через npm. Он обрабатывает граничные случаи, с которыми не справляются конвертеры на основе регулярных выражений: вложенные списки внутри блочных цитат, код внутри элементов списка, теги ссылок вокруг изображений и глубоко вложенные ячейки таблиц. Неизвестные структурные HTML-элементы — div, section, article — просто передают своих дочерних элементов, не теряя контент.
Типичные сценарии: миграция CMS, Notion, документация GitHub
Миграция CMS — наиболее распространённый профессиональный сценарий. Команды, переходящие с WordPress, Confluence, SharePoint или Ghost на современную платформу на основе Markdown, используют конвертацию HTML в Markdown для обработки экспортированного контента. Экспорт WordPress даёт HTML-блоки контента; Confluence экспортирует страницы как HTML или XHTML. Оба формата конвертируются без проблем. Полученные Markdown-файлы затем помещаются в Git-репозиторий, импортируются в Notion через встроенную функцию импорта Markdown или передаются в генератор статических сайтов — Docusaurus, MkDocs или Astro.
Ещё один распространённый сценарий — управление личными знаниями. Инструменты вроде Obsidian и Logseq построены на Markdown-файлах. Когда вы находите статью или страницу документации, которую хотите сохранить в своей базе знаний, этот конвертер позволяет вставить HTML страницы и получить чистый Markdown-файл за секунды — с сохранением структуры без лишних HTML-тегов. Счётчик слов помогает убедиться, что ни один фрагмент контента не был утерян при конвертации.
Pandoc и браузерные конвертеры: когда что использовать
Pandoc — золотой стандарт для конвертации документов в профессиональных конвейерах: инструмент командной строки, преобразующий десятки форматов, в том числе HTML в Markdown, Markdown в PDF и многое другое. Он обрабатывает граничные случаи — списки определений, сноски, сложные вложенные структуры — и поддерживает больше выходных форматов, чем любой JavaScript-конвертер: MultiMarkdown, Pandoc Markdown, AsciiDoc, reStructuredText и другие. Если вы строите автоматизированный конвейер пакетной конвертации на сервере, Pandoc — правильный выбор.
Для разовых конвертаций, быстрых миграций контента или работы с конфиденциальными материалами, которые не должны покидать устройство, браузерный конвертер удобнее и быстрее. Ничего не нужно устанавливать, не нужно изучать командную строку, результат мгновенный. Этот инструмент охватывает подавляющее большинство реальных HTML-структур — заголовки, абзацы, списки, таблицы, блоки кода, ссылки, изображения — что делает его практичным выбором для повседневных задач конвертации HTML в Markdown. Markdownify и h2m — надёжные npm-альтернативы для скриптовой конвертации в Node, но они требуют настройки проекта, которую этот инструмент полностью исключает.
Справочник по синтаксису Markdown и совместимость вывода
Основные соглашения Markdown, которых придерживается этот инструмент: заголовки обозначаются # через ###### для h1–h6, жирный текст оборачивается в **двойные звёздочки**, курсив — в *одинарные звёздочки*, строчный код — в обратные кавычки, а блоки кода — в тройные обратные кавычки с опциональным идентификатором языка. Ссылки следуют шаблону [текст](url), изображения используют формат . Маркированные списки используют дефис; нумерованные списки — цифры с точкой. Блочные цитаты добавляют символ > в начало каждой строки.
Таблицы используют символы | для разделения столбцов, со строкой-разделителем из дефисов (и опциональных двоеточий для выравнивания) после строки заголовка. Зачёркнутый текст оборачивается в ~~двойные тильды~~. Вывод следует CommonMark с расширениями GitHub Flavored Markdown (GFM), что обеспечивает совместимость с GitHub, GitLab, предпросмотром VS Code, Notion, Obsidian и практически всеми современными движками Markdown. Если вы замечаете различия в отображении между платформами, они почти всегда связаны с нестандартным диалектом Markdown на конкретной платформе, а не с проблемами вывода.
Конфиденциальность, отсутствие ограничений и поддержка мобильных устройств
Этот конвертер HTML в Markdown работает полностью в вашем браузере. Ничего не загружается на сервер, ничего не записывается в логи, аккаунт не нужен. Это значит, что можно безопасно вставлять конфиденциальную документацию, внутренние вики или клиентский контент — они никогда не покидают ваше устройство. Можно даже отключиться от интернета после загрузки страницы, и инструмент продолжит работать — это простейшее доказательство отсутствия сервера.
Нет ограничений по размеру файла, нет дневной квоты конвертаций, нет платного доступа. Онлайн-конвертеры, обрабатывающие файлы на стороне сервера — некоторые веб-обёртки Pandoc или API конвертации документов — часто ограничивают размер файлов до 1–5 МБ или число бесплатных конвертаций в день. Этот инструмент лишён подобных ограничений. Он также работает на iPhone и Android — вставьте HTML из браузера телефона, конвертируйте и скопируйте результат в Markdown напрямую в Notion, Obsidian или любое другое приложение.
Frequently asked questions
Какие HTML-элементы поддерживает конвертер?
Конвертер обрабатывает заголовки (h1–h6), абзацы, жирный текст, курсив, зачёркивание, строчный код, ограждённые блоки кода, блочные цитаты, горизонтальные разделители, ссылки, изображения, нумерованные списки, маркированные списки, вложенные списки и таблицы — охватывая полный набор возможностей CommonMark и GitHub Flavored Markdown (GFM). Неизвестные структурные элементы — div, section, article — прозрачно передают своих дочерних элементов, не теряя контент. Большинство реального HTML — из экспорта CMS, скачанной статьи или страницы документации — конвертируется без необходимости дополнительной обработки.
Чем этот инструмент отличается от Pandoc или Turndown.js?
Pandoc — мощный конвертер командной строки, но он требует установки, терминала и знания параметров запуска. Он подходит для автоматизированных серверных конвейеров, но избыточен для разовой конвертации. Turndown.js — наиболее используемая JavaScript-библиотека для конвертации HTML в Markdown: более 2,5 миллиона еженедельных загрузок через npm, свыше 10 800 звёзд на GitHub. Этот инструмент использует тот же DOM-подход парсинга, который делает Turndown надёжным. Отличие в том, что всё работает в браузере: без установки, командной строки, серверных запросов, и ни один файл не покидает устройство. Turndown требует настройки Node-проекта — этот инструмент не требует ничего.
Зачем конвертировать HTML в Markdown?
Markdown — стандартный текстовый формат для технической документации и управления контентом. Конвертация HTML в Markdown позволяет импортировать контент в Notion или Obsidian, фиксировать его в Git-репозитории вместе с кодом, публиковать через генераторы статических сайтов — Astro, Hugo, Jekyll — или передавать в ИИ-модели и LLM. Исследования 2024 года показывают, что Markdown сокращает расход токенов на 68–87% по сравнению с сырым HTML при использовании с большими языковыми моделями — это реальная разница в стоимости и точности при построении RAG-конвейеров или подготовке датасетов для дообучения.
Можно ли использовать инструмент для миграции CMS?
Да — миграция CMS является одним из наиболее распространённых профессиональных сценариев использования. Вставьте HTML, экспортированный из WordPress, Confluence, SharePoint, Ghost или любой другой платформы, и получите чистый Markdown для импорта в новую систему. Экспорт WordPress даёт HTML-блоки контента; Confluence экспортирует страницы как HTML или XHTML — оба формата конвертируются без проблем. Для лучших результатов вставляйте только основное тело контента, а не полный HTML страницы с навигацией и подвалом. Команды использовали браузерную конвертацию HTML в Markdown для переноса документации объёмом 150–200 страниц менее чем за два дня, не обращаясь к командной строке.
Как HTML-таблицы конвертируются в Markdown?
Таблицы конвертируются в формат pipe-таблиц GitHub Flavored Markdown (GFM) со строкой-разделителем из дефисов после строки заголовка. Этот формат работает в GitHub, GitLab, предпросмотре VS Code, Notion, Obsidian, Docusaurus и практически во всех современных движках Markdown. Вложенные таблицы сводятся в плоскую структуру, поскольку стандартный Markdown не поддерживает их нативно. Выравнивание столбцов — левое, по центру, правое через атрибут align или CSS text-align — сохраняется с помощью расположения двоеточий в строке-разделителе (например: :--- для левого, :---: для центра, ---: для правого).
Работает ли конвертер без интернета?
Да. Конвертация происходит полностью в браузере с использованием встроенного DOM-парсера — файлы не загружаются, интернет-соединение не требуется после загрузки страницы. Это делает инструмент безопасным для работы с конфиденциальным HTML: внутренней документацией, проприетарными справочниками API или клиентскими материалами, которые не должны покидать устройство. Проверить это просто: откройте DevTools браузера, перейдите на вкладку Network и убедитесь, что при вставке HTML и запуске конвертации не отправляется ни один сетевой запрос. Ничего не уходит с вашего устройства.
Что делает опция «Удалить лишние пробелы»?
Она удаляет конечные пробелы и табуляции из каждой строки Markdown-вывода, а также сворачивает несколько последовательных пустых строк в одну. Это сохраняет файлы в чистоте и предотвращает появление невидимых пробелов, которые могут повлиять на отображение в строгих парсерах Markdown — особенно в GitHub, который выделяет конечные пробелы как проблему линтера. Опция также облегчает использование вывода в документационных инструментах с проверкой пробелов. В подавляющем большинстве случаев её можно оставить включённой. Только в редких ситуациях конечные пробелы несут смысловую нагрузку.
Корректно ли конвертируются вложенные списки?
Да. Вложенные элементы ul и ol обрабатываются рекурсивно, и каждый уровень корректно отступает в Markdown-выводе. Смешанная вложенность — нумерованные списки внутри маркированных и наоборот — также обрабатывается правильно. Трёхуровневый маркированный список внутри нумерованного, например, получает правильный четырёхпробельный отступ на каждом уровне — это стандарт CommonMark. Именно здесь конвертеры на основе регулярных выражений часто дают сбои и создают сломанный Markdown. DOM-парсинг справляется с этим надёжно.
Какой диалект Markdown используется в выводе?
Вывод следует CommonMark с расширениями GitHub Flavored Markdown (GFM) для таблиц и зачёркивания. CommonMark — стандартизированная спецификация, используемая большинством платформ; GFM добавляет синтаксис pipe-таблиц и зачёркивание ~~, поддерживаемые GitHub, GitLab и VS Code. Это обеспечивает совместимость с GitHub, GitLab, предпросмотром VS Code, Notion, Obsidian, Docusaurus, MkDocs и большинством современных движков Markdown. Если нужен строгий CommonMark без расширений GFM, единственным отличающимся элементом будут таблицы — всё остальное идентично.
Можно ли конвертировать полную веб-страницу в Markdown?
Можно вставить любой HTML-фрагмент или полное тело страницы. Для лучших результатов рекомендуется вставлять только основную область контента — без полного документа с навигацией, боковой панелью и подвалом — чтобы вывод был сосредоточен на значимом содержимом. Большинство разработчиков копируют только div с статьёй или документацией из панели Elements в DevTools браузера (правая кнопка мыши → Копировать → Скопировать outerHTML). Это даёт чистый HTML контента без структурного обрамления страницы. Инструмент обрабатывает и полный HTML страницы, но вывод будет включать текст навигации в виде плоского списка ссылок, что обычно нежелательно.
Почему Markdown лучше HTML для ИИ и LLM в 2026 году?
ИИ-системы вроде Perplexity, ChatGPT и Gemini теперь читают, разбивают на фрагменты и используют веб-контент для генерации ответов. Markdown — их предпочтительный входной формат, поскольку он убирает HTML-теги структуры, которые расходуют токены, не добавляя смысловой ценности. Абзац в теге <p class="article-body"> стоит больше токенов, чем тот же абзац в чистом Markdown. Исследования 2024 года показывают, что Markdown сокращает расход токенов на 68–87% по сравнению с сырым HTML при том же содержимом — это напрямую снижает стоимость API и улучшает соотношение сигнал/шум для конвейеров RAG.
Как обрабатываются строчный код и блоки кода?
Строчные элементы кода (теги code не внутри pre) оборачиваются в одиночные обратные кавычки. Блоки кода (элементы pre > code) оборачиваются в ограждённые блоки с тройными обратными кавычками — стандарт CommonMark и GFM. Если элемент code имеет класс вроде 'language-python' или 'lang-python', идентификатор языка извлекается и сохраняется в открывающем ограждении для подсветки синтаксиса. Блоки кода, конвертированные со страниц README на GitHub или из документации, сохраняют языковые теги в выводе — подсветка синтаксиса из HTML переходит в Markdown.
Как этот инструмент сравнивается с Markdownify или h2m?
Markdownify и h2m — npm-пакеты для Node.js, предназначенные для программной конвертации HTML в Markdown в рамках конвейера сборки. Они подходят для автоматизации конвертации сотен файлов в скрипте. Этот браузерный инструмент покрывает сценарий, который они не закрывают: быстрые разовые конвертации, контент, который нельзя отправлять на сервер, и ситуации, когда нет желания настраивать Node-проект. Качество конвертации сопоставимо — все три инструмента используют DOM-парсинг вместо регулярных выражений — но этот инструмент добавляет предпросмотр в реальном времени, кнопку копирования и счётчики символов и слов, что делает его практичнее для работы с контентом.
Работает ли инструмент на iPhone и Android?
Да, конвертер полностью работает в мобильных браузерах. Вставьте HTML из буфера обмена, запустите конвертацию и скопируйте результат в Markdown — всё это с телефона или планшета. Интерфейс адаптируется к небольшим экранам с вертикальным расположением панелей. Проверено в Safari для iOS 17 и Chrome для Android 14. Один из распространённых мобильных сценариев: взять HTML статьи через меню «Поделиться» в браузере, конвертировать и вставить Markdown напрямую в Obsidian или Notion на том же устройстве, не прибегая к компьютеру. Без регистрации, без установки приложения, без ограничений.
Что происходит с HTML-комментариями и тегами script/style?
HTML-комментарии (<!-- ... -->) удаляются из вывода, поскольку в Markdown нет синтаксиса комментариев, а сами комментарии редко являются частью реального контента. Теги script и их содержимое также отбрасываются — JavaScript не имеет смысла в Markdown. Теги style и строчные атрибуты style тоже удаляются: стилизация CSS не переводится в Markdown, а семантическое значение (жирный, курсив, заголовок) сохраняется через тип элемента, а не визуальный стиль. Если span выделен жирным через CSS, а не через тег strong или b, это форматирование не перенесётся — что является корректным поведением для конвертации формата содержимого.
Есть ли ограничения по размеру файла или количеству символов?
Нет. Сервер не используется, поэтому нет ограничений по размеру, кроме возможностей памяти браузера. На практике браузерный DOM-парсер без проблем обрабатывает несколько мегабайт HTML — значительно больше любой реальной страницы CMS. При конвертации очень большого HTML-файла (полный экспорт книги, очень длинная скачанная статья) для получения наиболее чёткого вывода рекомендуется вставлять его по частям. Сама конвертация занимает миллисекунды вне зависимости от объёма, поскольку выполняется непосредственно в JavaScript в вашей вкладке браузера.
Related tools
Все инструментыКонвертер столбцов таблиц
Переводите номер столбца таблицы в букву (1 → A) и обратно.
Генератор srcset
Создавайте адаптивную разметку <img> с srcset и sizes из ваших значений ширины.
Тестер регулярных выражений
Тестируйте регулярные выражения с подсветкой совпадений в реальном времени, группами захвата и предпросмотром замены.
JSON Schema Validator
Validate JSON against a JSON Schema (draft-07 / draft-2020-12) with clear error messages.
YAML Formatter
Validate, beautify, and convert YAML online. Real-time syntax highlighting, error detection with line numbers, and one-click JSON export.
Форматер JSON
Форматируйте, минифицируйте и проверяйте JSON с мгновенными подсказками об ошибках.