HTML to Markdown
नयाConvert HTML to clean Markdown — pastes, imports files, and handles lists, tables and code.
Runs entirely in your browser. Nothing is uploaded.
HTML को Markdown में क्यों convert करें?
Markdown तकनीकी लेखन, documentation और developer-facing content के लिए standard plain-text format बन चुका है। HTML के विपरीत, यह raw form में भी आसानी से पढ़ा जा सकता है, किसी भी text editor में काम करता है, Git के साथ clean version-control होता है, और GitHub, GitLab, Notion, Obsidian तथा सभी major static site generators द्वारा natively supported है। जब content पहले से HTML में मौजूद हो — किसी CMS से, scraped article से, email से, या पुराने documentation platform से — तो उसे Markdown में convert करने से बिना manual reformatting के ये सभी workflows उपलब्ध हो जाते हैं।
2026 में एक और व्यावहारिक कारण है: AI और LLM pipelines raw HTML की बजाय Markdown को बहुत prefer करते हैं। Research दिखाती है कि एक ही content के लिए clean Markdown, raw HTML की तुलना में 68–87% कम tokens उपयोग करता है। जब documentation को retrieval-augmented generation (RAG) system में डाला जाता है, या fine-tuned model के लिए training data तैयार की जाती है, तो पहले HTML को Markdown में convert करना अब standard practice बन गई है। Perplexity, ChatGPT और Gemini सभी web content को internally Markdown-जैसे format में convert करते हैं — इसलिए उन्हें सीधे Markdown देने से एक lossy conversion step बच जाता है।
DOM-based HTML to Markdown conversion कैसे काम करती है
Raw HTML strings पर fragile regular expressions लगाने की बजाय — जो approach malformed tags, nested elements और edge cases पर टूट जाती है — यह tool आपके HTML को browser के built-in parser से एक real DOM tree में parse करता है। फिर यह प्रत्येक node को recursively walk करता है, element types को उनके Markdown equivalents से map करता है। Block elements (headings, paragraphs, lists, code blocks) को double newlines मिलती हैं ताकि Markdown सही render हो। Inline elements (bold, italic, code, links) surrounding content के अंदर inline Markdown syntax produce करते हैं।
यह DOM-based approach वही technique है जो Turndown.js में इस्तेमाल होती है — leading HTML-to-Markdown JavaScript library जिसके 2.5 मिलियन से ज्यादा weekly npm downloads हैं। यह regex-based converters के miss होने वाले edge cases को handle करता है: blockquotes के अंदर nested lists, list items के अंदर code, images wrap करने वाले anchor tags, और deeply nested table cells। div, section और article जैसे unknown structural HTML elements बस अपने children को pass-through करते हैं, इसलिए कोई content silently drop नहीं होती।
Common use cases: CMS migration, Notion, GitHub docs
CMS migration सबसे आम professional use case है। WordPress, Confluence, SharePoint या Ghost से modern Markdown-based platform पर जाने वाली teams exported content process करने के लिए HTML-to-Markdown conversion का उपयोग करती हैं। WordPress का export HTML content blocks देता है; Confluence pages को HTML या XHTML के रूप में export करता है — दोनों cleanly convert होते हैं। Markdown files फिर Git repository में commit की जाती हैं, Notion में इसके Markdown import feature से import की जाती हैं, या Docusaurus, MkDocs या Astro जैसे static site generator में डाली जाती हैं।
Personal knowledge management एक और common use case है। Obsidian और Logseq जैसे tools Markdown files के इर्द-गिर्द बने हैं। जब आप कोई article या documentation page अपने knowledge base में archive करना चाहते हैं, तो यह converter आपको page HTML paste करने और seconds में clean Markdown file पाने देता है — raw HTML tags के शोर के बिना structure preserve करते हुए। Word count display यह confirm करने में मदद करता है कि conversion के दौरान कोई content drop तो नहीं हुई।
Pandoc बनाम browser-based converters: कब कौन उपयोग करें
Pandoc professional pipelines में document conversion का gold standard है — एक command-line tool जो दर्जनों formats के बीच convert करता है जिसमें HTML to Markdown, Markdown to PDF और कई अन्य शामिल हैं। यह definition lists, footnotes और complex nested structures जैसे edge cases handle करता है, और किसी भी JavaScript converter से ज्यादा output flavors support करता है: MultiMarkdown, Pandoc Markdown, AsciiDoc, reStructuredText और अन्य। यदि आप server पर automated batch-conversion pipeline बना रहे हैं, तो Pandoc सही choice है।
One-off conversions, quick content migrations, या sensitive material के साथ काम करने के लिए जो आपके device से बाहर नहीं जानी चाहिए, browser-based converter तेज और ज्यादा practical है। कुछ install करने की जरूरत नहीं, कोई command line सीखने की जरूरत नहीं, instant results। यह tool real-world HTML structures की vast majority को cover करता है — headings, paragraphs, lists, tables, code blocks, links, images — जो इसे रोजमर्रा की HTML-to-Markdown जरूरतों के लिए practical choice बनाता है। Markdownify और h2m solid npm alternatives हैं अगर आपको Node में conversions script करनी हों, लेकिन उनके लिए project setup चाहिए जिसे यह tool पूरी तरह skip करता है।
Markdown syntax reference और output compatibility
इस tool के Markdown conventions: headings h1–h6 के लिए # से ###### का उपयोग करती हैं, bold text को **double asterisks** में wrap करती हैं, italic को *single asterisks* में, inline code को backticks में, और fenced code blocks को optional language identifier के साथ triple backticks में। Links [text](url) pattern follow करते हैं और images  use करती हैं। Unordered lists dash prefix use करती हैं; ordered lists period के बाद numbers। Blockquotes प्रत्येक line को > से prefix करते हैं।
Tables columns separate करने के लिए pipe characters का उपयोग करते हैं, header row के बाद dashes की separator row (और alignment के लिए optional colons) के साथ। Strikethrough text को ~~double tildes~~ में wrap करता है। Output CommonMark with GitHub Flavored Markdown (GFM) extensions follow करता है, जो इसे GitHub, GitLab, VS Code preview, Notion, Obsidian और virtually हर modern Markdown renderer के साथ compatible बनाता है। यदि platforms के बीच rendering differences दिखें, तो वे लगभग हमेशा platform के non-standard Markdown flavor use करने के कारण होते हैं, output में कोई समस्या नहीं।
Privacy, no limits, और mobile support
यह HTML to Markdown converter 100% आपके browser में run होता है। कुछ भी server पर upload नहीं होता, कुछ भी log नहीं होता, और कोई account की जरूरत नहीं। इसका मतलब है कि confidential documentation, internal wikis, या client content paste करना safe है — यह कभी आपके device से बाहर नहीं जाता। आप page load होने के बाद internet disconnect भी कर सकते हैं और यह काम करता रहेगा, जो सबसे simple proof है कि कोई server involved नहीं है।
कोई file size limit नहीं है, कोई daily conversion quota नहीं है, और कोई paywall नहीं है। Online converters जो files server-side process करते हैं, जैसे कुछ Pandoc web wrappers या document conversion APIs, अक्सर file sizes को 1–5 MB पर cap करते हैं या free users को प्रति दिन कुछ conversions तक सीमित करते हैं। इस tool में ऐसी कोई restriction नहीं है। यह iPhone और Android पर भी काम करता है — अपने phone के browser से HTML paste करें, convert करें, और Markdown result को सीधे Notion, Obsidian या किसी भी app में copy करें।
Frequently asked questions
यह converter कौन से HTML elements support करता है?
यह converter headings (h1–h6), paragraphs, bold, italic, strikethrough, inline code, fenced code blocks, blockquotes, horizontal rules, links, images, ordered lists, unordered lists, nested lists और tables handle करता है — पूरे CommonMark और GitHub Flavored Markdown (GFM) feature set को cover करता है। div, section और article जैसे unknown structural elements अपने children को transparently pass-through करते हैं इसलिए content कभी नहीं खोती। Real-world HTML — CMS export से, scraped article से, या documentation page से — बिना किसी post-processing के cleanly convert होती है।
यह Pandoc या Turndown.js से अलग कैसे है?
Pandoc एक powerful command-line converter है लेकिन installation, terminal और इसके flags की जानकारी चाहता है। यह automated server-side pipelines के लिए सही tool है लेकिन one-off conversion के लिए overkill है। Turndown.js HTML-to-Markdown काम के लिए सबसे ज्यादा use होने वाली JavaScript library है — 2.5 मिलियन से ज्यादा weekly npm downloads, 10,800+ GitHub stars — और यह tool उसी DOM-based parsing approach का उपयोग करता है जो Turndown को reliable बनाती है। फर्क यह है कि सब कुछ आपके browser में run होता है: कोई install नहीं, कोई command line नहीं, कोई server round-trip नहीं, और कोई file आपके device से नहीं जाती। Turndown के लिए Node project setup चाहिए; इसके लिए नहीं।
HTML को Markdown में क्यों convert करें?
Markdown तकनीकी लेखन, documentation और content management का standard plain-text format है। HTML को Markdown में convert करने से आप content को Notion या Obsidian में import कर सकते हैं, इसे code के साथ Git repository में commit कर सकते हैं, Astro, Hugo या Jekyll जैसे static site generators के जरिए publish कर सकते हैं, या इसे AI models और LLMs को feed कर सकते हैं। 2024 में published research दिखाती है कि large language models के साथ उपयोग करने पर Markdown, raw HTML की तुलना में token usage 68–87% कम करता है — RAG pipelines बनाते समय या fine-tuning datasets तैयार करते समय यह एक real cost और accuracy difference है।
क्या मैं इसे CMS migration के लिए use कर सकता हूं?
हां — CMS migration सबसे common professional use cases में से एक है। WordPress, Confluence, SharePoint, Ghost, या किसी अन्य platform से exported HTML paste करें और clean Markdown पाएं जिसे नए system में import किया जा सके। WordPress का export HTML content blocks देता है; Confluence pages को HTML या XHTML के रूप में export करता है — दोनों cleanly convert होते हैं। Best results के लिए, navigation और footer वाले पूरे page HTML की बजाय सिर्फ content body paste करें। Teams ने browser-based HTML-to-Markdown conversion का उपयोग करके 150–200-page documentation sites को दो दिनों से कम में migrate किया है, बिना command line को touch किए।
HTML tables को Markdown में कैसे convert किया जाता है?
Tables को GitHub Flavored Markdown (GFM) pipe-table format में convert किया जाता है, header row के बाद dashes की separator row के साथ। यह format GitHub, GitLab, VS Code preview, Notion, Obsidian, Docusaurus और virtually सभी modern Markdown renderers में काम करता है। Nested tables को flatten किया जाता है क्योंकि standard Markdown उन्हें natively support नहीं करता। Column alignment — align attribute या CSS text-align के जरिए left, center, right — separator row में colon placement का उपयोग करके preserve की जाती है (जैसे left के लिए :---, center के लिए :---:, right के लिए ---:)।
क्या converter offline काम करता है?
हां। Conversion पूरी तरह browser में built-in DOM parser का उपयोग करके होती है — कोई file upload नहीं होती और page load होने के बाद internet connection की जरूरत नहीं। यह confidential HTML के साथ उपयोग के लिए safe बनाता है जैसे internal documentation, proprietary API references, या client work जो आपके device से बाहर नहीं जानी चाहिए। आप इसे verify कर सकते हैं: browser DevTools खोलें, Network tab पर जाएं, और confirm करें कि HTML paste करने और conversion trigger करने पर zero network requests fire होती हैं। कुछ भी आपकी machine से नहीं जाता।
'Trim extra whitespace' option क्या करता है?
यह Markdown output की प्रत्येक line से trailing spaces और tabs हटाता है, और multiple consecutive blank lines को single blank line में collapse करता है। यह files को clean रखता है और उस invisible whitespace से बचाता है जो strict Markdown parsers में rendering को affect कर सकती है — खासकर GitHub के, जो trailing whitespace को lint issue के रूप में highlight करता है। यह output को documentation tools में drop करना भी आसान बनाता है जो whitespace checks चलाते हैं। लगभग सभी cases में यह option on रखना safe है। बहुत कम ही trailing whitespace का semantic meaning होता है।
क्या nested lists सही से convert होती हैं?
हां। Nested ul और ol elements को recursively process किया जाता है और प्रत्येक level Markdown output में सही indent होती है। Mixed nesting — unordered lists के अंदर ordered lists, या vice versa — भी correctly handle होती है। उदाहरण के लिए, ordered list के अंदर three-level-deep unordered list को प्रत्येक level पर proper four-space indentation मिलती है, जो CommonMark standard है। यह उन edge cases में से एक है जहां regex-based converters अक्सर fail होते हैं और broken Markdown produce करते हैं। DOM-based parsing इसे reliably handle करती है।
Output किस Markdown flavor का उपयोग करता है?
Output tables और strikethrough के लिए GitHub Flavored Markdown (GFM) extensions के साथ CommonMark follow करता है। CommonMark standardized spec है जो most platforms द्वारा use होती है, और GFM उस pipe-table syntax और ~~ strikethrough को add करता है जिसे GitHub, GitLab और VS Code सभी support करते हैं। यह output को GitHub, GitLab, VS Code, Notion, Obsidian, Docusaurus, MkDocs और most modern Markdown renderers के साथ compatible बनाता है। यदि आपको GFM extensions के बिना strict CommonMark चाहिए, तो tables ही एकमात्र element होगा जो differ करेगा — बाकी सब identical है।
क्या मैं पूरे webpage को Markdown में convert कर सकता हूं?
आप कोई भी HTML fragment या full page body paste कर सकते हैं। Best results के लिए सिर्फ main content area paste करें — nav, sidebar और footer वाला पूरा document नहीं — ताकि output meaningful content पर focused रहे। अधिकतर developers browser DevTools Elements panel से सिर्फ article या documentation div copy करते हैं (right-click → Copy → Copy outerHTML)। यह structural page chrome के बिना clean content HTML देता है। Converter full-page HTML भी handle करता है लेकिन output में navigation text को links की flat list के रूप में converted शामिल होगा, जो usually वह नहीं होता जो आप चाहते हैं।
2026 में AI और LLMs के लिए Markdown, HTML से बेहतर क्यों है?
Perplexity, ChatGPT और Gemini जैसे AI systems अब web content को read, chunk और reuse करके answers generate करते हैं। Markdown उनका preferred input format है क्योंकि यह HTML structure tags को strip करता है जो बिना semantic meaning add किए tokens consume करते हैं। <p class="article-body"> tags में wrapped paragraph, plain Markdown में उसी paragraph से ज्यादा tokens cost करता है। 2024 में published research दिखाती है कि same content के लिए Markdown, raw HTML की तुलना में token usage 68–87% कम करता है — जो directly API cost कम करता है और retrieval-augmented generation (RAG) pipelines के लिए signal-to-noise improve करता है।
Inline code और code blocks कैसे handle होते हैं?
Inline code elements (pre के बाहर code tags) single backticks में wrap होते हैं। Code blocks (pre > code elements) triple-backtick fenced blocks में wrap होते हैं, CommonMark और GFM standard। यदि code element में 'language-python' या 'lang-python' जैसी class है, तो language identifier extract होकर syntax highlighting के लिए opening fence में preserve होती है। GitHub README pages या documentation sites से converted code blocks अपने language tags output में retain करते हैं — इसलिए HTML में आपकी syntax highlighting Markdown में survive करती है।
यह Markdownify या h2m से कैसे compare करता है?
Markdownify और h2m build pipeline में programmatic HTML-to-Markdown conversion के लिए Node.js npm packages हैं। ये सही choice हैं जब आपको script में सैकड़ों files में conversion automate करनी हो। यह browser tool उस use case को cover करता है जो वे cover नहीं करते: quick one-off conversions, content जिसे आप server के साथ share नहीं कर सकते, और ऐसी situations जहां आप Node project setup नहीं करना चाहते। Conversion quality similar है — तीनों regex की बजाय DOM-based parsing use करते हैं — लेकिन यह tool live preview, copy button और character/word counts add करता है जो इसे content work के लिए ज्यादा practical बनाते हैं।
क्या यह tool iPhone और Android पर काम करता है?
हां, converter mobile browsers पर fully काम करता है। Clipboard से HTML paste करें, conversion trigger करें, और Markdown result copy करें — सब phone या tablet से। Interface smaller screens के लिए stacked panes के साथ adapt होता है। iOS 17 के लिए Safari और Android 14 के लिए Chrome पर tested। एक common mobile use case: अपने browser के Share menu से article का HTML grab करें, convert करें, और Markdown को directly Obsidian या Notion में paste करें उसी device पर, desktop की जरूरत के बिना। No sign-up, no app download, no limits।
HTML comments और script/style tags का क्या होता है?
HTML comments (<!-- ... -->) output से strip होते हैं क्योंकि Markdown में कोई comment syntax नहीं है और comments rarely actual content का हिस्सा होते हैं। Script tags और उनके contents भी drop होते हैं — JavaScript Markdown में meaningful नहीं है। Style tags और inline style attributes भी remove होते हैं; CSS styling Markdown में translate नहीं होती, और semantic meaning (bold, italic, heading) visual style की बजाय element type के जरिए preserve होती है। यदि कोई span CSS की बजाय strong या b tag के जरिए bold है, तो वह styling carry over नहीं होगी — जो content format conversion के लिए correct behavior है।
क्या कोई file size या character limit है?
नहीं। कोई server involved नहीं है, इसलिए आपके browser की memory जितनी handle कर सके उससे ज्यादा कोई size limit नहीं है। व्यवहार में, browser DOM parser बिना किसी समस्या के कई megabytes के HTML handle कर सकता है — किसी भी real CMS page से बहुत ज्यादा। यदि आप extremely large HTML file convert कर रहे हैं (complete book export, बहुत लंबा scraped article), तो clearest output के लिए एक साथ नहीं बल्कि sections में paste करें। Conversion खुद milliseconds लेती है चाहे size कुछ भी हो क्योंकि यह directly आपके browser tab में JavaScript में run होती है।
Related tools
सभी टूल्स देखेंस्प्रेडशीट कॉलम कन्वर्टर
स्प्रेडशीट कॉलम नंबर को उसके अक्षर (1 → A) में और वापस बदलें।
Srcset जेनरेटर
अपनी widths से srcset और sizes के साथ रिस्पॉन्सिव <img> markup बनाएँ।
Regex टेस्टर
लाइव मैच हाइलाइटिंग, कैप्चर ग्रुप्स और रिप्लेस प्रीव्यू के साथ रेगुलर एक्सप्रेशन जाँचें।
JSON Schema Validator
Validate JSON against a JSON Schema (draft-07 / draft-2020-12) with clear error messages.
YAML Formatter
Validate, beautify, and convert YAML online. Real-time syntax highlighting, error detection with line numbers, and one-click JSON export.
JSON फ़ॉर्मेटर
तुरंत एरर संकेतों के साथ JSON को सुंदर बनाएँ, मिनिफ़ाई और वैलिडेट करें।