Skip to content
Pembersih Teks
Tools

Pembersih Teks

Baru

Hapus spasi berlebih, pemutus baris, HTML, dan tanda kutip pintar dari teks.

Quick presets

✶ AI preset — strips em dashes (—), smart/curly quotes, zero-width & invisible Unicode, and Markdown: the fingerprints left by ChatGPT and other LLMs.

Whitespace & spacing
AI text — quotes, dashes & invisible chars
Strip content
Line breaks
Join into one paragraph, or replace line breaks with commas.
Input: 0 words · 0 chars · 0 lines Output: 0 words · 0 chars · 0 lines 0 chars removed

Runs entirely in your browser. Nothing is uploaded.

Bersihkan teks berantakan dalam satu klik

Pembersih teks gratis ini memperbaiki semua yang salah saat Anda menyalin dan menempel: format yang menempel, spasi ganda, jeda baris yang canggung, baris kosong, sisa HTML, tanda kutip keriting "pintar", em dash, dan Unicode tak terlihat. Aktifkan pembersihan yang Anda inginkan dan hasilnya diperbarui langsung — tanpa upload, tanpa daftar, tanpa reload halaman.

Ini adalah cara tercepat untuk menghapus format dari teks dan mengubah konten yang disalin dari PDF, email, Word, Google Docs, dan halaman web menjadi teks polos yang bersih dan bisa Anda tempel di mana saja.

Bersihkan teks ChatGPT dan hasil AI

Alat penulisan AI meninggalkan jejak khas: em dash panjang (—), tanda kutip pintar yang keriting (" " ' '), spasi non-breaking, dan karakter Unicode zero-width / tak terlihat yang bertahan setelah copy-paste biasa. Preset satu klik Clean AI / ChatGPT text menghapus semuanya sekaligus, plus sisa Markdown, sehingga teksnya terlihat seperti buatan manusia dan bisa ditempel dengan bersih ke CMS, editor kode, atau email.

Mengubah tanda kutip keriting "pintar" menjadi lurus dan em dash — menjadi hyphen - juga menghentikan gangguan encoding yang merusak file CSV, JSON, dan sistem teks polos.

Hapus jeda baris, \n, dan spasi berlebih

Perlu menghapus semua jeda baris dan menggabungkan semuanya menjadi satu paragraf? Atur mode Line breaks ke "Join with space". Ingin mengganti jeda baris dengan koma untuk spreadsheet atau daftar? Pilih "Join with comma" untuk mengubah setiap baris menjadi nilai yang dipisahkan koma. Toggle whitespace juga memangkas ujung baris, merapatkan spasi berlebih, mengonversi tab, dan menghapus baris kosong dalam satu proses yang sama.

Ini mencakup pencarian populer seputar menghapus newline dari file teks, menghilangkan karakter \n dari sebuah string, menghapus jarak antar baris, dan menangani hapus jeda baris di Word atau Excel — semuanya tanpa makro, plugin, atau bolak-balik Find & Replace.

Hapus HTML, Markdown, emoji, dan Unicode

Tempel sepotong konten web dan aktifkan Strip HTML untuk membuang setiap <tag> dan mendekode entity seperti &nbsp;. Strip Markdown menghapus heading, **bold**, _italic_, tautan, dan blok kode. Remove emojis membersihkan 😀 serta rangkaian bendera/skin-tone, sementara Remove non-ASCIIpembersih teks Unicode sesungguhnya — mereduksi teks menjadi ASCII 7-bit polos.

Toggle opsional juga menghapus tanda baca, simbol, atau angka untuk saat Anda hanya butuh kata-katanya saja.

Preset, penghitung langsung, dan ekspor

Lima preset satu klik — Clean AI text, Remove all formatting, Single line, Tidy whitespace, dan Plain ASCII — langsung mengatur toggle yang tepat, dan Anda bisa menyempurnakan dari sana. Penghitung langsung menampilkan karakter, kata, dan baris untuk baik input maupun hasil bersih, plus persis berapa banyak karakter yang dihapus. Setelah siap, Copy hasilnya atau Download sebagai file .txt.

Perbandingan dengan TextSoap, Text Mechanic, dan TinyWow

TextSoap (dari Unmarked Software, $40) menangani sebagian besar pembersihan yang sama tetapi hanya untuk macOS, berbayar, dan tidak punya versi browser atau preset teks AI — jadi jika Anda memakai Windows, Linux, atau ponsel, ini bukan pilihan. Text Mechanic (textmechanic.com) gratis dan terkenal tetapi menyebarkan fiturnya di halaman-halaman terpisah: satu halaman untuk menghapus baris kosong, halaman lain untuk menghapus jeda baris, halaman ketiga untuk membersihkan HTML. Tidak ada ruang kerja gabungan dan tidak ada preset pembersihan AI.

TinyWow menyertakan alat teks, tetapi dokumen yang Anda tempel dikirim ke server TinyWow untuk diproses. Itu tidak masalah untuk konten yang tidak sensitif, tetapi berarti teks Anda meninggalkan perangkat Anda. Hal yang sama berlaku untuk banyak "pembersih teks online" lain yang diam-diam melakukan pekerjaannya di sisi server. Pembersih teks UtiloKit melakukan semua pekerjaan secara lokal memakai JavaScript di tab browser Anda — tidak ada yang dikirim ke mana pun, alat ini berfungsi offline setelah pemuatan pertama, dan tidak ada batas penggunaan atau watermark.

Privat, instan, dan offline

Tidak ada yang perlu diinstal dan tidak ada yang perlu didaftarkan. Setiap pembersihan — merapatkan spasi, menghapus HTML, meluruskan tanda kutip, menghapus Unicode tak terlihat — terjadi secara lokal di browser Anda, sehingga teks Anda tidak pernah meninggalkan perangkat Anda. Karena tidak bergantung pada server, pembersih teks ini tetap berfungsi offline setelah halaman dimuat. Simpan sebagai bookmark dan rapikan teks kapan saja.

Masalah karakter tersembunyi: tanda kutip pintar, zero-width space, dan byte-order mark

Saat Anda menyalin teks dari pengolah kata atau situs web, sekumpulan karakter ikut berpindah secara tak terlihat dan menyebabkan kerusakan yang hampir mustahil didiagnosis dengan mata telanjang. Tanda kutip pintar — tanda kutip ganda tipografis kiri dan kanan (U+201C “ dan U+201D ”) dan tanda kutip tunggal kiri serta kanan (U+2018 ‘ dan U+2019 ’) — terlihat baik-baik saja saat dicetak tetapi merupakan code point yang sepenuhnya berbeda dari tanda kutip ASCII lurus (U+0022) dan apostrof ASCII lurus (U+0027) yang diharapkan JSON, CSV, SQL, skrip shell, dan sebagian besar bahasa pemrograman. Nilai JSON seperti {"key": “value”} adalah kesalahan sintaks; klausa SQL WHERE name = ‘Alice’ akan diam-diam mengembalikan nol baris.

Zero-width space (U+200B) adalah karakter tunggal yang dirender sebagai tidak ada apa-apa sama sekali — tanpa glyph, tanpa lebar — namun mendarat di tengah kata saat Anda menyalin dari situs web, PDF, atau alat AI. Pencarian kata "résumé" akan melewatkan kata yang terlihat identik yang mengandung zero-width space setelah "é". Zero-width non-joiner (U+200C) dan soft hyphen (U+00AD) menyebabkan masalah ketidaksesuaian tak terlihat yang sama, sementara byte-order mark (U+FEFF, BOM) — ditambahkan di depan file yang disimpan oleh Notepad Windows dalam mode UTF-8 — merusak field pertama setiap CSV dan menyebabkan error "\xEF\xBB\xBF unexpected token" pada parser yang tidak secara eksplisit menghapusnya. Satu-satunya perbaikan andal adalah menjalankan teks lewat pembersih yang mengenali semua code point ini dan menghapusnya dalam satu proses.

Deteksi adalah rintangan pertama: tidak satu pun karakter ini terlihat di editor teks atau pengolah kata standar. Anda butuh hex editor atau alat yang secara eksplisit menargetkannya. Toggle Remove invisible Unicode di sini menghapus zero-width space, zero-width non-joiner, soft hyphen, dan BOM dalam satu langkah, dan toggle Straighten quotes memetakan keempat varian tanda kutip keriting ke padanan ASCII polosnya, sehingga teks yang disalin menjadi aman untuk ditempel ke kode, file konfigurasi, dan basis data.

Normalisasi Unicode: mengapa dua string yang tampak identik ternyata tidak sama

Unicode memungkinkan karakter visual yang sama dikodekan dalam lebih dari satu urutan byte. Huruf ü, misalnya, bisa disimpan sebagai satu code point gabungan U+00FC (bentuk NFC — precomposed) atau sebagai huruf polos u (U+0075) diikuti diaeresis gabungan (U+0308) yang melekatkan titik-titiknya (bentuk NFD — decomposed). Keduanya dirender identik, tetapi perbandingan string byte-per-byte mengembalikan false, pencocokan ekspresi reguler gagal, dan pencarian kamus melewatkan kuncinya. Ini menyebabkan kerusakan data yang diam-diam terjadi di basis data, error sistem berkas, dan indeks pencarian yang rusak.

Masalah ini sangat terasa di beberapa skenario dunia nyata. URL slug yang diturunkan dari heading bisa bentrok atau 404 tergantung bentuk normalisasi mana yang dipilih server dan browser masing-masing. macOS menyimpan nama file dalam NFD; Windows dan sebagian besar sistem berkas Linux memakai NFC. File bernama café.txt yang disalin antar platform bisa menghasilkan dua file dengan nama yang terlihat sama tetapi sesungguhnya adalah path yang berbeda. NFKC dan NFKD melangkah lebih jauh: keduanya juga mengembangkan karakter kompatibilitas, mengonversi ligatur seperti fi (U+FB01) menjadi urutan dua huruf fi, dan meruntuhkan varian gaya seperti angka Romawi Ⅳ (U+2163) menjadi huruf polos IV — penting saat teks perlu bisa dicari atau diindeks. Sebagian besar basis data dan mesin pencari modern menormalisasi secara internal, tetapi data yang masuk dari sumber eksternal — web scraping, impor file, respons API — sebaiknya dinormalisasi ke bentuk yang konsisten sebelum disimpan.

Perbaikan praktis untuk sebagian besar pekerjaan pemrosesan teks adalah menormalisasi semuanya ke NFC sebelum perbandingan atau penyimpanan, dan memakai NFKC saat Anda butuh dekomposisi kompatibilitas penuh untuk pencarian. Di JavaScript, str.normalize('NFC') melakukan tugas ini. Pembersih teks menerapkan normalisasi ini sebagai bagian dari pembersihan Unicode-nya, sehingga string yang terlihat sama tetapi dibandingkan tidak sama dalam kode Anda keluar dengan encoding yang konsisten.

Mojibake: seperti apa error encoding teks dan cara memperbaikinya

Mojibake (文字化け — bahasa Jepang untuk "transformasi karakter") adalah teks kacau yang muncul ketika byte yang ditulis dalam satu encoding dibaca kembali dalam encoding yang berbeda. Kasus paling umum di web adalah teks UTF-8 yang salah dibaca sebagai Windows-1252 (juga disebut cp1252 atau "ANSI"), yang menjadi encoding default di versi Windows dan Internet Explorer yang lebih lama. Tanda kutip tunggal kanan ’ disimpan dalam UTF-8 sebagai urutan dua byte 0xE2 0x80 0x99; ketika byte itu didekode sebagai Windows-1252, hasilnya adalah string tiga karakter ’. Serupa, huruf e kecil beraksen akut (é, U+00E9) di-encode menjadi 0xC3 0xA9 dalam UTF-8, yang dibaca Windows-1252 sebagai string dua karakter é. Setelah Anda mempelajari pola-pola ini, Anda bisa langsung mengenali mojibake.

Pipeline deklarasi encoding memiliki tiga lapisan, dan ketidaksesuaian di salah satunya menyebabkan masalah. Tag HTML meta charset (<meta charset="utf-8">) memberi tahu browser cara mendekode halaman. HTTP Content-Type header (Content-Type: text/html; charset=utf-8) diprioritaskan di atas tag meta ketika keduanya ada. Collation basis data — misalnya utf8mb4_unicode_ci di MySQL — menentukan bagaimana basis data menyimpan dan membandingkan string. Ketidaksesuaian antara dua dari lapisan-lapisan ini sudah cukup untuk merusak karakter, dan kerusakannya bisa kumulatif: teks yang sudah salah di-encode sekali bisa salah di-encode lagi, menghasilkan double-mojibake seperti ‘ untuk tanda kutip tunggal kiri.

Windows-1252 hampir identik dengan ISO-8859-1 (Latin-1) tetapi memberikan karakter berbeda untuk rentang byte 0x80–0x9F, yang di ISO-8859-1 dibiarkan sebagai karakter kontrol. Karakter yang bisa dicetak di rentang itu meliputi tanda euro € (0x80), tanda kutip low-9 tunggal dan ganda ‚ dan „ (0x82, 0x84), elipsis horizontal … (0x85) serta em dash dan en dash — dan – (0x97, 0x96). Ketika byte Windows-1252 itu didekode sebagai Latin-1, karakter-karakter ini menghilang atau menjadi kode kontrol. Mendiagnosis mojibake cukup sederhana: jika Anda melihat ’ atau é, byte-nya adalah UTF-8 tetapi didekode sebagai Windows-1252. Jika Anda melihat kotak atau tanda tanya, byte-nya berisi code point yang tidak didefinisikan sama sekali oleh encoding yang dipilih. Perbaikannya selalu mengidentifikasi encoding sumber yang benar dan mendekode ulang byte mentah dengan tepat sebelum pemrosesan lebih lanjut.

Taksonomi whitespace: spasi yang bukan spasi

Tidak semua whitespace adalah karakter spasi biasa (U+0020). Konten web, hasil pengolah kata, dan teks yang terinternasionalisasi secara rutin mengandung karakter spasi yang terlihat identik dengan spasi normal tetapi berperilaku berbeda dalam tata letak, pencarian, dan pemrosesan string. Yang paling umum adalah non-breaking space (U+00A0, &nbsp; di HTML), yang mencegah jeda baris di antara kata-kata di kedua sisinya. Di browser yang merendernya dengan benar itu tidak masalah, tetapi di kolom teks atau basis data, pencarian "New York" akan melewatkan "New York" yang mengandung non-breaking space — keduanya adalah byte yang berbeda. Non-breaking space sangat umum ditemukan di teks yang disalin dari halaman web karena browser menyisipkannya secara otomatis untuk mempertahankan rangkaian whitespace.

Di luar kasus yang umum, Unicode mendefinisikan seluruh set karakter spasi dengan lebar spesifik yang dipakai dalam tipografi profesional. Thin space (U+2009) dipakai di sekitar operator matematika dan dalam beberapa standar format angka (misalnya, 1 000 000 alih-alih 1.000.000). Hair space (U+200A) bahkan lebih sempit dan muncul di buku bertipeset di sekitar tanda baca. Figure space (U+2007) tepat selebar satu digit angka, dipakai untuk menyejajarkan kolom angka. Em space (U+2003) sesuai dengan em font saat ini. Ideographic space (U+3000) adalah spasi selebar penuh yang dipakai dalam teks CJK (Cina, Jepang, dan Korea) di mana setiap karakter menempati blok persegi yang sama; ini secara visual tidak bisa dibedakan dari ideograf selebar penuh oleh non-pembaca tetapi lebarnya dua kali spasi Latin.

Akhir baris adalah dimensi lain dari ambiguitas whitespace. Windows memakai urutan dua byte carriage-return + line-feed (CRLF, U+000D U+000A). Unix dan macOS modern hanya memakai line-feed (LF, U+000A). Classic Mac OS (sebelum OS X) hanya memakai carriage-return (CR, U+000D). File yang disimpan di Windows dan dibuka di alat Unix sering menampilkan karakter literal ^M di akhir setiap baris; file yang disimpan di classic Mac OS menampilkan seluruh isinya sebagai satu baris tunggal di sebagian besar editor modern. Pendekatan yang benar sebelum pemrosesan teks apa pun adalah menormalisasi semua akhir baris ke satu bentuk yang konsisten — hampir selalu LF — dan mengonversi semua karakter spasi eksotis menjadi spasi biasa atau menghapusnya, tergantung apakah teks di sekitarnya ditujukan untuk tampilan atau untuk kolom data.

Frequently asked questions

Bagaimana cara menghapus format dari teks?

Tempel teks Anda ke kotak input dan versi yang sudah dibersihkan langsung muncul di sebelah kanan. Aktifkan Strip HTML, Straighten quotes, dan toggle whitespace untuk menghilangkan gaya bold/italic, tanda kutip keriting, dan spasi yang salah dalam satu proses — atau tekan preset "Remove all formatting". Misalnya, cuplikan rich-text seperti "<b>Hello</b>&nbsp; there" menjadi baris polos "Hello there". Setiap toggle diperbarui langsung sehingga Anda melihat hasilnya sebelum menyalin.

Bagaimana cara membersihkan teks ChatGPT atau hasil AI?

Klik preset satu klik "Clean AI / ChatGPT text". Alat ini menghapus jejak khas AI dalam satu proses: em dash panjang (—) menjadi hyphen, "tanda kutip pintar" keriting menjadi lurus, spasi non-breaking dan karakter Unicode zero-width / tak terlihat dihapus, dan sisa Markdown seperti **bold** diratakan. Hasilnya terbaca seperti buatan manusia dan bisa ditempel dengan bersih ke CMS, email, atau editor kode.

Bagaimana cara menghapus newline dari file teks?

Buka file di editor teks apa pun, salin teksnya, lalu tempel di sini. Atur kontrol Line breaks ke "Join with space" untuk mengganti setiap newline dengan satu spasi (mengubah file menjadi satu paragraf panjang), atau "Join with comma" untuk menghasilkan daftar yang dipisahkan koma. Klik Download untuk menyimpan hasilnya sebagai file .txt yang bersih. Seluruh proses berlangsung instan dan tidak ada yang meninggalkan perangkat Anda.

Bagaimana cara menghapus semua jeda baris di Word?

Di Word Anda perlu membuka Find & Replace, ketikkan ^p di Find dan spasi di Replace, lalu Replace All — merepotkan dan mudah salah. Lebih cepat di sini: tempel teksnya, atur kontrol Line breaks ke "Join with space" (satu paragraf) atau "Join with comma" (daftar dipisah koma), lalu salin hasilnya kembali ke Word. Anda juga bisa mengunduh teks yang sudah bersih sebagai file .txt dan membukanya baru.

Bagaimana cara menghapus \n dari sebuah string?

\n adalah karakter newline. Tempel string-nya di sini dan atur Line breaks ke "Join with space" untuk mengganti setiap \n dengan satu spasi, atau "Join with comma" untuk menukar setiap newline dengan koma dan spasi. Misalnya, "line1\nline2\nline3" menjadi "line1, line2, line3". Baris kosong dihapus dalam proses yang sama sehingga Anda tidak pernah mendapat pemisah ganda.

Bagaimana cara menghapus jarak antar baris?

"Jarak antar baris" biasanya berarti salah satu dari dua hal. Jika maksud Anda baris kosong tambahan di antara paragraf, aktifkan Remove blank lines — ini menyaring setiap baris kosong. Jika maksud Anda rangkaian spasi dalam satu baris, aktifkan Collapse spaces untuk merapatkan urutan beberapa spasi menjadi satu. Kedua toggle bekerja bersama dan memperbarui hasilnya secara langsung saat Anda mengetik.

Bagaimana cara mengubah tanda kutip pintar atau keriting menjadi tanda kutip lurus?

Aktifkan toggle "Straighten quotes". Ini memetakan tanda kutip ganda keriting “” menjadi tanda kutip lurus dan tanda kutip tunggal keriting ‘’ (serta apostrof ’) menjadi apostrof lurus, sehingga teks yang disalin dari Word, Google Docs, atau alat AI berhenti merusak file CSV, JSON, dan kode. Misalnya “it’s a “test”” menjadi versi yang bersih dan lurus tanda kutipnya.

Bagaimana cara menghapus em dash dari teks?

Aktifkan "Normalize dashes". Setiap em dash (—) dan en dash (–) diganti dengan hyphen biasa (-), dan elipsis Unicode (…) menjadi tiga titik (...). Ini salah satu cara tercepat membuat teks hasil AI terlihat alami, karena penggunaan em dash yang berlebihan adalah jejak khas LLM.

Bagaimana cara menghapus karakter khusus atau Unicode?

Gunakan "Remove non-ASCII" untuk mereduksi teks menjadi ASCII 7-bit polos (pembersih teks Unicode sesungguhnya), atau "Remove punctuation" untuk hanya mempertahankan huruf, angka, dan spasi. Tips: aktifkan "Straighten quotes" dan "Normalize dashes" terlebih dahulu sehingga karakter yang berguna dikonversi menjadi padanan ASCII-nya alih-alih dihapus.

Bagaimana cara menghapus karakter zero-width atau tak terlihat?

Aktifkan "Remove invisible Unicode". Ini menghapus zero-width space (U+200B), zero-width joiner/non-joiner, byte-order mark (U+FEFF), word joiner, dan soft hyphen — karakter tersembunyi yang tertempel dari alat AI dan situs web serta bisa merusak pencarian, slug, dan kode sambil tetap tak terlihat di layar.

Bagaimana cara menghapus tag HTML dari teks?

Nyalakan "Strip HTML". Setiap tag seperti <p>, <a>, atau <span> dihapus dan entity umum seperti &amp;nbsp;, &amp;amp;, dan &amp;quot; didekode kembali menjadi karakter aslinya. Jadi "<p>Hi&amp;nbsp;there</p>" menjadi teks polos "Hi there".

Bagaimana cara menghapus emoji dari teks?

Aktifkan "Remove emojis". Ini membersihkan emoji termasuk rangkaian multi-karakter — varian skin-tone, bendera seperti 🇺🇸 dan keycap — sehingga "Great work 👍🏽🎉" menjadi "Great work ". Padukan dengan "Collapse spaces" untuk merapikan celah yang ditinggalkan emoji.

Bagaimana cara menempel tanpa format?

Di sebagian besar aplikasi Anda bisa menempel sebagai teks polos dengan Ctrl+Shift+V (Cmd+Shift+V di Mac), yang melewati gaya sumbernya. Ketika opsi itu tidak tersedia — atau Anda juga perlu memperbaiki tanda kutip, dash, dan karakter tak terlihat — tempel di sini, terapkan preset "Remove all formatting", dan salin hasil yang bersih.

Bagaimana perbandingannya dengan TextSoap dan Text Mechanic?

TextSoap ($40 dari Unmarked Software) mencakup pembersihan serupa tetapi berbayar dan hanya berjalan di macOS — tidak ada versi web, tidak ada ponsel, dan tidak ada preset teks AI. Text Mechanic (textmechanic.com) gratis tetapi memisah setiap fungsi ke selusin halaman terpisah tanpa preset gabungan dan tanpa pembersihan ChatGPT. Alat teks TinyWow mengunggah konten Anda ke server mereka untuk diproses. Pembersih teks UtiloKit menggabungkan semua fungsi dalam satu halaman, berfungsi di perangkat apa pun dengan browser, dan berjalan sepenuhnya di perangkat Anda — tidak ada yang dikirim ke mana pun.

Apakah aman membersihkan teks online, dan apakah bisa dipakai offline?

Ya. Setiap pembersihan berjalan sepenuhnya di browser Anda dengan JavaScript — teks Anda tidak pernah diunggah, dicatat, atau dikirim ke server mana pun, sehingga dokumen rahasia sekalipun tetap ada di perangkat Anda. Karena tidak bergantung pada jaringan, alat ini tetap berfungsi offline setelah halaman dimuat.