Apa yang dibawa dokumen, dan apa yang dilakukan setiap konversi terhadapnya
File .docx adalah ZIP berisi file-file XML, dan sebagian besar yang menjadikannya dokumen bukanlah teksnya. Ada style — definisi bernama seperti Heading 1 yang dipakai bersama oleh banyak paragraf — dan ada format langsung, ketika seseorang memilih satu baris lalu menekan bold. Keduanya tampak identik tetapi berperilaku sama sekali berbeda saat dikonversi: style tetap bertahan sebagai style, sedangkan teks berformat langsung hanya bertahan sebagai format yang dihasilkannya. Di sampingnya ada definisi penomoran, tracked changes, komentar, catatan kaki, header dan footer, kotak teks, font yang di-embed, dan properti dokumen, masing-masing disimpan terpisah dari teks paragraf.
Nomor daftar adalah contoh yang paling jelas. Word tidak menyimpan “1.” sebagai teks; Word menyimpan rujukan ke definisi penomoran dan menghitung nomornya saat menggambar halaman. Karena itu, pengekstrak teks yang menelusuri XML paragraf membuang setiap nomor dan memberi Anda daftar tanpa nomor. DOCX ke TXT justru menyusunnya kembali — “1.”, “1.1”, “a)”, “iii.” — termasuk daftar yang dimulai ulang atau berlanjut di sepanjang dokumen.
Tracked changes dan komentar adalah keputusan, bukan kebetulan. Dokumen yang sedang ditinjau menyimpan teks yang dihapus sekaligus teks yang disisipkan, di file yang sama, dengan penandaan. DOCX ke TXT membacanya seolah semua perubahan sudah diterima: sisipan dipertahankan, penghapusan ditinggalkan. Komentar sama sekali tidak disertakan, dan biasanya itulah yang Anda inginkan jika teks biasanya akan dipublikasikan. Catatan kaki dan catatan akhir muncul sebagai penanda [1] dengan catatannya dikumpulkan di akhir, header dan footer bisa diaktifkan, dan kotak teks muncul masing-masing sekali sesuai urutan baca, tidak berulang atau hilang.
Yang dikunci oleh konversi ke PDF adalah pembagian halaman. Di pengolah kata, di mana halaman empat berakhir dihitung ulang setiap kali file dibuka, memakai font dan driver printer milik siapa pun yang membukanya — karena itulah dokumen tiba dengan tabel yang terbelah di dua halaman di komputer penerima, padahal tidak di komputer Anda. PDF tidak menghitung ulang seperti itu: pergantian halaman ditentukan sekali, saat konversi, dan kini menjadi bagian tetap dari file. Word ke PDF, ODT ke PDF, dan RTF ke PDF mendapatkan pergantian halaman itu dari tata letak pengolah kata yang lengkap, bukan dari browser yang menirunya, dan karena itulah kotak teks, bentuk, header, dan footer berada di tempat yang ditentukan penulisnya.
Yang hilang adalah kemampuan untuk diedit dan alur ulang teks. Style menjadi format visual, outline menjadi bookmark, dan teks tidak lagi menyesuaikan diri dengan layar ponsel. Font yang di-embed di dokumen dipakai apa adanya; font yang tidak di-embed dan tidak tersedia bagi konverter diganti dengan padanan terdekat yang metriknya kompatibel, sehingga baris tetap terputus di tempat yang sama meskipun bentuk hurufnya berbeda.
E-book tidak punya halaman yang perlu dipertahankan. EPUB, MOBI, dan AZW3 bersifat reflowable — aplikasi pembaca yang menentukan di mana setiap halaman berakhir, dengan ukuran font apa pun yang Anda pilih — sehingga “halaman 40” bukan sifat bukunya, dan pembagian halaman di PDF Anda dibuat saat konversi berdasarkan ukuran halaman dan margin yang Anda pilih. Yang ada di file adalah struktur bab dan daftar isi, dan keduanya menjadi tautan dan bookmark PDF yang sesungguhnya. AZW3 membawa stylesheet dan sering kali font yang di-embed, sehingga hasilnya tampak seperti rancangan penerbit; file MOBI lama sama sekali tidak punya stylesheet, dan karena itulah MOBI yang dikonversi tampak lebih polos daripada buku yang sama di aplikasi Kindle — aplikasinya menambahkan tipografi yang tidak pernah ada di file.
RTF sepenuhnya berupa teks, dan karena itulah RTF bertahan melewati puluhan tahun software. Kelemahannya ada pada encoding karakter: RTF lebih tua daripada Unicode dan menyimpan teks dalam code page lama — Eropa Tengah, Sirilik, Yunani, Jepang — dan dari situlah mojibake pada RTF yang dikonversi dengan buruk berasal. Setiap code page di-decode dengan benar di sini, begitu pula teks Unicode modern.
Kapan browser memang bukan alat yang tepat
Sebagian alat ini menjaga file Anda sepenuhnya privat dan sebagian menyerahkannya ke server, dan penting untuk tepat tentang mana yang mana. PDF ke Teks, TXT ke PDF, DOCX ke TXT, HTML ke DOCX, dan Markdown ke HTML tidak pernah mengirim apa pun — file dibaca, dikonversi, dan ditulis di sini, dan tidak ada yang keluar. Word ke PDF, ODT ke PDF, RTF ke PDF, HTML ke PDF, Markdown ke PDF, dan tiga konverter e-book melakukan konversi di server kami, karena mereproduksi tata letak halaman pengolah kata, atau membagi halaman buku dengan benar, bukan hal yang bisa dipalsukan oleh halaman web. Yang dikirim berbeda-beda: dokumen Word, ODT, dan RTF dikirim apa adanya, sedangkan file Markdown dan e-book dibongkar dan dirakit menjadi halaman web terlebih dulu, dan halaman rakitan itulah yang dikirim. Apa pun caranya, file dikirim lewat koneksi terenkripsi, dikonversi, dan dihapus begitu file unduhan Anda siap — tidak ada yang disimpan, dicatat, atau dibagikan. Setiap alat itu juga beralih ke konverternya sendiri jika server tidak bisa dijangkau, dan memberi tahu Anda saat itu terjadi, serta apa yang tidak bisa dipertahankan oleh konverter cadangannya.
Format yang tidak kami buka. File biner .doc lama dari Word 97–2003 bisa dikonversi dengan baik di Word ke PDF, karena server membacanya secara langsung — tetapi DOCX ke TXT yang berjalan di browser tidak bisa, dan memerlukan .docx. Dokumen yang dilindungi kata sandi perlu dihapus kata sandinya di program yang memasangnya. Buku Kindle yang dilindungi DRM tidak bisa dibuka oleh konverter mana pun di mana pun — memang itulah tujuan perlindungannya — begitu pula format KFX Amazon yang lebih baru, yang hanya bisa dibaca aplikasi Kindle.
Pekerjaan dokumen panjang. Master document, kolom rujukan silang, indeks, daftar otoritas yang dibuat otomatis, mail merge, dan pengelola kutipan adalah fitur pengolah kata, dan konverter bukanlah pengolah kata. Instal LibreOffice — gratis, bisa membaca setiap format di halaman ini, dan untuk pekerjaan-pekerjaan itu memang program yang tepat.
Batch dan otomatisasi. Alat-alat ini berjalan saat seseorang mengklik. Mengonversi seribu file secara terjadwal adalah pekerjaan command line, dan alat gratisnya sangat bagus: LibreOffice dalam mode headless mengonversi apa pun yang bisa dibuka Writer, Pandoc berpindah antara Markdown, HTML, DOCX, LaTeX, dan belasan format lain dengan kendali lebih besar daripada formulir web mana pun, dan Calibre menangani e-book dalam jumlah banyak serta mengonversi antar-semua format e-book yang tidak dilindungi.
Tata letak yang setia ke arah sebaliknya. Mengubah PDF dengan desain rumit kembali menjadi dokumen yang bisa diedit adalah soal penafsiran, bukan konversi, dan tidak ada yang bisa melakukannya dengan sempurna — bukan kami, bukan pula produk desktop yang mahal. Jika dokumen aslinya masih ada, edit dokumen itu.
Memilih di antara alat yang namanya mirip
Markdown ke PDF vs Markdown ke HTML. Parser yang sama, tujuan yang berbeda. Markdown ke PDF memberi Anda dokumen berhalaman dengan jenis huruf, ukuran halaman, dan margin pilihan Anda, judul sebagai bookmark PDF, dan daftar isi yang melompat ke halaman yang tepat — untuk dicetak, dilampirkan, atau diarsipkan. Markdown ke HTML memberi Anda halaman mandiri yang sudah diberi gaya atau potongan HTML polos untuk ditempel ke CMS — untuk dipublikasikan. Jika Anda ingin Markdown di Word, lewati Markdown ke HTML lalu HTML ke DOCX.
Word ke PDF vs ODT ke PDF vs RTF ke PDF. Konversi yang sama di baliknya; bedanya hanya pada apa yang Anda masukkan. Word ke PDF untuk .docx. ODT ke PDF untuk apa pun dari LibreOffice, OpenOffice, atau “Download as OpenDocument” di Google Docs. RTF ke PDF untuk WordPad, TextEdit, serta surat dan laporan yang masih dihasilkan sistem bisnis. Memilih halaman yang sesuai dengan ekstensi Anda tidak sepenting yang Anda kira — yang penting adalah tidak satu pun dari ketiganya adalah TXT ke PDF, yang memang tidak punya format untuk dipertahankan.
TXT ke PDF vs Markdown ke PDF. TXT ke PDF menata teks Anda sebagai teks: satu jenis huruf, margin Anda, tanpa penafsiran. Markdown ke PDF membaca # dan * sebagai perintah dan menghasilkan judul, daftar, tabel, kode yang diwarnai, dan outline bookmark. Masukkan file Markdown ke TXT ke PDF, dan Anda mendapat PDF berisi tanda bintang.
EPUB, MOBI, dan AZW3 ke PDF. Ketiganya menerima lebih banyak daripada yang tersirat dari namanya, jadi yang mana pun akan membuka file Anda; halamannya berbeda karena bukunya berbeda. EPUB dan AZW3 (KF8) membawa stylesheet dan sering kali font yang di-embed, sehingga hasilnya tampak dirancang. MOBI adalah wadah lama dengan format minimal, dan PDF hasil konversinya memang sengaja polos. Jika file Kindle berisi kedua tata letak, yang lebih baru yang dipakai.
HTML ke DOCX vs Markdown ke HTML. HTML ke DOCX menata markup-nya terlebih dulu, sehingga CSS yang sudah diterapkan — font, ukuran, warna, jarak, garis tepi — ditulis ke dokumen sebagai format Word sungguhan, dengan style heading Word, daftar sungguhan, dan tabel sungguhan, bukan kotak-kotak yang dipaku di tempatnya. Markdown ke HTML menghasilkan markup-nya sejak awal. Tidak satu pun yang menjalankan JavaScript, kapan pun.
DOCX ke TXT vs PDF ke Teks. Keduanya memberi Anda teks biasa, tetapi yang dibaca sangat berbeda. File .docx masih tahu apa itu paragraf, daftar, dan tabel, sehingga DOCX ke TXT bisa menyusun ulang nomor daftar dan menjaga baris tabel tetap utuh. PDF hanya tahu di mana setiap karakter dilukis, sehingga PDF ke Teks menyimpulkan baris dan paragraf dari posisinya — hasilnya bagus, tetapi tidak pernah sesetia struktur aslinya. Jika Anda punya dokumen asli sekaligus PDF-nya, ekstrak dari dokumennya.
DOCX ke TXT vs menyimpan sebagai .txt dari Word. Ekspor teks biasa bawaan Word membuang penomoran daftar, merusak tabel, dan punya pendapat sendiri soal encoding. DOCX ke TXT menyusun ulang penomoran, menulis tabel sebagai baris yang dipisahkan tab yang bisa ditempel ke spreadsheet atau sebagai kolom rata yang tetap rata bahkan dalam bahasa Tionghoa dan Jepang, dan menyimpan UTF-8 dengan akhir baris sesuai pilihan Anda.