Tài liệu chứa những gì, và mỗi lần chuyển đổi xử lý chúng ra sao
File .docx là một file ZIP chứa các file XML, và phần lớn những gì làm nên một tài liệu không phải là chữ. Có style — các định nghĩa được đặt tên như Heading 1 mà nhiều đoạn văn dùng chung — và có định dạng trực tiếp, khi ai đó bôi đen một dòng rồi nhấn in đậm. Chúng trông giống hệt nhau nhưng hoạt động hoàn toàn khác nhau khi chuyển đổi: style vẫn giữ là style, còn đoạn định dạng trực tiếp chỉ còn lại định dạng mà nó tạo ra. Bên cạnh đó còn có định nghĩa đánh số, theo dõi thay đổi, bình luận, chú thích cuối trang, đầu trang và chân trang, hộp văn bản, phông chữ nhúng và thuộc tính tài liệu, mỗi thứ được lưu tách riêng với chữ của đoạn văn.
Số thứ tự danh sách là ví dụ rõ nhất. Word không lưu “1.” dưới dạng chữ; nó lưu một tham chiếu tới định nghĩa đánh số và tính ra con số khi vẽ trang. Vì vậy các công cụ trích xuất văn bản chỉ đọc XML của đoạn văn sẽ bỏ mất mọi con số và trả về cho bạn một danh sách không đánh số. Chuyển DOCX sang TXT thì dựng lại chúng — “1.”, “1.1”, “a)”, “iii.” — kể cả những danh sách bắt đầu lại hoặc tiếp tục xuyên suốt tài liệu.
Theo dõi thay đổi và bình luận là một lựa chọn có chủ ý, không phải ngẫu nhiên. Một tài liệu đang được duyệt chứa cả phần chữ bị xóa lẫn phần chữ được chèn, trong cùng một file, có đánh dấu. Chuyển DOCX sang TXT đọc nó như thể mọi thay đổi đã được chấp nhận: giữ phần chèn, bỏ phần xóa. Bình luận hoàn toàn không được đưa vào, thường là điều bạn muốn khi văn bản thuần sẽ được công khai. Chú thích cuối trang và cuối tài liệu xuất hiện dưới dạng dấu [1] với nội dung chú thích gom ở cuối, đầu trang và chân trang có thể bật lên, và hộp văn bản xuất hiện đúng một lần theo thứ tự đọc thay vì bị lặp lại hoặc bị mất.
Điều mà chuyển sang PDF cố định lại là việc phân trang. Trong trình soạn thảo văn bản, trang bốn kết thúc ở đâu được tính lại mỗi lần mở file, dựa trên phông chữ và trình điều khiển máy in của người mở — đó là lý do tài liệu đến tay người nhận với cái bảng bị chia đôi qua hai trang trong khi ở máy bạn thì không. PDF không có việc tính lại như vậy: ngắt trang đã được quyết định một lần, lúc chuyển đổi, và giờ là một phần cố định của file. Chuyển Word sang PDF, Chuyển ODT sang PDF và Chuyển RTF sang PDF lấy các ngắt trang đó từ một bộ dàn trang soạn thảo văn bản đầy đủ chứ không phải từ trình duyệt mô phỏng lại, vì thế hộp văn bản, hình vẽ, đầu trang và chân trang nằm đúng chỗ tác giả đặt.
Cái mất đi là khả năng chỉnh sửa và tự dàn lại dòng. Style trở thành định dạng hiển thị, dàn ý trở thành bookmark, và chữ không còn tự xuống dòng theo màn hình điện thoại. Phông chữ nhúng trong tài liệu được dùng nguyên như vậy; phông chữ không được nhúng và cũng không có sẵn trên bộ chuyển đổi sẽ được thay bằng phông chữ tương thích số đo gần nhất, nên các dòng vẫn ngắt đúng chỗ cũ dù hình dáng chữ khác đi.
Sách điện tử không có trang nào để giữ nguyên. EPUB, MOBI và AZW3 là định dạng tự dàn lại — ứng dụng đọc sách quyết định mỗi trang kết thúc ở đâu, theo cỡ chữ bạn chọn — nên “trang 40” không phải là thuộc tính của cuốn sách, và việc phân trang trong file PDF của bạn được tạo ra lúc chuyển đổi, từ khổ trang và lề bạn chọn. Những gì có trong file là cấu trúc chương và mục lục, và chúng trở thành liên kết và bookmark PDF thực sự. AZW3 có stylesheet và thường có phông chữ nhúng, nên ra đúng như nhà xuất bản thiết kế; file MOBI cũ hoàn toàn không có stylesheet, vì thế MOBI sau khi chuyển đổi trông đơn giản hơn cùng cuốn sách đó trong ứng dụng Kindle — chính ứng dụng đã thêm phần trình bày chữ mà file chưa bao giờ có.
RTF từ trong ra ngoài đều là văn bản, đó là lý do nó tồn tại qua hàng chục năm thay đổi phần mềm. Điểm vướng của nó là bảng mã ký tự: RTF ra đời trước Unicode và lưu chữ theo các bảng mã cũ — Trung Âu, Cyrillic, Hy Lạp, Nhật Bản — đó chính là nguồn gốc của lỗi font trong các file RTF chuyển đổi kém. Ở đây, mỗi bảng mã đều được giải mã đúng cách, cùng với văn bản Unicode hiện đại.
Khi trình duyệt thực sự không phải là công cụ phù hợp
Một số công cụ ở đây giữ file của bạn hoàn toàn riêng tư, một số khác chuyển file lên máy chủ, và cần nói chính xác công cụ nào làm gì. Chuyển PDF sang văn bản, Chuyển TXT sang PDF, Chuyển DOCX sang TXT, Chuyển HTML sang DOCX và Chuyển Markdown sang HTML không bao giờ gửi đi bất cứ thứ gì — file được đọc, chuyển đổi và ghi ra ngay tại đây, và không có gì rời đi. Chuyển Word sang PDF, Chuyển ODT sang PDF, Chuyển RTF sang PDF, Chuyển HTML sang PDF, Chuyển Markdown sang PDF và ba công cụ chuyển đổi sách điện tử thực hiện chuyển đổi trên máy chủ của chúng tôi, vì tái tạo bố cục trang của trình soạn thảo văn bản, hay phân trang một cuốn sách đúng cách, không phải là điều một trang web có thể giả lập. Những gì được gửi đi thì khác nhau: tài liệu Word, ODT và RTF được gửi nguyên trạng, còn file Markdown và sách điện tử được giải nén và ghép thành một trang web trước, và chính trang đã ghép đó được gửi đi. Dù theo cách nào, file cũng đi qua kết nối mã hóa, được chuyển đổi, và bị xóa ngay khi bản tải xuống của bạn sẵn sàng — không lưu trữ, không ghi log, không chia sẻ. Mỗi công cụ đó cũng có bộ chuyển đổi dự phòng riêng nếu không kết nối được máy chủ, và sẽ báo cho bạn khi dùng đến nó, cùng những gì bộ dự phòng không giữ được.
Những định dạng chúng tôi không mở. File .doc nhị phân kiểu cũ từ Word 97–2003 chuyển đổi tốt với Chuyển Word sang PDF, vì máy chủ đọc trực tiếp được chúng — nhưng Chuyển DOCX sang TXT chạy trên trình duyệt thì không, và cần file .docx. Tài liệu có mật khẩu cần được gỡ mật khẩu trong chính chương trình đã đặt nó. Sách Kindle có DRM không thể mở bằng bất kỳ bộ chuyển đổi nào ở bất cứ đâu — đó chính là mục đích của lớp bảo vệ — và định dạng KFX mới hơn của Amazon cũng vậy, chỉ ứng dụng Kindle đọc được.
Công việc với tài liệu dài. Tài liệu chủ (master document), trường tham chiếu chéo, chỉ mục, bảng trích dẫn tự động, trộn thư và trình quản lý trích dẫn là tính năng của trình soạn thảo văn bản, mà bộ chuyển đổi thì không phải trình soạn thảo văn bản. Hãy cài LibreOffice — nó miễn phí, đọc được mọi định dạng trên trang này, và với những việc này nó đơn giản là chương trình phù hợp.
Xử lý hàng loạt và tự động hóa. Các công cụ này chạy khi có người nhấn nút. Chuyển đổi một nghìn file theo lịch là việc của dòng lệnh, và các công cụ miễn phí rất xuất sắc: LibreOffice ở chế độ headless chuyển đổi mọi thứ Writer mở được, Pandoc chuyển qua lại giữa Markdown, HTML, DOCX, LaTeX và hàng chục định dạng khác với mức kiểm soát cao hơn bất kỳ biểu mẫu web nào, còn Calibre xử lý sách điện tử hàng loạt và chuyển đổi giữa mọi định dạng sách điện tử không bị khóa.
Giữ đúng bố cục theo chiều ngược lại. Biến một PDF thiết kế cầu kỳ trở lại thành tài liệu chỉnh sửa được là bài toán suy luận, không phải chuyển đổi, và không gì làm được hoàn hảo — không phải chúng tôi, cũng không phải các phần mềm máy tính đắt tiền. Nếu tài liệu gốc vẫn còn, hãy chỉnh sửa trên đó.
Chọn giữa các công cụ nghe có vẻ giống nhau
Chuyển Markdown sang PDF và Chuyển Markdown sang HTML. Cùng bộ phân tích, khác điểm đến. Chuyển Markdown sang PDF cho bạn một tài liệu có phân trang với kiểu chữ, khổ trang và lề do bạn chọn, tiêu đề thành bookmark PDF và mục lục nhảy đến đúng trang — để in, đính kèm hoặc lưu trữ. Chuyển Markdown sang HTML cho bạn một trang độc lập có định dạng hoặc một đoạn mã trần để dán vào CMS — để đăng tải. Nếu bạn muốn đưa Markdown vào Word, hãy qua Chuyển Markdown sang HTML rồi đến Chuyển HTML sang DOCX.
Chuyển Word sang PDF, Chuyển ODT sang PDF và Chuyển RTF sang PDF. Bên dưới là cùng một cách chuyển đổi; chúng chỉ khác ở loại file bạn đưa vào. Chuyển Word sang PDF cho file .docx. Chuyển ODT sang PDF cho mọi thứ từ LibreOffice, OpenOffice hoặc Google Docs “Tải xuống dưới dạng OpenDocument”. Chuyển RTF sang PDF cho WordPad, TextEdit và các thư từ, báo cáo mà hệ thống doanh nghiệp vẫn xuất ra. Chọn đúng trang khớp với đuôi file không quan trọng như bạn nghĩ — điều quan trọng là không công cụ nào trong số đó là Chuyển TXT sang PDF, vốn ngay từ đầu đã không có định dạng nào để giữ.
Chuyển TXT sang PDF và Chuyển Markdown sang PDF. Chuyển TXT sang PDF trình bày văn bản của bạn đúng là văn bản: một kiểu chữ, lề do bạn chọn, không diễn giải gì. Chuyển Markdown sang PDF đọc dấu # và * như chỉ dẫn và tạo ra tiêu đề, danh sách, bảng, code được tô màu và dàn ý bookmark. Đưa file Markdown vào Chuyển TXT sang PDF thì bạn sẽ nhận được một file PDF đầy dấu sao.
Chuyển EPUB, MOBI và AZW3 sang PDF. Cả ba đều nhận nhiều hơn những gì tên gọi cho thấy, nên công cụ nào cũng mở được file của bạn; các trang khác nhau vì bản thân các cuốn sách khác nhau. EPUB và AZW3 (KF8) có stylesheet và thường có phông chữ nhúng, nên ra trông có thiết kế. MOBI là định dạng cũ hơn với định dạng tối thiểu, và file PDF chuyển đổi từ nó cố ý được giữ đơn giản. Nếu một file Kindle chứa cả hai kiểu bố cục, kiểu mới hơn sẽ được dùng.
Chuyển HTML sang DOCX và Chuyển Markdown sang HTML. Chuyển HTML sang DOCX dàn trang mã HTML trước, nên CSS đã được áp dụng — phông chữ, cỡ chữ, màu sắc, khoảng cách, đường viền — được ghi vào tài liệu dưới dạng định dạng Word thực sự, với heading style của Word, danh sách thực sự và bảng thực sự thay vì các khung cố định vị trí. Chuyển Markdown sang HTML là công cụ tạo ra mã HTML đó ngay từ đầu. Không công cụ nào chạy JavaScript, không bao giờ.
Chuyển DOCX sang TXT và Chuyển PDF sang văn bản. Cả hai đều trả về văn bản thuần nhưng đọc những thứ rất khác nhau. File .docx vẫn biết đâu là đoạn văn, danh sách và bảng, nên Chuyển DOCX sang TXT có thể dựng lại số thứ tự danh sách và giữ các hàng của bảng liền nhau. PDF chỉ biết từng ký tự được vẽ ở đâu, nên Chuyển PDF sang văn bản suy ra dòng và đoạn từ vị trí — tốt, nhưng không bao giờ trung thực về cấu trúc bằng. Nếu bạn có cả tài liệu gốc lẫn bản PDF của nó, hãy trích xuất từ tài liệu gốc.
Chuyển DOCX sang TXT so với lưu thành .txt từ Word. Chức năng xuất văn bản thuần của chính Word bỏ mất số thứ tự danh sách, làm hỏng bảng và tự quyết định bảng mã theo ý nó. Chuyển DOCX sang TXT dựng lại số thứ tự, ghi bảng thành các hàng phân cách bằng tab để dán vào bảng tính hoặc thành các cột căn thẳng hàng — vẫn thẳng hàng ngay cả với tiếng Trung và tiếng Nhật — và lưu UTF-8 với kiểu xuống dòng bạn chọn.