Chuyển đến nội dung

Đếm số từ

Số từ, số câu, số đoạn văn và thời gian cần để đọc — cập nhật ngay khi bạn gõ. Chính xác với cả những ngôn ngữ không có dấu cách giữa các từ, điều mà hầu hết công cụ đếm đều làm sai. Không lưu trữ gì cả.

  • Không bao giờ lưu trữ
  • Không xếp hàng, không phải chờ
  • Không cần đăng ký, không watermark

0

Từ

mọi ngôn ngữ

0

Ký tự

emoji tính là một

0

Câu

xử lý cả chữ viết tắt

0

Đoạn văn

tách theo dòng trống

Mọi số đếm, và nơi dùng đến chúng
DòngNhư trình soạn thảo đánh số
0
CâuKhông bị ngắt bởi “TS.” hay “v.v.”
0
Đoạn vănCác khối cách nhau bởi một dòng trống
0
Code pointNhững gì dấu “.” trong biểu thức chính quy khớp được
0
Đơn vị UTF-16Giá trị string.length trả về trong JavaScript
0
Byte UTF-8Thứ mà giới hạn VARCHAR và HTTP header đo
0
Thời gian đọcĐọc thầm, 238 từ mỗi phút
—
Thời gian nóiĐọc to, 150 từ mỗi phút
—
Từ dài nhấtTính theo ký tự, không theo byte
—
Độ dài từ trung bìnhChỉ báo sơ bộ về độ dễ đọc
—

Bắt đầu gõ là mọi số liệu hiện ra. Thử một emoji, hoặc một câu tiếng Trung — cả hai đều được đếm theo cách con người đếm, điều mà hầu hết công cụ đếm đều làm sai.

Cách hoạt động

1

Dán hoặc gõ

Hoặc thả một file văn bản vào. Số đếm cập nhật ngay khi bạn gõ; không gửi gì đi đâu cả.

2

Xem các con số

Số từ, câu, đoạn văn, dòng và ký tự, cùng thời gian đọc và thời gian nói.

3

Kiểm tra giới hạn

Nếu bạn đang viết theo giới hạn — tiêu đề SEO, meta description, tin nhắn SMS — trang sẽ cho thấy bạn còn cách giới hạn bao xa.

Cái gì được đếm, và ai thực hiện việc đếm

Số từ không phải do chúng tôi tự đếm. Từ được lấy từ bộ phân đoạn Unicode có sẵn của trình duyệt, dùng ngôn ngữ mặc định chứ không chỉ định một ngôn ngữ cụ thể, và trang giữ lại những phần mà nó đánh dấu là giống từ. Không có quy tắc nào được thêm vào cho dấu gạch nối, dấu nháy đơn hay chữ số — thứ bạn nhận được là đánh giá của bộ phân đoạn về chỗ từ bắt đầu, đó là lý do kết quả đúng với tiếng Trung và tiếng Nhật, và cũng là lý do hai trình duyệt trên hai máy có thể chênh nhau rất nhỏ với cùng một văn bản. Trên trình duyệt quá cũ không có bộ phân đoạn, trang sẽ chuyển sang tách theo khoảng trắng và cho bạn biết con số chỉ là ước tính — cũng chính là con số mà các công cụ đếm đơn giản hơn luôn đưa ra mà không hề nói rõ.

Đoạn văn và dòng được đếm theo quy tắc riêng của chúng tôi, và đó là hai quy tắc khác nhau. Ranh giới đoạn văn là một dòng trống — hai lần xuống dòng mà giữa chúng chỉ có dấu cách hoặc tab — nên một file văn bản Windows thả vào mà vẫn giữ nguyên ký tự carriage return sẽ được đếm là một đoạn văn duy nhất; văn bản dán vào ô nhập không bao giờ gặp vấn đề này, vì ô nhập văn bản chuyển thành ký tự line feed. Dòng được đếm theo cách lề số dòng của trình soạn thảo đếm: ô trống là không dòng, một từ là một dòng, và file kết thúc bằng ký tự xuống dòng có một dòng cuối trống cũng được tính. Điều này cố ý khác với lệnh wc trên dòng lệnh, vốn báo số ký tự kết thúc dòng.

Hai quyết định nhỏ hơn giải quyết hầu hết tranh cãi về các con số. Số ký tự không tính dấu cách bỏ đi mọi thứ trình duyệt coi là khoảng trắng, bao gồm cả dấu cách không ngắt dòng đi kèm văn bản sao chép từ trang web — nhưng không bỏ dấu cách độ rộng bằng không, vì đó không phải khoảng trắng và vẫn được tính. Còn từ dài nhất và độ dài từ trung bình được đo bằng code point chứ không phải bằng cụm grapheme mà con số ký tự chính sử dụng, nên một từ chứa emoji hoặc dấu kết hợp sẽ được đo dài hơn vẻ ngoài của nó ở đây. Bảng tần suất ẩn khoảng sáu mươi từ chức năng tiếng Anh phổ biến trừ khi bạn yêu cầu hiện chúng, và gộp chữ hoa chữ thường theo quy tắc tiếng Anh đơn giản bất kể bạn đang viết bằng ngôn ngữ nào.

Khi bạn cần công cụ khác

Khi một chương trình cụ thể sẽ là thước đo, chỉ con số của chương trình đó mới có giá trị. Một tạp chí yêu cầu tám nghìn từ kể cả tài liệu tham khảo là muốn nói đến con số Word đưa ra, và Word đếm trường, chú thích cuối trang, chú thích hình và hộp văn bản theo cài đặt riêng của nó. Trang này sẽ cho kết quả sát với văn xuôi thông thường nhưng sẽ không khớp đến từng từ, nên hãy nộp bài theo công cụ đang chấm bạn chứ không phải theo công cụ này.

Với nhiều hơn một tài liệu, việc đếm chỉ là một dòng lệnh. wc -w xử lý cả một thư mục cùng lúc và đọc dạng luồng các file lớn hơn bộ nhớ của bạn; với Markdown, HTML hay LaTeX, chuyển file qua pandoc thành văn bản thuần trước sẽ loại bỏ phần đánh dấu, để khối code, đích liên kết và thẻ không bị tính là văn xuôi — đó là khoảng cách giữa số từ của cả kho mã nguồn và số từ thực sự. Cả hai đều là việc mà một ô dán văn bản không thể làm cho bốn trăm file.

Câu hỏi thường gặp

Văn bản của tôi có bị lưu trữ ở đâu không?

Không. Không lưu trữ gì cả và không gửi yêu cầu nào đi, và công cụ vẫn hoạt động khi đã ngắt mạng. Với văn bản, điều này quan trọng hơn bạn tưởng: thứ người ta dán vào công cụ đếm trực tuyến là bài viết chưa đăng, bản thảo pháp lý, bài làm của học sinh, sinh viên và tài liệu nội bộ.

Công cụ có dùng được cho tiếng Trung, tiếng Nhật hay tiếng Thái không?

Có, và đây là điều chính khiến nó khác biệt với hầu hết công cụ đếm khác. Những ngôn ngữ đó không đặt dấu cách giữa các từ, nên cách làm thông thường — tách theo khoảng trắng — sẽ báo cả một bài viết tiếng Trung là một từ. Công cụ này dùng tính năng phân đoạn từ Unicode của trình duyệt (thuật toán UAX #29), vốn biết từ thực sự bắt đầu và kết thúc ở đâu trong mọi hệ chữ viết. Hãy dán văn bản tiếng Trung vào trang này và một công cụ đếm khác cạnh nhau; bạn sẽ thấy khác biệt ngay.

Thời gian đọc được tính như thế nào?

Lấy số từ chia cho 238 từ mỗi phút khi đọc thầm, và 150 từ mỗi phút khi đọc to. Con số 238 đến từ phân tích tổng hợp năm 2019 của Brysbaert trên 190 nghiên cứu về tốc độ đọc thầm của người lớn, chứ không phải con số tròn 200 hay 250 được chép qua lại giữa các bài blog. Đó là mức trung bình với văn xuôi thông thường — văn bản kỹ thuật dày đặc đọc chậm hơn, còn chủ đề quen thuộc đọc nhanh hơn.

Thế nào được tính là một câu?

Một câu kết thúc ở dấu chấm, dấu chấm hỏi hoặc dấu chấm than — nhưng không phải sau danh xưng hay chữ viết tắt. “We met Dr. Smith on Monday.” là một câu chứ không phải hai, điều mà tính năng phân đoạn của chính trình duyệt làm sai và trang này sửa lại. “Bring pens, paper, etc. and we will start” cũng là một câu; nhưng cùng cụm đó mà theo sau là một chữ viết hoa thì là hai câu.

Thế nào được tính là một đoạn văn?

Một khối văn bản cách nhau bởi một dòng trống. Nếu coi mỗi lần xuống dòng là một đoạn văn thì mỗi dòng của một địa chỉ sẽ thành một đoạn, đó là lý do số liệu ở đây khác một số công cụ khác.

Công cụ có đếm được số từ trong tài liệu Word hay PDF không?

Không trực tiếp — hãy dán văn bản vào, hoặc dùng công cụ Chuyển PDF sang văn bản của chúng tôi trước rồi dán kết quả. Trang này làm việc với văn bản, đó là điều giúp nó tức thì và riêng tư.

Vì sao số từ của tôi khác với Microsoft Word?

Thường là do dấu gạch nối và con số. Word đếm “well-known” là một từ và chúng tôi cũng vậy; một số công cụ đếm thành hai. Con số, ngày tháng và ký hiệu đứng riêng được tính là từ ở đây khi chúng chứa chữ số hoặc chữ cái. Với văn xuôi thông thường, hai bên cho kết quả rất sát nhau; với một danh sách mã linh kiện thì không.

Nên biết: Thời gian đọc và thời gian nói là mức trung bình với văn xuôi thông thường — văn bản kỹ thuật dày đặc đọc chậm hơn còn chủ đề quen thuộc đọc nhanh hơn, nên hãy xem đó là con số tham khảo, không phải cam kết. Việc đếm dựa vào tính năng phân đoạn Unicode của trình duyệt; trình duyệt quá cũ không có tính năng này sẽ chuyển sang ước tính và ghi rõ trên trang.

Đặt công cụ này lên website của bạn

Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.