Công Cụ Này Là Gì?
Công cụ so sánh PDF nhận vào hai phiên bản của một tài liệu — chẳng hạn một hợp đồng trước và sau khi chỉnh sửa, hoặc hai bản nháp của một báo cáo — rồi cho bạn thấy điểm khác biệt giữa chúng mà không cần bạn phải đọc song song từng dòng.
Công cụ này hoạt động bằng cách so sánh nội dung văn bản: nó dùng pdf.js để trích xuất văn bản từ mọi trang của mỗi file PDF (theo đặc tả PDF ISO 32000, mỗi trang lưu văn bản dưới dạng các đoạn có vị trí xác định, và pdf.js đọc lại chúng theo đúng thứ tự đọc), sau đó thực hiện so sánh khác biệt ở cấp độ từng từ giữa nội dung của các trang tương ứng. Nó cho bạn biết chính xác từ nào đã được thêm vào hoặc bị xóa đi.
Điều quan trọng là cần hiểu rõ công cụ này phát hiện được gì và không phát hiện được gì: đây là so sánh dựa trên nội dung văn bản, không phải so sánh hình ảnh theo từng pixel. Nó sẽ phát hiện đáng tin cậy các thay đổi về câu chữ, câu được thêm hoặc xóa, và đoạn văn được dàn lại. Nó sẽ không phát hiện các thay đổi thuần túy về hình ảnh hoặc bố cục — như đổi phông chữ, đổi màu, dịch chuyển hình ảnh, hoặc sắp xếp lại trang trong khi từ ngữ vẫn giữ nguyên. Nếu bạn cần xác nhận một tài liệu giống hệt tài liệu khác đến từng pixel, công cụ này không phù hợp; còn nếu bạn cần biết câu chữ có thay đổi hay không, đây chính là công cụ dành cho bạn.
Tại Sao Nên Dùng?
- Nhìn thấy thay đổi ngay lập tức — văn bản thêm mới và bị xóa được tô màu theo từng trang thay vì bạn phải tự dò mắt qua hai tài liệu.
- Tóm tắt số trang ngay từ đầu: file A có bao nhiêu trang, file B có bao nhiêu trang, và có bao nhiêu trang thực sự khác nhau.
- Xử lý được cả PDF có số trang khác nhau — những trang chỉ tồn tại ở một file sẽ được nêu rõ chứ không bị âm thầm bỏ qua.
- Được thiết kế chú trọng quyền riêng tư: hợp đồng, bản nháp và các tài liệu nhạy cảm khác không bao giờ rời khỏi thiết bị của bạn, vì cả việc trích xuất lẫn so sánh đều diễn ra ngay trong tab trình duyệt.
- Miễn phí, không giới hạn số trang ngoài khả năng xử lý của trình duyệt, và không cần tạo tài khoản.
Cách Sử Dụng
- Nhấp hoặc kéo thả file A (PDF gốc) vào ô thả đầu tiên.
- Nhấp hoặc kéo thả file B (PDF đã chỉnh sửa) vào ô thả thứ hai.
- Nhấn "Compare PDFs" và chờ trong khi văn bản của từng trang được trích xuất và so sánh.
- Đọc dòng tóm tắt để biết số trang của mỗi file và có bao nhiêu trang khác nhau.
- Cuộn qua kết quả của từng trang — phần tô sáng màu xanh lá là văn bản được thêm vào file B, phần gạch ngang màu đỏ là văn bản bị xóa khỏi file A, và các trang không có phần tô sáng nào là không thay đổi.
Ví dụ
Đầu vào
contract-v1.pdf (3 trang) và contract-v2.pdf (3 trang), trong đó trang thứ ba có một điều khoản được viết lạiĐầu ra
Tóm tắt: "File A: 3 trang, file B: 3 trang — 1 trang khác biệt", với trang 3 hiển thị điều khoản cũ bị gạch ngang màu đỏ và câu chữ mới được tô sáng màu xanh láTrang 1 và 2 hiển thị là giống hệt nhau, nên bạn có thể chuyển thẳng đến trang thực sự có thay đổi.
Khi nào nên dùng PDF Compare thay vì Text Diff
Cả hai công cụ đều thực hiện cùng một kiểu so sánh khác biệt ở cấp độ từ, nhưng chúng xuất phát từ đầu vào khác nhau. Hãy dùng PDF Compare khi bạn có sẵn hai file PDF thực sự — một hợp đồng, một hóa đơn, một báo cáo — và muốn công cụ tự mở cả hai file, trích xuất văn bản của từng trang, rồi tự động ghép các trang tương ứng với nhau.
Hãy dùng công cụ Text Diff đơn giản thay vào đó khi bạn đã có sẵn nội dung dưới dạng văn bản — ví dụ bạn đã sao chép dán một điều khoản từ PDF ra, hoặc bạn đang so sánh hai phiên bản của một file cấu hình, một đoạn script, hay một bản nháp email. Cách này nhanh hơn vì không cần phân tích PDF, và nó hoạt động với bất kỳ văn bản nào được dán vào, không chỉ giới hạn ở các trang PDF đã trích xuất.
Các trường hợp sử dụng phổ biến
- Kiểm tra xem thực sự có gì thay đổi giữa hai bản sửa đổi của một hợp đồng hoặc thỏa thuận pháp lý trước khi ký.
- Rà soát các chỉnh sửa giữa bản nháp và bản cuối cùng của một báo cáo, đề xuất hoặc bài báo học thuật.
- Xác nhận hóa đơn hoặc đơn đặt hàng có khớp với phiên bản trước đó sau khi nhà cung cấp gửi bản sửa đổi.
- Phát hiện những chỉnh sửa trái phép hoặc bất ngờ giữa tài liệu gốc và một bản sao mà người khác đã chỉnh sửa.
Câu Hỏi Thường Gặp
Công cụ này so sánh bố cục hình ảnh chính xác của các file PDF, hay chỉ so sánh văn bản?
Chỉ so sánh nội dung văn bản của mỗi trang. Nó trích xuất phần văn bản mà pdf.js có thể đọc được từ mỗi trang và so sánh khác biệt theo từng từ. Nó sẽ không phát hiện một thay đổi thuần túy về hình ảnh — như đổi phông chữ, đổi màu tiêu đề, dịch chuyển hình ảnh — nếu các từ ngữ bên dưới vẫn giống nhau. Nếu bạn cần so sánh hình ảnh ở mức độ pixel, việc đó đòi hỏi phải render cả hai file PDF thành hình ảnh rồi so sánh từng pixel, điều mà công cụ nhẹ chạy trên trình duyệt này không thực hiện.
Nếu hai file PDF có số trang khác nhau thì sao?
Các trang được so sánh theo vị trí tương ứng (trang 1 của A với trang 1 của B, và cứ thế). Nếu một file có nhiều trang hơn file kia, những trang dư ra sẽ được hiển thị là "chỉ có ở file A" hoặc "chỉ có ở file B" thay vì bị bỏ qua hoặc gây lỗi.
Công cụ có thể so sánh PDF được quét hoặc các trang chỉ chứa hình ảnh không?
Chỉ khi PDF có văn bản thực sự được nhúng bên trong — các trang được quét chỉ là hình ảnh, không có lớp văn bản bên dưới, nên pdf.js không có gì để trích xuất, và những trang đó sẽ hiển thị là trống. Hãy chạy OCR trước để thêm lớp văn bản nếu bạn cần so sánh theo cách này.
File PDF của tôi có bị tải lên đâu đó để so sánh không?
Không. Cả hai file đều được đọc, trích xuất văn bản và tính toán khác biệt hoàn toàn ngay trong trình duyệt của bạn bằng JavaScript. Không file nào được gửi đến máy chủ — không có gì để tải lên cả.
Tôi đã có sẵn văn bản của cả hai tài liệu — tôi có cần công cụ này không?
Không cần — nếu bạn đã trích xuất hoặc sao chép nội dung thành văn bản thuần túy, hãy dùng trực tiếp công cụ Text Diff, vì nó bỏ qua bước phân tích PDF và so sánh văn bản ngay lập tức. Hãy dùng PDF Compare khi bạn có sẵn hai file PDF và muốn công cụ tự động xử lý việc trích xuất từng trang giúp bạn.