Công Cụ Này Là Gì?
robots.txt là một file văn bản thuần đặt ở thư mục gốc của trang web, cho crawler biết những phần nào của trang được phép hoặc không được phép truy cập. Các công cụ tìm kiếm như Google và Bing tuân thủ file này để lập chỉ mục; vào năm 2026 đây cũng là cách chuẩn để các trang web từ chối cho phép nội dung của mình được dùng huấn luyện mô hình AI, thông qua tên bot cụ thể như GPTBot, CCBot và Google-Extended.
Việc viết đúng cú pháp rất quan trọng — một đường dẫn Disallow sai có thể vô tình chặn công cụ tìm kiếm truy cập toàn bộ trang web, hoặc một quy tắc chặn AI đặt sai vị trí có thể không chặn được gì cả. Công cụ này tạo ra kết quả đúng cú pháp cho từng tình huống.
Tại Sao Nên Dùng?
- Mẫu chặn AI crawler chuyên biệt bao gồm GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider và anthropic-ai — trong khi vẫn giữ nguyên quyền truy cập của công cụ tìm kiếm.
- Đường dẫn disallow tùy chỉnh cho nội dung bạn muốn ẩn khỏi mọi crawler.
- Trường URL sitemap — một bổ sung nhỏ giúp công cụ tìm kiếm khám phá trang của bạn nhanh hơn.
- Cú pháp chính xác mọi lúc — không có rủi ro một lỗi gõ nhỏ chặn nhầm toàn bộ trang web.
- Miễn phí, tức thì, tải file xuống trực tiếp hoặc sao chép văn bản.
Cách Sử Dụng
- Chọn một mẫu: cho phép tất cả, chặn tất cả, hoặc chỉ chặn AI crawler.
- Tùy chọn thêm đường dẫn bị chặn tùy chỉnh, mỗi dòng một đường dẫn (ví dụ /admin/).
- Tùy chọn thêm URL sitemap của bạn.
- Nhấn Copy hoặc Download, sau đó tải file lên thư mục gốc trang web của bạn dưới dạng /robots.txt.
Ví dụ
Đầu vào
Mẫu: Chặn AI crawler, giữ công cụ tìm kiếm. Sitemap: https://example.com/sitemap.xmlĐầu ra
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlMỗi AI crawler có quy tắc chặn riêng, trong khi quy tắc ký tự đại diện ở cuối vẫn giữ mở quyền truy cập của công cụ tìm kiếm thông thường.
Bạn có nên chặn crawler này không?
Không phải bot nào cũng phục vụ cùng một mục đích — chặn nhầm bot có thể cắt luồng truy cập tìm kiếm thay vì chỉ từ chối huấn luyện AI.
| Crawler | Chức năng | Nên chặn nếu… |
|---|---|---|
| Googlebot, Bingbot | Lập chỉ mục trang web cho kết quả tìm kiếm | Không bao giờ — chặn những bot này khiến bạn biến mất hoàn toàn khỏi tìm kiếm Google/Bing. |
| GPTBot, ChatGPT-User | Crawler của OpenAI — GPTBot dùng để huấn luyện mô hình, ChatGPT-User lấy trang khi người dùng yêu cầu ChatGPT duyệt | Bạn không muốn nội dung được dùng huấn luyện AI, nhưng lưu ý ChatGPT-User duyệt một trang do người dùng dán liên kết là trường hợp khác mà một số trang chọn cho phép. |
| Google-Extended | Kiểm soát việc Google có dùng nội dung của bạn để huấn luyện Gemini/AI hay không — tách biệt với việc lập chỉ mục tìm kiếm của Googlebot | Bạn muốn giữ vị trí trên Google Search nhưng từ chối huấn luyện AI của Google — quy tắc này làm chính xác điều đó mà không ảnh hưởng thứ hạng. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (nguồn cho nhiều bộ dữ liệu AI), ByteDance, crawler của Anthropic | Lý do tương tự GPTBot — chặn nếu bạn không muốn nội dung nằm trong bộ dữ liệu huấn luyện AI. |
Câu Hỏi Thường Gặp
robots.txt có thực sự ngăn AI sử dụng nội dung của tôi không?
Nó hoạt động theo cơ chế tự giác — crawler của các công ty AI uy tín thực sự tuân thủ (đó là lý do GPTBot, CCBot v.v. tồn tại như các user-agent riêng biệt, được ghi rõ, để trang web có thể từ chối). Nó không ngăn được các crawler bỏ qua chuẩn này, và không có tác dụng với nội dung đã bị thu thập trước khi bạn thêm quy tắc chặn.
Chặn AI crawler có ảnh hưởng đến thứ hạng tìm kiếm Google/Bing không?
Không — mẫu chặn AI chỉ chặn riêng các bot AI được nêu tên và để lại quy tắc ký tự đại diện "Allow: /" cho mọi bot khác, nên Googlebot và Bingbot không bị ảnh hưởng.
Tôi đặt file robots.txt ở đâu?
Ở thư mục gốc của tên miền, để có thể truy cập đúng tại yourdomain.com/robots.txt — không đặt trong thư mục con. Hầu hết nhà cung cấp hosting và trình tạo trang web tĩnh đều có một thư mục public/root dành riêng cho việc này.
Dòng sitemap dùng để làm gì?
Nó chỉ crawler đến file sitemap.xml của bạn, liệt kê tất cả các trang có thể lập chỉ mục. Đây là tùy chọn nhưng thường được khuyến nghị — thêm một dòng có thể giúp trang mới được phát hiện nhanh hơn.
Tôi có thể kết hợp đường dẫn disallow tùy chỉnh với mẫu chặn AI không?
Có — mẫu chặn AI thêm các quy tắc chặn bot AI trước, sau đó áp dụng các đường dẫn disallow tùy chỉnh của bạn (nếu có) dưới quy tắc ký tự đại diện chung vẫn cho phép công cụ tìm kiếm truy cập.