CodeKitHub
Tiếng Việt
Công cụ Quản trị Web

Trình Tạo Robots.txt

Tạo một file robots.txt hợp lệ trong vài giây: bắt đầu từ một mẫu có sẵn (cho phép tất cả, chặn tất cả, hoặc chặn riêng crawler huấn luyện AI trong khi vẫn giữ lập chỉ mục của Google/Bing), thêm đường dẫn bị chặn và URL sitemap của riêng bạn, sau đó sao chép hoặc tải file xuống.

Download robots.txt

Công Cụ Này Là Gì?

robots.txt là một file văn bản thuần đặt ở thư mục gốc của trang web, cho crawler biết những phần nào của trang được phép hoặc không được phép truy cập. Các công cụ tìm kiếm như Google và Bing tuân thủ file này để lập chỉ mục; vào năm 2026 đây cũng là cách chuẩn để các trang web từ chối cho phép nội dung của mình được dùng huấn luyện mô hình AI, thông qua tên bot cụ thể như GPTBot, CCBot và Google-Extended.

Việc viết đúng cú pháp rất quan trọng — một đường dẫn Disallow sai có thể vô tình chặn công cụ tìm kiếm truy cập toàn bộ trang web, hoặc một quy tắc chặn AI đặt sai vị trí có thể không chặn được gì cả. Công cụ này tạo ra kết quả đúng cú pháp cho từng tình huống.

Tại Sao Nên Dùng?

  • Mẫu chặn AI crawler chuyên biệt bao gồm GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider và anthropic-ai — trong khi vẫn giữ nguyên quyền truy cập của công cụ tìm kiếm.
  • Đường dẫn disallow tùy chỉnh cho nội dung bạn muốn ẩn khỏi mọi crawler.
  • Trường URL sitemap — một bổ sung nhỏ giúp công cụ tìm kiếm khám phá trang của bạn nhanh hơn.
  • Cú pháp chính xác mọi lúc — không có rủi ro một lỗi gõ nhỏ chặn nhầm toàn bộ trang web.
  • Miễn phí, tức thì, tải file xuống trực tiếp hoặc sao chép văn bản.

Cách Sử Dụng

  1. Chọn một mẫu: cho phép tất cả, chặn tất cả, hoặc chỉ chặn AI crawler.
  2. Tùy chọn thêm đường dẫn bị chặn tùy chỉnh, mỗi dòng một đường dẫn (ví dụ /admin/).
  3. Tùy chọn thêm URL sitemap của bạn.
  4. Nhấn Copy hoặc Download, sau đó tải file lên thư mục gốc trang web của bạn dưới dạng /robots.txt.

Ví dụ

Đầu vào

Mẫu: Chặn AI crawler, giữ công cụ tìm kiếm. Sitemap: https://example.com/sitemap.xml

Đầu ra

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

...

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Mỗi AI crawler có quy tắc chặn riêng, trong khi quy tắc ký tự đại diện ở cuối vẫn giữ mở quyền truy cập của công cụ tìm kiếm thông thường.

Bạn có nên chặn crawler này không?

Không phải bot nào cũng phục vụ cùng một mục đích — chặn nhầm bot có thể cắt luồng truy cập tìm kiếm thay vì chỉ từ chối huấn luyện AI.

CrawlerChức năngNên chặn nếu…
Googlebot, BingbotLập chỉ mục trang web cho kết quả tìm kiếmKhông bao giờ — chặn những bot này khiến bạn biến mất hoàn toàn khỏi tìm kiếm Google/Bing.
GPTBot, ChatGPT-UserCrawler của OpenAI — GPTBot dùng để huấn luyện mô hình, ChatGPT-User lấy trang khi người dùng yêu cầu ChatGPT duyệtBạn không muốn nội dung được dùng huấn luyện AI, nhưng lưu ý ChatGPT-User duyệt một trang do người dùng dán liên kết là trường hợp khác mà một số trang chọn cho phép.
Google-ExtendedKiểm soát việc Google có dùng nội dung của bạn để huấn luyện Gemini/AI hay không — tách biệt với việc lập chỉ mục tìm kiếm của GooglebotBạn muốn giữ vị trí trên Google Search nhưng từ chối huấn luyện AI của Google — quy tắc này làm chính xác điều đó mà không ảnh hưởng thứ hạng.
CCBot, Bytespider, anthropic-ai, ClaudeBotCommon Crawl (nguồn cho nhiều bộ dữ liệu AI), ByteDance, crawler của AnthropicLý do tương tự GPTBot — chặn nếu bạn không muốn nội dung nằm trong bộ dữ liệu huấn luyện AI.

Câu Hỏi Thường Gặp

robots.txt có thực sự ngăn AI sử dụng nội dung của tôi không?

Nó hoạt động theo cơ chế tự giác — crawler của các công ty AI uy tín thực sự tuân thủ (đó là lý do GPTBot, CCBot v.v. tồn tại như các user-agent riêng biệt, được ghi rõ, để trang web có thể từ chối). Nó không ngăn được các crawler bỏ qua chuẩn này, và không có tác dụng với nội dung đã bị thu thập trước khi bạn thêm quy tắc chặn.

Chặn AI crawler có ảnh hưởng đến thứ hạng tìm kiếm Google/Bing không?

Không — mẫu chặn AI chỉ chặn riêng các bot AI được nêu tên và để lại quy tắc ký tự đại diện "Allow: /" cho mọi bot khác, nên Googlebot và Bingbot không bị ảnh hưởng.

Tôi đặt file robots.txt ở đâu?

Ở thư mục gốc của tên miền, để có thể truy cập đúng tại yourdomain.com/robots.txt — không đặt trong thư mục con. Hầu hết nhà cung cấp hosting và trình tạo trang web tĩnh đều có một thư mục public/root dành riêng cho việc này.

Dòng sitemap dùng để làm gì?

Nó chỉ crawler đến file sitemap.xml của bạn, liệt kê tất cả các trang có thể lập chỉ mục. Đây là tùy chọn nhưng thường được khuyến nghị — thêm một dòng có thể giúp trang mới được phát hiện nhanh hơn.

Tôi có thể kết hợp đường dẫn disallow tùy chỉnh với mẫu chặn AI không?

Có — mẫu chặn AI thêm các quy tắc chặn bot AI trước, sau đó áp dụng các đường dẫn disallow tùy chỉnh của bạn (nếu có) dưới quy tắc ký tự đại diện chung vẫn cho phép công cụ tìm kiếm truy cập.

Công Cụ Liên Quan