Tạo robots.txt miễn phí: cho phép, chặn và bot AI | We.Inc
Tạo robots.txt miễn phí: cho phép hoặc chặn trình thu thập dữ liệu, chặn thư mục, thêm sitemap và chọn bot AI như GPTBot có thể đọc website hay không.
Tạo tệp robots.txt chuẩn chỉ trong một phút: chọn quy tắc mặc định cho mọi trình thu thập, liệt kê thư mục cần chặn, thêm sitemap và quyết định bot AI có thể đọc nội dung hay không. Sao chép kết quả hoặc tải thành tệp.
Chọn quy tắc mặc định cho mọi bot: cho phép tất cả (hầu hết website) hoặc chặn tất cả (website thử nghiệm).
Thêm các thư mục cần chặn bot, mỗi thư mục một dòng, chẳng hạn /admin/ hoặc /cart/.
Dán địa chỉ sitemap để công cụ tìm kiếm tìm thấy mọi trang.
Có thể chặn bot huấn luyện AI. Sau đó sao chép hoặc tải robots.txt rồi đưa lên thư mục gốc tên miền.
robots.txt phải nằm chính xác tại yourdomain.com/robots.txt. Vị trí khác sẽ bị bỏ qua.
Chặn trang trong robots.txt không xóa trang khỏi Google. Muốn ẩn trang khỏi kết quả, hãy dùng thẻ noindex và vẫn cho phép thu thập dữ liệu.
Đừng bao giờ chặn thư mục CSS hoặc JavaScript; Google cần chúng để xem trang chính xác.
Sau khi tải lên, mở tệp bằng trình duyệt để kiểm tra phiên bản đang hoạt động.
Câu hỏi thường gặp
robots.txt có tác dụng gì?
Tệp này thông báo cho các bot tuân thủ quy tắc những phần nào trên website chúng được phép yêu cầu. Đây chỉ là đề nghị, không phải khóa bảo vệ: tệp không bảo vệ nội dung riêng tư và bot xấu có thể bỏ qua.
Tôi có cần tệp robots.txt không?
Không bắt buộc. Nếu không có, bot giả định chúng được thu thập mọi nội dung. Tệp vẫn hữu ích để trỏ đến sitemap và chặn bot khỏi giỏ hàng hoặc màn hình quản trị.
Tôi có nên chặn bot AI không?
Đây là lựa chọn kinh doanh. Chặn GPTBot, ClaudeBot, Google-Extended và các bot tương tự sẽ yêu cầu chúng không dùng nội dung để huấn luyện, nhưng trợ lý AI cũng có thể biết ít hơn về doanh nghiệp. Nhiều doanh nghiệp nhỏ cho phép bot để trợ lý AI có thể đề xuất họ.
Thay đổi có hiệu lực sau bao lâu?
Google thường đọc lại robots.txt trong vòng một ngày. Bạn có thể yêu cầu làm mới trong báo cáo robots.txt ở Google Search Console.
Làm sao kiểm tra xem URL có bị robots.txt chặn không?
Dùng công cụ kiểm tra trên trang này. Dán robots.txt của bạn (hoặc dùng tệp vừa tạo), nhập địa chỉ và tên bot, chẳng hạn Googlebot, và công cụ sẽ hiển thị Được phép hoặc Bị chặn cùng quy tắc quyết định. Công cụ áp dụng quy tắc khớp của Google trong trình duyệt và không tải tệp trực tiếp, vì vậy hãy dán phiên bản hiện tại từ yourdomain.com/robots.txt.
Nếu cả quy tắc Allow và Disallow đều khớp, quy tắc nào thắng?
Với Google, quy tắc có đường dẫn dài hơn thắng vì nó cụ thể hơn. Nếu cả hai đường dẫn có cùng độ dài, Allow thắng. Các bot khác có thể xử lý xung đột khác nhau, vì vậy tránh dựa vào trường hợp hòa.
Cách đọc quy tắc robots.txt
Tệp robots.txt là danh sách các nhóm. Mỗi nhóm bắt đầu bằng một hay nhiều dòng User-agent nêu bot (hoặc * để áp dụng cho mọi bot), rồi đến dòng Allow và Disallow chứa đường dẫn URL. Bot dùng nhóm cụ thể nhất gọi tên nó; trong một nhóm, đường dẫn khớp dài nhất được ưu tiên.
'Disallow: /' chặn tất cả. 'Disallow:' để trống cho phép tất cả. 'Disallow: /admin/' chặn mọi địa chỉ bắt đầu bằng /admin/. Đường dẫn phân biệt chữ hoa chữ thường.
Thiết lập mặc định hợp lý cho website doanh nghiệp nhỏ
Cho phép tất cả, chặn thư mục quản trị, giỏ hàng, thanh toán hoặc tài khoản mà nền tảng của bạn dùng, rồi liệt kê sitemap. Hầu hết website chỉ cần vậy. Đừng dùng robots.txt để ẩn trang cảm ơn hoặc trang trùng lặp khỏi Google; hãy dùng noindex đúng cách.
Website xuất bản bằng We.Inc đã tự động cung cấp robots.txt và sitemap, nên chỉ cần công cụ này cho website lưu trữ ở nơi khác.
Kiểm tra URL trước khi tải lên
Một lỗi nhỏ trong robots.txt có thể chặn cả một phần website, vì vậy hãy kiểm tra các địa chỉ quan trọng trước khi tải lên: trang chủ, trang sản phẩm hoặc dịch vụ, bài viết blog và bất kỳ trang nào bạn muốn chặn. Nhập từng trang vào công cụ kiểm tra với bot bạn quan tâm, thường là Googlebot, và kiểm tra kết quả cùng quy tắc quyết định có đúng như mong đợi không.
Ký tự đại diện thường gây bất ngờ nhất. 'Disallow: /*?sort=' chặn mọi địa chỉ chứa ?sort=, còn 'Disallow: /*.pdf$' chặn địa chỉ kết thúc bằng .pdf nhưng không chặn /file.pdf?download=1. Cũng lưu ý rằng bot được nêu tên trong nhóm riêng, như Googlebot-Image, bỏ qua nhóm * hoàn toàn, vì vậy quy tắc bạn viết cho mọi người không áp dụng cho bot đó.