ChatGPT-User, AI crawler (bot thu thập nội dung theo yêu cầu người dùng thực) của OpenAI, đã vào được các trang bị chặn trên gần nửa số website châu Âu trong nửa đầu năm 2026, theo báo cáo State of the Bots của TollBit. OpenAI lý giải: vì yêu cầu xuất phát từ người dùng thực chứ không phải crawler tự động, robots.txt (file chuẩn mà webmaster dùng để chỉ dẫn bot tự động không được vào trang nào) có thể không áp dụng ở đây. Dưới đây là những gì số liệu thực sự cho thấy.
Dữ liệu TollBit H1/2026 cho thấy gì?
Trong dataset các website châu Âu, khoảng 15% AI fetch agent được nhận dạng đã vào được URL mà các site đánh dấu là disallowed (không cho phép), theo báo cáo TollBit H1/2026.
Phần lớn sự cố này tập trung ở vài bot nhất định. ChatGPT-User, Bytespider và Youbot mỗi loại đã vào được trang bị chặn trên gần nửa số website châu Âu có tên chúng trong danh sách chặn. Trong ba bot đó, ChatGPT-User tiếp cận được nhiều site nhất.
Các agent mới hơn cho bức tranh khác hẳn. Chỉ 9% website châu Âu chặn Claude-User, so với 26% ở Bắc Mỹ. Perplexity-User ở mức 13% tại châu Âu so với 26% tại Bắc Mỹ. Hầu hết agent thế hệ mới nhất có tỷ lệ bị chặn chỉ một chữ số khắp châu Âu.
ChatGPT-User là ngoại lệ rõ ràng: vừa là AI fetch agent bị nhiều site chặn nhất so với các bot cùng loại, vừa là bot đã vào được nhiều site bị chặn nhất. Nhiều site cố ngăn nó hơn bất kỳ bot tương đương nào, nhưng nó cũng vượt qua được nhiều hơn bất kỳ bot nào.
Tại sao OpenAI nói robots.txt có thể không áp dụng với AI crawler?
Tài liệu bot của OpenAI trên developers.openai.com giải thích: ChatGPT-User chỉ truy cập một trang khi người dùng ChatGPT đặt câu hỏi cần fetch trang đó về. Vì hành động xuất phát từ người dùng thực chứ không phải từ crawler chạy tự động, OpenAI cho rằng quy tắc robots.txt có thể không áp dụng với các yêu cầu này.
Perplexity có lập trường tương tự: Perplexity-User nhìn chung bỏ qua robots.txt với cùng lý do “người dùng khởi tạo”, theo Search Engine Journal. Anthropic đứng ở phía đối lập, khẳng định cả ba bot của mình đều tuân thủ robots.txt.
TollBit không phân biệt lý do biện hộ. Trong phương pháp đo của TollBit, bất kỳ yêu cầu nào đến URL bị chặn đều được tính là bypass (vượt qua lệnh chặn), bất kể bên vận hành bot đưa ra lập luận gì.
Chặn ChatGPT-User có làm site bạn mất hiển thị trong ChatGPT không?
Theo tài liệu chính thức của OpenAI, khả năng cao là không. Bot quyết định website có xuất hiện trong kết quả ChatGPT Search hay không là OAI-SearchBot, không phải ChatGPT-User. Hai bot này phục vụ mục đích khác nhau và cài đặt robots.txt của chúng hoàn toàn độc lập với nhau.
Theo developers.openai.com, một website có thể cho phép OAI-SearchBot (để duy trì hiển thị trong ChatGPT Search) trong khi vẫn chặn GPTBot (crawler huấn luyện của OpenAI, thu thập nội dung để cải thiện mô hình nền) cùng lúc. Hai cài đặt này không ảnh hưởng lẫn nhau.
Trong thực tế, site nào chỉ chặn ChatGPT-User để ngăn traffic AI có thể đã thực hiện một đánh đổi không có chủ ý: hạn chế một đường fetch nội dung trong khi ChatGPT Search indexing vẫn nguyên vẹn, hoặc mất hiển thị tìm kiếm hoàn toàn nếu cả hai bot bị chặn cùng nhau mà không tính toán trước.
Server log hoặc CDN (content delivery network, lớp hạ tầng định tuyến lưu lượng web) ghi lại những gì thực sự đến. Robots.txt chỉ ghi lại những gì bạn yêu cầu.
Cloudflare đang thay đổi gì và từ khi nào?
Cloudflare thông báo cập nhật cách phân loại và quản lý crawler, chuyển kiểm soát xuống network layer (tầng mạng) thay vì dựa vào từng bot tự nguyện tuân thủ. Với các bot Cloudflare nhận dạng được, tuân thủ không còn phụ thuộc vào thiện chí của chính crawler nữa.
Từ ngày 15/9/2026, tên miền mới thêm vào Cloudflare sẽ có Training crawler và Agent crawler bị chặn mặc định trên các trang có quảng cáo. Search crawler vẫn được phép mặc định.
Cloudflare phân loại hành vi bot thành ba nhóm, theo blog chính thức của họ:
- Search: bot chủ động thu thập và index nội dung để trả lời truy vấn trong tương lai. Chủ site nên kỳ vọng nhận lại referral traffic (lưu lượng giới thiệu) hoặc giá trị tương đương.
- Agent: tự động hóa hoạt động theo thời gian thực thay mặt người dùng, bao gồm fetch bot như ChatGPT-User và browser-use agent (agent điều khiển trình duyệt thực) như Gemini hay Claude đang chạy phiên duyệt web trực tiếp.
- Training: crawler thu thập nội dung để huấn luyện hoặc fine-tune (tinh chỉnh) mô hình AI, đưa nội dung vào kiến trúc mô hình vĩnh viễn.
Cloudflare lưu ý nhiều crawler thuộc nhiều hơn một nhóm cùng lúc. Phân loại theo mục đích giúp chủ site hiểu rõ hơn lý do một bot cụ thể đang truy cập site của mình.
Góc nhìn Hingewise: không phải chặn hay không, mà là chặn để đạt mục tiêu gì
Nhiều site đang chặn nhầm bot mà không nhận ra điều đó.
Hình dung thế này: bạn khóa cửa hông để không cho người lạ vào, nhưng cửa trước mới là thứ quyết định địa chỉ nhà bạn có xuất hiện trên bản đồ hay không. Khóa cửa hông không xóa bạn khỏi bản đồ. Nó chỉ kiểm soát một lối vào, và ngay cả sự kiểm soát đó cũng đang bị đặt dấu hỏi.
Có ba điểm đáng chú ý từ dữ liệu này mà phần lớn bình luận về chủ đề bỏ qua:
Robots.txt được thiết kế cho một thế giới chỉ có một loại khách tự động: crawler xây dựng index tìm kiếm. Thế giới đó không còn tồn tại nữa. Một AI assistant hiện gửi ít nhất ba loại bot với ba mục đích khác nhau và ba quan hệ khác nhau với robots.txt. Gộp chung vào một nhóm là phòng thủ sai hướng.
“Lỗ hổng người dùng khởi tạo” không phải chi tiết kỹ thuật nhỏ. Nếu các AI assistant lớn đang fetch nội dung theo thời gian thực thay mặt người dùng thực, và xu hướng ngày càng đi theo chiều đó, thì robots.txt về cơ bản chỉ còn là lời đề nghị cho những yêu cầu này. Động thái của Cloudflare, chuyển kiểm soát xuống tầng mạng, là thừa nhận trực tiếp khoảng trống đó: khi tuân thủ phụ thuộc vào thiện chí của bot, đó không phải kiểm soát thực sự.
Điểm mà phần lớn bài viết về chủ đề này bỏ qua: sự phân biệt giữa ChatGPT-User và OAI-SearchBot thay đổi hoàn toàn cách tính cho thương hiệu muốn quản lý hiển thị trên AI. Site muốn xuất hiện trong câu trả lời ChatGPT cần OAI-SearchBot index mình. Chặn ChatGPT-User một mình không ảnh hưởng đến điều đó. Site muốn giữ nội dung khỏi câu trả lời ChatGPT trực tiếp lại đối mặt với bài toán khó hơn, vì lý lẽ “người dùng khởi tạo” có nghĩa ngay cả lệnh chặn được cấu hình đúng cũng có thể không giữ được.
Nhận định của Hingewise: câu hỏi hữu ích hơn không phải là “có nên chặn bot này không”, mà là “bot nào kiểm soát kết quả hiển thị nào”. Nhầm lẫn ở đây có nghĩa là bỏ công sức vào các kiểm soát không khớp với mục tiêu. Framework ba nhóm của Cloudflare (Search / Agent / Training) là điểm xuất phát tốt để bắt đầu phân tích điều đó.
Cần kiểm tra gì trước khi điều chỉnh robots.txt cho AI bot
- Xác định mục tiêu cụ thể: Bạn muốn ngăn nội dung bị dùng để huấn luyện mô hình, hay ngăn nội dung xuất hiện trong câu trả lời AI trực tiếp, hay cả hai? Mỗi mục tiêu cần chặn bot khác nhau.
- Xem server log hoặc CDN: Biết AI bot nào thực sự đang đến, không chỉ dựa vào những gì bạn đã liệt kê trong robots.txt.
- Phân biệt ba loại bot OpenAI: GPTBot (huấn luyện mô hình), OAI-SearchBot (hiển thị trong ChatGPT Search), ChatGPT-User (fetch theo yêu cầu người dùng thực). Mỗi cái kiểm soát một kết quả khác nhau.
- Nếu muốn duy trì hiển thị trong ChatGPT Search: không chặn OAI-SearchBot.
- Theo dõi ngày 15/9/2026: Từ ngày này, Cloudflare sẽ tự động chặn Training và Agent crawler trên domain mới có quảng cáo.
- Đối chiếu danh sách bot đang chặn với ba nhóm của Cloudflare (Search / Agent / Training): đảm bảo kiểm soát đúng đối tượng theo đúng mục tiêu.
Dữ liệu TollBit cho H2/2026 và phản ứng của các nền tảng AI lớn với framework mới của Cloudflare sẽ cho thấy liệu kiểm soát ở tầng mạng có thực sự thu hẹp khoảng cách giữa “yêu cầu chặn” và “thực sự bị chặn” hay không.
Nguồn: Search Engine Journal · OpenAI Developer Docs · Cloudflare Blog · TollBit State of the Bots H1/2026
