Bộ bằng chứng mà nhiều agency dùng để bán llms.txt cho khách hàng – bot AI crawl (tự động tải về) file, Google index nó, một LLM (mô hình ngôn ngữ lớn) nhắc lại nội dung từ file, ChatGPT xác nhận nó có hiệu quả – đều áp dụng được cho một file text khai báo mèo văn phòng hư cấu, kèm chức danh công việc và chỉ số “PurrLevel.” Đây là phát hiện từ một thí nghiệm được ghi lại trên Search Engine Journal, và nó có hàm ý trực tiếp với bất kỳ thương hiệu nào đang chi ngân sách cho chiến thuật GEO (tối ưu hóa khả năng hiển thị trên công cụ AI).
cats.txt là gì và tại sao lại được “xác nhận”?
cats.txt là một tiêu chuẩn web trào phúng do một tác giả trên Search Engine Journal phát minh ra, sau nhiều tháng chứng kiến ngành đối xử với bốn sự kiện quan sát được như thể chúng là bằng chứng rằng llms.txt cải thiện hiệu suất tìm kiếm AI.
Để làm vấn đề trở nên không thể tranh cãi, tác giả nghĩ ra một thông số kỹ thuật trào lộng: yêu cầu các website chính thức khai báo mèo văn phòng của mình, gồm tên, giống, chức danh công việc, và chỉ số “PurrLevel” bắt buộc tính trên thang 10. File được đặt tại root domain (thư mục gốc của website), kèm một bài đăng LinkedIn giới thiệu đây là “tiêu chuẩn còn thiếu cho SEO và GEO,” rồi được kiểm tra theo đúng bốn bài mà ngành dùng để xác nhận llms.txt.
Nó vượt qua cả bốn.
Thí nghiệm còn phát triển ngoài dự kiến. Chuyên gia technical SEO Dave Smart thêm cats.txt vào website của mình, trở thành “người dùng sớm” của một tiêu chuẩn được tạo ra để là vô nghĩa. Sau đó, một người khác dựng catstxt.org, bản triển khai trông chuyên nghiệp hơn và có tổ chức hơn. Không ai trong số đó là do tác giả ban đầu lên kế hoạch.
Bốn bài kiểm tra: bằng chứng cho llms.txt có đủ thuyết phục không?
cats.txt vượt qua từng bài kiểm tra trong bốn “bằng chứng” mà ngành thường dùng để bảo vệ llms.txt. Search Engine Journal phân tích từng bài thực ra đang đo cái gì, so với điều mà người ủng hộ tuyên bố nó chứng minh.
- Bot AI đã crawl file. PerplexityBot, GPTBot, ClaudeBot, Googlebot và nhiều bot khác đều tải file cats.txt về. Tuy nhiên, bài viết chỉ ra rằng việc một crawler (chương trình tự động duyệt và tải trang web) tải một file không cho biết gì về việc nội dung có được đọc, được gán trọng số, được tin cậy, hay được xử lý hay không. Tải file là hành vi mặc định của mọi crawler. Bài viết diễn đạt thẳng thắn: “Người đưa thư chạm vào cổng nhà bạn không phải là sự chứng thực nội dung thùng rác của bạn.” catstxt.org còn xây dựng công cụ xem log trực tiếp để bất kỳ ai cũng có thể theo dõi các bot AI đang tận tụy crawl mô tả công việc của những con mèo hư cấu theo thời gian thực.
- Google đã index nó. Google index cats.txt, trong đó khẳng định một con mèo British Shorthair tên Pixel làm “GUI Purrfectionist” với PurrLevel 8. Bài viết lưu ý rằng Google đã index file văn bản thuần từ trước khi hầu hết những người ủng hộ llms.txt sở hữu smartphone. Việc index chỉ xác nhận URL tồn tại và có chứa từ ngữ. Đó không phải phán quyết về tính hữu ích hay độ chính xác.
- Một LLM trả về nội dung chỉ có trong file. Khi Dave Smart thêm cats.txt vào site của mình, AI Overviews của Google bắt đầu trích dẫn nó, tự tin mô tả con mèo tên Odd là “Render Cat,” giống Tuxedo với PurrLevel 5/7, “chạy theo con trỏ, vồ những pixel lạc, và cất chúng trên thảm kỹ thuật số.” Cơ chế ở đây rất bình thường: đây là RAG (retrieval-augmented generation, tức mô hình AI tìm kiếm web và đọc nội dung xếp hạng cao nhất trước khi trả lời). Mô hình đọc cats.txt như một trang web thông thường, không phải nguồn đặc biệt đáng tin. File xếp hạng vì được index theo bài kiểm tra trước. Đó là file hoạt động như một trang web, không phải như một tiêu chuẩn có thẩm quyền.
- ChatGPT xác nhận khi được hỏi. Khoảng hai tuần sau khi cats.txt ra mắt, hỏi ChatGPT liệu file này có giúp cải thiện thứ hạng tìm kiếm không, câu trả lời nhận được là: “Có, cats.txt có thể giúp bạn xếp hạng trong cả công cụ tìm kiếm lẫn các hệ thống do LLM dẫn dắt.” Mô hình còn giải thích về “tín hiệu có cấu trúc cho máy móc,” “hiểu tốt hơn dẫn đến hiển thị tốt hơn,” và cách AI có thể “tin tưởng, tóm tắt, và trích dẫn nội dung của bạn chính xác hơn.” Đó chính xác là luận điểm thường được dùng để bán llms.txt, được đưa ra cho một file mô tả sở thích được vuốt ve của những con mèo hư cấu.
“Vấn đề hội tụ” là gì và tại sao marketer cần quan tâm?
“Vấn đề hội tụ” (convergence problem) là tên bài viết trên Search Engine Journal dùng để giải thích cơ chế đứng sau cả bốn bài kiểm tra cùng lúc.
Khi bạn hỏi một mô hình ngôn ngữ liệu một chiến thuật có hiệu quả không, mô hình không suy luận, không chạy thử nghiệm, không cân nhắc nguồn. Nó trả về điều phổ biến nhất mà nó đã đọc về chủ đề đó. Khi internet đầy các bài đăng hào hứng về cats.txt, ChatGPT nói cats.txt hiệu quả. Khi luồng thảo luận chuyển hướng và mọi người giải thích đây là trò đùa, ChatGPT đảo ngược lập trường. File không thay đổi gì cả. Chỉ có văn bản xung quanh trên web thay đổi.
Bài viết dẫn lời John Mueller của Google về llms.txt: “Không có hệ thống AI nào hiện tại sử dụng llms.txt […] Các LLM tiêu dùng và chatbot sẽ tải các trang của bạn – để training (học từ dữ liệu) và grounding (bổ sung ngữ cảnh thực tế khi tạo câu trả lời), nhưng không cái nào tải file llms.txt. Có thể ngày mai thì có? Cũng có thể ngày mai tôi trúng xổ số?”
Bài viết cũng dẫn nghiên cứu của Ahrefs trên 100.000 domain, cho thấy llms.txt “phần lớn bị các crawler mà nó nhắm đến bỏ qua,” không có lợi thế trích dẫn đo được nào cho các site có thêm file này.
Ý nghĩa thực tế với khả năng hiển thị trên AI
Bài học thực tế từ cats.txt đơn giản hơn một cuộc tranh luận kỹ thuật về định dạng file: phần lớn “bằng chứng” GEO đang lưu hành hiện nay là nhận dạng mẫu được ngụy trang thành quan hệ nhân quả.
Hình dung thế này: mỗi lần bạn xếp ô lại, mưa cuối cùng cũng tạnh, và ai đó kết luận ô của bạn đang khiến mưa tạnh. Bốn bài kiểm tra của llms.txt có cùng hình dạng: những sự kiện sẽ xảy ra bất kể cơ chế bên dưới có hoạt động hay không. Bot crawl mọi thứ. Google index file văn bản. RAG kéo nội dung xếp hạng cao. ChatGPT phản chiếu điều internet nói nhiều nhất.
Khả năng hiển thị AI của một thương hiệu phụ thuộc vào việc các hệ thống AI có thực sự trích dẫn, gợi ý, hoặc hiển thị thương hiệu đó với người dùng khi họ đặt câu hỏi liên quan hay không. Các yếu tố có thể ảnh hưởng đến kết quả đó, gồm chất lượng nội dung, structured data (markup có cấu trúc giúp máy móc phân tích nội dung trang), và sự hiện diện trong các nguồn mà mô hình AI đánh giá có thẩm quyền, đều có thể kiểm chứng qua quan sát độc lập với chiến thuật cụ thể.
Trước khi triển khai bất kỳ chiến thuật GEO mới nào, những câu hỏi nên đặt ra:
- Chiến thuật này có bằng chứng độc lập nào, hay chỉ có “bot đã crawl nó” và “ChatGPT nói nó hiệu quả”?
- Kết quả có thể quan sát và đo lường được, tách biệt với những gì sẽ xảy ra dù làm gì đi nữa?
- Nhà cung cấp LLM nào (OpenAI, Google, Anthropic) đã tài liệu hóa cơ chế cụ thể này trong hệ thống của họ?
- Nghiên cứu trên nhiều domain có xác nhận lợi ích trích dẫn đo được không?
- Nội dung có đang xếp hạng với các truy vấn mà AI dùng làm nguồn khi trả lời không?
- Thương hiệu có đang được nhắc đến trong các trang mà các hệ thống AI đánh giá là có thẩm quyền không?
Góc nhìn Hingewise
cats.txt không chứng minh llms.txt vô dụng. Nó chứng minh điều đơn giản hơn: ngành đang thiếu một ngưỡng bằng chứng tối thiểu trước khi lên hóa đơn cho khách.
Nhìn vào ví dụ cụ thể: khi Dave Smart thêm cats.txt, AI Overviews mô tả chính xác con mèo hư cấu Odd vì file được index, xếp hạng với truy vấn liên quan, và RAG kéo nội dung xếp hạng cao. Đó chính xác là cách RAG vận hành với bất kỳ trang nào được index tốt. Cơ chế có thật và có thể tận dụng, nhưng nó không cần file meta đặc biệt nào. Nó cần nội dung có cấu trúc rõ, được index, và xếp hạng với đúng câu hỏi.
Điều đáng chú ý hơn là tính đối xứng của vấn đề: bốn “bằng chứng” phổ biến nhất cho llms.txt sẽ luôn được thỏa mãn bởi bất kỳ file nào được đặt trên domain có nội dung, vì chúng không đo kết quả thực sự. Chúng đo việc internet hoạt động bình thường. Nghiên cứu Ahrefs trên 100.000 domain xác nhận: không có lợi thế trích dẫn đo được. John Mueller xác nhận: không có hệ thống AI nào tài liệu hóa việc đọc llms.txt.
Nhận định của Hingewise: đây là vấn đề về tiêu chuẩn bằng chứng, và nó không chỉ giới hạn ở llms.txt. Bất kỳ chiến thuật GEO mới nào cũng cần câu hỏi tương tự: kết quả có thể quan sát độc lập với chiến thuật, trước khi chi tiền. Cats.txt làm rõ điều gì xảy ra khi bỏ câu hỏi đó.
Điều đáng theo dõi tiếp: liệu có nhà cung cấp LLM lớn nào tài liệu hóa cụ thể việc họ đọc llms.txt trong quá trình tạo câu trả lời không. Cho đến khi đó, bằng chứng có sẵn hướng đến kết luận mà nghiên cứu Ahrefs trên 100.000 domain đã vạch ra.
Nguồn: Search Engine Journal, 2025; Ahrefs, nghiên cứu 100.000 domain, 2025; John Mueller, Google.
