Trước khi viết câu trả lời, ChatGPT chạy hàng loạt tìm kiếm ngầm song song, gọi là fan-out query. Theo phân tích của Search Engine Journal (2025), số URL được AI truy xuất trong mỗi câu trả lời đang tăng, trong khi số domain được trích dẫn lại giảm. Với thương hiệu muốn xuất hiện trong câu trả lời AI, cơ chế lọc nguồn này quan trọng không kém gì thứ hạng tìm kiếm truyền thống.
Fan-out query là gì và tại sao thương hiệu cần biết?
Khi câu hỏi của người dùng kích hoạt tìm kiếm web trong ChatGPT, mô hình không chỉ chạy một lần. Nó phân tách câu hỏi thành nhiều truy vấn nhỏ, chạy song song qua RAG (Retrieval-Augmented Generation, kỹ thuật kéo nội dung web trực tiếp vào quá trình soạn câu trả lời), rồi tổng hợp kết quả. Những truy vấn ngầm đó gọi là fan-out query.
Theo phân tích của Search Engine Journal, mỗi từ và toán tử tìm kiếm mà ChatGPT đặt vào fan-out query đều hé lộ loại nguồn nào mô hình đang tìm và sẵn sàng tin tưởng. Theo dõi fan-out query theo thời gian, bài phân tích lập luận, là cửa sổ rõ nhất để thấy OpenAI đang tinh chỉnh hành vi tìm kiếm qua từng lần cập nhật model.
ChatGPT dùng toán tử site: để lọc nguồn như thế nào?
Một trong những xu hướng nổi bật nhất trong nghiên cứu của Search Engine Journal là ChatGPT ngày càng dùng nhiều toán tử site: trong fan-out query. Toán tử site: (lệnh tìm kiếm giới hạn kết quả về một tên miền cụ thể, theo hướng dẫn của Ahrefs về search operators nâng cao) vốn là công cụ quen thuộc trong nghiên cứu SEO.
Theo phân tích của Search Engine Journal, ChatGPT đang dùng toán tử này để thu hẹp tìm kiếm trực tiếp vào những tên miền mà nó đánh giá là đáng tin. Đôi khi mô hình còn thêm từ “official” vào truy vấn, hoặc chỉ định thẳng một cộng đồng Reddit cụ thể.
Giả thuyết của bài viết: OpenAI dùng toán tử site:, cùng với cách thiết kế fan-out query nói chung, như một cách giảm thiểu nội dung spam và thông tin kém chất lượng từ web. Tác giả so sánh điều này với cách Google xây dựng khung E-E-A-T (bộ tiêu chí đánh giá độ tin cậy nội dung: kinh nghiệm, chuyên môn, thẩm quyền, đáng tin), nhưng được triển khai theo cách của ChatGPT.
URL được truy xuất và URL được trích dẫn khác nhau ở điểm nào?
Phân biệt hai khái niệm này là bước bắt buộc với bất kỳ ai đang theo dõi hiệu quả AI search. Theo tổng hợp của Search Engine Journal từ nhiều bộ dữ liệu ngành (2025), hai chỉ số này đang đi ngược chiều nhau:
- Truy xuất (retrieved): URL mà ChatGPT tải về khi chạy fan-out query. Số URL truy xuất trên mỗi câu trả lời đang tăng.
- Trích dẫn (cited): URL xuất hiện dưới dạng link hiển thị trong câu trả lời cuối cùng. Số domain duy nhất được trích dẫn trên mỗi câu trả lời đang giảm trong cùng giai đoạn.
Hệ quả thực tế: nhiều trang được xem xét hơn, nhưng ít trang được ghi nhận trong câu trả lời hiển thị. Điều này có nghĩa là chỉ đếm lần được trích dẫn sẽ cho con số thấp hơn mức độ ảnh hưởng thực sự của một trang lên câu trả lời AI. Ngược lại, nó cũng có thể phóng đại tác động của một nội dung đơn lẻ với nhiều loại truy vấn khác nhau của người dùng.
Phiên bản ChatGPT nào thực sự đang thực hiện tìm kiếm?
Không phải mọi người dùng ChatGPT đều có cùng trải nghiệm tìm kiếm. Theo phân tích của Search Engine Journal, ChatGPT 5.6 có hai biến thể: “Sol” (phiên bản chuẩn) và “Luna” (biến thể rẻ hơn, trở thành model mặc định cho người dùng Free và Go vào đầu tháng 8/2025). Điểm khác biệt này quan trọng khi đọc các nghiên cứu về fan-out query, vì các nghiên cứu có thể đang đo các tầng model khác nhau mà không ghi chú rõ.
Theo phân tích của Olivier de Segonzac đăng trên Search Engine Land, hơn 90% người dùng ChatGPT hàng tuần đang dùng gói miễn phí. Điều đó có nghĩa hành vi truy xuất của Luna mới là trải nghiệm mà phần lớn người dùng ChatGPT thực sự nhận được.
Search Engine Journal cũng lưu ý rằng không phải mọi câu hỏi đều kích hoạt tìm kiếm web. Các model rẻ hơn thường trả lời từ dữ liệu huấn luyện hơn, vì truy xuất web phát sinh chi phí cao hơn. Khi tìm kiếm được kích hoạt, ChatGPT lấy dữ liệu từ cả công cụ tìm kiếm bên ngoài lẫn chỉ mục nội bộ của mình, được gọi là Labrador.
Ý nghĩa thực tế với khả năng hiển thị trên AI search
Cách hiểu đơn giản nhất: ChatGPT không tìm kiếm bằng cách khớp từ khóa. Nó chọn nguồn nào cần tham khảo, và quyết định đó xảy ra trước khi mô hình viết bất kỳ chữ nào trong câu trả lời.
Một truy vấn giới hạn theo site: chỉ định đúng tên miền giống như mô hình đang nói “Tôi muốn biết nguồn cụ thể này nói gì về chủ đề này.” Đó là câu hỏi hoàn toàn khác với một tìm kiếm web rộng. Một thương hiệu có thể xếp hạng tốt trên Google thông thường nhưng vẫn bị bỏ qua hoàn toàn nếu quá trình fan-out của ChatGPT không bao giờ nhắm thẳng vào tên miền đó. Hai thứ không phải là một tín hiệu.
Sự phân kỳ giữa truy xuất và trích dẫn thêm một tầng phức tạp. Nội dung của một thương hiệu có thể được AI đọc trong quá trình truy xuất mà không bao giờ xuất hiện như một link trong câu trả lời hiển thị. Đó là ảnh hưởng không có ghi nhận, có nghĩa là các công cụ theo dõi trích dẫn thông thường chỉ đang đo một phần bức tranh.
Góc nhìn Hingewise
Tin tốt và tin xấu cùng một lúc: nội dung của bạn có thể ảnh hưởng đến câu trả lời AI mà không có tên trong đó, và ngược lại, được trích dẫn không đồng nghĩa với việc AI thực sự tin tưởng tên miền của bạn lâu dài.
Một điều các nguồn chưa nói rõ: xu hướng fan-out query giới hạn theo site: nhiều khả năng có lợi cho thương hiệu có thẩm quyền chủ đề nhất quán trên toàn tên miền, chứ không chỉ thương hiệu có một vài bài viết nổi bật. Khi mô hình đã chọn thu hẹp tìm kiếm về một tên miền cụ thể theo tên, nó đã quyết định tên miền đó là nguồn tham chiếu đã biết cho chủ đề đó. Việc được nhận diện như vậy, qua cả dữ liệu huấn luyện lẫn truy xuất trực tiếp, có thể quan trọng hơn việc tối ưu từng trang đơn lẻ cho mật độ từ khóa.
Nhận định của Hingewise: hành vi fan-out query hiện là một trong những tín hiệu thông tin nhất để hiểu cách AI đánh giá độ tin cậy của nguồn tại thời điểm inference (thời điểm mô hình tạo câu trả lời trực tiếp, tách biệt với những gì nó học trong quá trình huấn luyện). Quan sát tên miền nào mà mô hình chọn để giới hạn tìm kiếm tiết lộ các quyết định tin tưởng đang xảy ra trong thời gian thực, không chỉ là liên kết từ dữ liệu huấn luyện lịch sử. Đây là tín hiệu có ý nghĩa và có thể hành động được nhiều hơn so với phân tích dữ liệu huấn luyện đơn thuần.
Cần kiểm tra gì trước khi audit AI search của bạn?
- Bạn có đang theo dõi fan-out query, không chỉ trích dẫn cuối không? Các công cụ như Peec AI, Profound, plugin Chrome Resoneo và FanoutFox hiển thị các truy vấn nền thực sự mà ChatGPT chạy trước khi trả lời.
- Tên miền của bạn có xuất hiện trong các truy vấn site: không? Đây là tín hiệu khác biệt so với việc xếp hạng trong kết quả Google thông thường.
- Bạn có đo cả truy xuất lẫn trích dẫn không? Chỉ theo dõi một trong hai sẽ cho bức tranh không đầy đủ về mức độ ảnh hưởng thực sự của nội dung.
- Nghiên cứu fan-out bạn đang đọc đo ChatGPT tầng nào? “Sol” và “Luna” có thể có hành vi truy xuất khác nhau, và phần lớn người dùng đang dùng Luna.
- Trang của bạn có thường xuyên được truy xuất mà không được trích dẫn không? Điều đó có thể cho thấy nội dung được AI tham khảo nhưng chưa được đánh giá là câu trả lời phù hợp nhất.
Xu hướng fan-out query vẫn đang thay đổi nhanh, và các bộ dữ liệu trong ngành đang hội tụ dần về cùng kết luận. Điều đáng theo dõi tiếp là liệu việc dùng truy vấn giới hạn theo site: có mở rộng thêm không, và liệu khoảng cách giữa truy xuất và trích dẫn có tiếp tục nới rộng khi OpenAI tinh chỉnh thêm cơ chế lọc nguồn.
Nguồn:
- Search Engine Journal: What We Can Learn from Evolving ChatGPT Fan-Out Queries (2025)
- Ahrefs: Google Advanced Search Operators
- Search Engine Land: Phân tích của Olivier de Segonzac về phân phối người dùng ChatGPT theo gói (2025)
