Một khảo sát trên 163 chuyên gia SEO và GEO (tối ưu hóa khả năng xuất hiện trong câu trả lời AI) thực hiện trong ba tuần tháng 7, công bố trên Search Engine Journal, ghi nhận: dữ liệu về mức độ hiển thị trên AI được chấm trung bình 4.20/5 về mức độ hữu ích. Nhưng chỉ 44% cho rằng đầu tư vào nền tảng đo lường chuyên biệt là xứng đáng. Gần một phần ba chấm việc đầu tư này chỉ 1 hoặc 2/5. Vấn đề không phải là giá, chỉ 7% đề cập chi phí. Vấn đề là niềm tin.
Khảo sát đo những gì?
Duane Forrester, người sáng lập UnboundAnswers.com, thu thập phản hồi qua mạng lưới cá nhân, repost và quảng cáo trả phí trên LinkedIn và X trong ba tuần. Mẫu tự chọn này mang sai số khoảng bảy điểm phần trăm. Forrester công khai rằng ông từng xây một trong các nền tảng được đánh giá, một xung đột lợi ích đáng ghi nhận.
Người tham gia chấm điểm năm loại dữ liệu theo thang 1-5, theo dữ liệu khảo sát tháng 7/2025:
- Query alignment (khớp câu hỏi, vượt ra ngoài từ khóa đơn thuần): 90% chấm 4 hoặc 5
- So sánh với đối thủ trên cùng truy vấn: 83%
- Phân biệt mention từ training hay retrieval (retrieval: AI lấy nội dung trực tiếp từ web tại thời điểm hỏi, khác với kiến thức được tích hợp sẵn khi huấn luyện mô hình): 83%
- Chunk-level attribution (truy xuất đoạn nguồn cụ thể mà mô hình dùng khi tạo câu trả lời): 75%
- Tình trạng được trích dẫn (citation status): 71%
Điểm trung bình năm loại dữ liệu: 4.20/5. Điểm trung bình mức sẵn sàng đầu tư vào nền tảng đo lường: 3.19/5. Khoảng cách này duy trì ổn định từ 36 phản hồi đầu đến 163 phản hồi cuối, gợi ý đây không phải nhiễu mẫu ngẫu nhiên.
Điều gì kìm hãm quyết định đầu tư?
Trong 123 người (75%) có để lại phản hồi dạng văn bản, các nhóm phản đối hiện ra rõ ràng theo phân tích của Forrester:
- Không tin số liệu, phương pháp thiếu minh bạch: 24%
- ROI và kết nối với giá trị kinh doanh thực: 20%
- Non-determinism (AI cho ra kết quả khác nhau mỗi lần hỏi cùng một câu) và cá nhân hóa: 15%
- Prompt tổng hợp so với nhu cầu thực của người dùng: 11%
- Ranh giới giữa citation, mention và recommendation: 4%
Cộng lại, 57% nêu “tôi không tin con số này” hoặc “tôi không kết nối được nó với tiền”. Chỉ 7% nêu chi phí là vấn đề. Rào cản không nằm ở túi tiền.
Tại sao vấn đề phương pháp luận không có lời giải gọn
Nhiều người tham gia xác định điều Forrester gọi là “vấn đề không có mẫu số” (no denominator): các nền tảng xây điểm số từ danh sách prompt tự đặt ra, không dựa trên lưu lượng truy vấn thực tế quan sát được. Khi model variance (độ dao động kết quả giữa các lần chạy) làm điểm thay đổi giữa hai kỳ báo cáo, khách hàng có thể được thông báo “win” hoặc “lose” mà không có dữ liệu nền nào để kiểm chứng.
Một người tham gia gọi đó là “lời tiên tri tự thực hiện”. Người khác so sánh việc theo dõi citation với tín hiệu brand awareness hơn là công cụ chẩn đoán, vì khi AI cho ra câu trả lời khác nhau mỗi lần hỏi thì không có gì để reverse-engineer.
Forrester lập luận, và ghi rõ đây là quan điểm cá nhân chứ không phải kết quả khảo sát, rằng việc công khai toàn bộ phương pháp luận là bất khả thi về mặt thương mại: công bố thì sản phẩm trả phí biến thành công cụ miễn phí. Ông so sánh với các nền tảng keyword research được tin dùng suốt hai thập kỷ dù không ai nhìn vào bên trong. Câu hỏi thực chất hơn, ông gợi ý, không phải “cho tôi xem phương pháp của anh” mà là “bằng chứng nào mới thực sự khiến tôi tin vào con số?”. Không ai trong khảo sát đưa ra câu trả lời cụ thể.
Điều gì thay đổi sau khi mua subscription
Với những người đang trả phí sử dụng dịch vụ, khoảng cách giữa điểm giá trị dữ liệu và điểm giá trị nền tảng gần như biến mất, theo kết quả khảo sát. Với những người chưa mua, khoảng cách lớn gấp khoảng ba lần.
Forrester không khẳng định nhân quả: mua xong thì hết nghi ngờ, hay người đã không nghi ngờ mới là người mua? Khảo sát không phân biệt được hai trường hợp này, và ông ghi rõ điều đó.
Một xu hướng nổi lên trong phần trả lời mở: người chưa mua thường nghi ngờ con số; người đang trả phí thường chấp nhận con số nhưng gặp khó trong việc hành động theo. Đây là giới hạn đào tạo, giới hạn sản phẩm, hay giới hạn cấu trúc của chính medium, Forrester không kết luận.
Chỉ 8% người tham gia tự xây công cụ đo riêng. Trong nhóm nêu vấn đề về độ tin cậy hoặc non-determinism, tỷ lệ là 9%, một sự khác biệt thống kê không đáng kể. Phản đối “tôi không tin số” đang hoạt động như một lời nhờ người khác giải quyết vấn đề, hơn là một hướng thị trường đang tự theo đuổi.
Nền tảng AI nào đang được chuyên gia theo dõi
Người tham gia chọn tối đa năm nền tảng. Tỷ lệ đưa vào danh sách, theo khảo sát tháng 7/2025:
- Google AI Overviews và AI Mode: 95%
- ChatGPT: 94%
- Gemini: 75%
- Claude: 64%
- Perplexity: 34%
- Microsoft Copilot: 25%
46% người tham gia chọn đủ năm lựa chọn, nên các con số trên là ngưỡng sàn, không phải phân phối đầy đủ. Không nền tảng nào ngoài sáu cái trên vượt 5%.
Ý nghĩa với khả năng hiển thị trên AI search
Cách đọc rõ nhất từ kết quả này: chuyên gia tin vào thứ họ muốn đo, nhưng không tin vào cái thước đang đo nó.
Hình dung một chủ tiệm muốn biết ChatGPT đang giới thiệu doanh nghiệp của mình ra sao khi khách hỏi về nhà cung cấp địa phương. Câu hỏi đó hoàn toàn xứng đáng chấm 4.20/5. Nhưng công cụ trả lời câu hỏi này lại tự chọn danh sách câu hỏi giả định, rồi chạy chúng qua mô hình thay bạn. Danh sách đó chưa chắc đã gồm đúng những gì khách hàng thực sự gõ. Và vì AI cho ra câu trả lời khác nhau tùy người dùng, giờ trong ngày và hàng chục yếu tố khác, con số bạn nhận được là ảnh chụp của một mục tiêu đang chuyển động mà không ai cố định được. Đó là thực tế của 3.19/5.
Góc nhìn Hingewise
Vấn đề cốt lõi không phải các nền tảng thiếu minh bạch về phương pháp, mà là AI visibility về bản chất không thể đo bằng cách SEO truyền thống đã làm.
Rank tracker hoạt động được vì kết quả tìm kiếm đủ ổn định để neo một con số. Bạn đứng vị trí 4 cho một từ khóa, đó là sự thật cụ thể, tái hiện được. Gõ lại ngày mai, vẫn vị trí 4.
AI thì khác. Cùng một câu hỏi, hai người hỏi đồng thời có thể nhận hai câu trả lời hoàn toàn không giống nhau. Vì vậy, một điểm số AI visibility có thể phản ánh danh sách prompt mà chính nền tảng tự đặt ra nhiều hơn là sự hiện diện thực của thương hiệu trong câu trả lời AI.
Nhận định của Hingewise: tín hiệu AI visibility gần với một cuộc khảo sát brand sentiment hơn là rank tracker. Có định hướng, có nhiễu, và hữu ích nhất khi theo dõi xu hướng theo thời gian so với đối thủ trên cùng một tập prompt, thay vì đọc như con số tuyệt đối trong một ngày cụ thể. Người đang trả phí vượt qua được sự nghi ngờ không phải vì họ tìm ra câu trả lời cho vấn đề phương pháp luận, mà nhiều khả năng vì họ chấp nhận rằng tín hiệu định hướng còn hơn không có gì. Đây là điểm xuất phát thực tế hơn để đánh giá các công cụ trong danh mục này.
Trước khi quyết định đầu tư vào nền tảng AI visibility, nên kiểm tra:
- Nền tảng dùng prompt list tự đặt hay có dữ liệu từ truy vấn thực tế người dùng?
- Khi điểm số thay đổi giữa hai kỳ báo cáo, có giải thích cụ thể nguyên nhân hay chỉ có con số thay đổi?
- Có thể so sánh trực tiếp với đối thủ trên cùng tập prompt không?
- Nền tảng có phân biệt mention từ training data và retrieval thời gian thực không?
- Báo cáo có theo dõi xu hướng theo thời gian hay chỉ cung cấp điểm tuyệt đối từng kỳ?
- Nền tảng theo dõi AI nào, và danh sách đó có khớp với AI platform khách hàng thực sự dùng không?
Điều đáng theo dõi tiếp là liệu ngành có hội tụ về một chuẩn phương pháp luận chung hay mỗi nền tảng tiếp tục vận hành với prompt list riêng. Câu trả lời đó sẽ xác định danh mục này trưởng thành theo hướng của keyword research, hay duy trì là tín hiệu định hướng có nhiễu trong một thời gian dài nữa.
