Perplexity chọn nguồn qua ít nhất hai lớp có thể quan sát được: bộ phân loại intent 16 đầu (hệ thống tự động định tuyến query trước khi tìm kiếm) và một trust registry (danh sách uy tín gắn với domain cụ thể) đang hình thành dần. Cách xếp hạng nguồn cụ thể bên trong hai lớp đó vẫn nằm phía server, không ai nhìn thấy từ bên ngoài.
Bức tranh trên đến từ báo cáo reverse-engineering (phân tích ngược hệ thống) của Search Engine Journal. Nhà nghiên cứu chặn luồng dữ liệu trực tiếp trên tài khoản Pro cá nhân tại Dubai, ghi lại tám phiên query ngày 25/6/2026 (build 7fe6ad4) và kiểm tra lại ba lần vào 21/7/2026 (build df49f17). Các phát hiện về cấu trúc, tức là trường nào tồn tại và hoạt động thế nào, có độ tin cậy cao vì chỉ cần nhìn thấy một lần là xác nhận được. Còn các con số theo tỷ lệ hay tần suất chỉ mang tính định hướng do cỡ mẫu nhỏ.
Bộ phân loại 16 đầu của Perplexity quyết định điều gì?
Trước khi thực hiện bất kỳ tìm kiếm nào, Perplexity chấm điểm query qua 16 “đầu” (head) intent khác nhau, mỗi đầu có ngưỡng xác suất cố định. Toàn bộ bảng điểm này được gửi về trình duyệt người dùng trong trường classifier_results.mhe_predictions_full, mức độ minh bạch về routing logic hiếm thấy ở các nền tảng AI.
16 đầu bao gồm các loại nội dung khác nhau: địa điểm địa phương, mua sắm, video, thời tiết, tạo ảnh, thẻ tài chính và nhiều loại khác. Mỗi đầu trả về xác suất, ngưỡng kích hoạt và kết quả đúng/sai. Trên cùng là nhãn domain_subdomain, hệ thống phân loại chủ đề của Perplexity cho query đó.
Theo báo cáo SEJ, ngưỡng kích hoạt không thay đổi qua cả bảy loại query trong tháng Sáu và vẫn giữ nguyên 26 ngày sau trên một build khác. Nhãn chủ đề thay đổi theo query đúng như kỳ vọng:
- “best AI SEO tools 2026” được phân loại TECHNOLOGY/ARTIFICIAL_INTELLIGENCE với độ tin cậy 0,86
- “Ahrefs vs Semrush” được phân loại BUSINESS/DIGITAL_MARKETING với độ tin cậy 0,94, điểm cao nhất trong toàn bộ lần ghi lại
- “latest Google algorithm update” chỉ đạt TECHNOLOGY/INTERNET_TECHNOLOGIES với 0,49, điểm thấp nhất, vì query tin tức khó ép vào một chủ đề duy nhất
Kết quả của bộ phân loại quyết định thương hiệu đang cạnh tranh ở “mặt trận” nào. Query dạng “X tốt nhất gần đây” vượt ngưỡng địa điểm thì mở cuộc thi hiển thị bản đồ, không phải cuộc thi trích dẫn thông thường. Query hướng dẫn thì kéo tab video song song với kết quả văn bản.
Perplexity có luôn tìm kiếm web không, hay đôi khi trả lời từ bộ nhớ?
Perplexity tìm web trên mọi query. Cờ skip_search (tín hiệu báo hệ thống trả lời từ dữ liệu huấn luyện mà không gọi web) có giá trị false trên tất cả bảy loại query trong lần ghi lại, kể cả các query hướng dẫn từng bước mà ChatGPT, theo teardown trước đó của cùng nhà nghiên cứu, xử lý hoàn toàn từ bộ nhớ mà không trích dẫn trang nào.
Sự khác biệt cấu trúc này ảnh hưởng trực tiếp đến khả năng hiển thị nội dung. Với ChatGPT, query hướng dẫn có thể được giải quyết từ training data mà không dẫn nguồn bên ngoài. Với Perplexity, mọi query hướng dẫn đều kéo dữ liệu từ web.
Trong lần ghi lại của SEJ, query về thay lốp xe leo lên chế độ Study (model: pplx_study, chế độ thiên về giảng giải) và kích hoạt tab video với đầu phân loại video đạt điểm 0,988 khi chạy lại vào tháng Bảy. Hành vi này nhất quán qua hai build cách nhau khoảng bốn tuần.
Trust field của Perplexity là gì và thực sự đo lường điều gì?
Tính đến lần ghi lại ngày 21/7/2026, Perplexity gắn một đối tượng trust (thông tin uy tín) vào một số domain trong kết quả, chứa: mức độ bằng số, tên bậc và câu mô tả phạm vi uy tín của domain đó. Trường này vắng mặt trong lần ghi lại tháng Sáu, còn ở lần ghi lại trên tài khoản miễn phí trước đó thì trường có mặt nhưng rỗng. Điều đó có nghĩa nó đã thay đổi trạng thái ít nhất ba lần trong vòng hai tháng.
Báo cáo SEJ xác nhận hai bậc:
- Bậc 1, “credible” (uy tín): ví dụ caranddriver.com, được mô tả là uy tín cho nội dung ô tô “lâu đời, được biên tập chuyên nghiệp”
- Bậc 2, “trusted” (tin cậy): ví dụ goodyear.eu, được mô tả là “tin cậy cho thông tin sản phẩm lốp xe Goodyear chính thức” bao gồm mảng EMEA và doanh nghiệp đội xe
Mọi trust entry được ghi lại đều theo mẫu first-party (nguồn gốc trực tiếp): domain được tin cậy về sản phẩm, dịch vụ và lĩnh vực của chính mình, không phải tin cậy chung chung. Câu mô tả phạm vi nói lên domain “sở hữu” gì, không phải domain lớn hay nổi tiếng thế nào.
Mức độ phủ không đồng đều trong lần ghi lại. Trên query hướng dẫn, 6 trong 15 nguồn có trust entry, toàn bộ đều là domain chính thức lớn. YouTube không có trust entry trong bất kỳ citation nào trên một query nhất định, nhưng vẫn chiếm 14 trong 40 nguồn được trích dẫn của query đó. Thiếu trust entry không ngăn được việc được trích dẫn.
Nhà nghiên cứu lưu ý rõ rằng tên bậc và cách diễn đạt là “ảnh chụp của một hệ thống đang triển khai giữa chừng, không phải API ổn định.”
Perplexity tìm kiếm sâu đến mức nào trước khi tạo câu trả lời?
Search fan-out (số bước tìm kiếm chạy trước khi tạo câu trả lời) mặc định của Perplexity khá nông. Sáu trong bảy query trong lần ghi lại chỉ thực hiện một bước SEARCH_WEB duy nhất, gửi query của người dùng gần như nguyên văn lên web và lấy về một tập kết quả nhỏ gọn. “Ahrefs vs Semrush” được gửi đi không thay đổi; “best AI SEO tools 2026” cũng được gửi đi không thay đổi và trả về 10 kết quả.
Nhà nghiên cứu SEJ đối chiếu điều này với hành vi của ChatGPT trên cùng các query. Hành vi mặc định của Perplexity: một query, một tập kết quả, một câu trả lời.
Góc nhìn Hingewise
Perplexity không chấm “điểm uy tín tổng” cho một website theo kiểu domain authority SEO truyền thống. Nó đang xây một danh bạ chuyên gia, trong đó mỗi mục ghi rõ “website này được tin về cái gì cụ thể.”
Ví dụ từ dữ liệu làm rõ điều này: goodyear.eu không đạt bậc “trusted” vì là thương hiệu lớn hay có nhiều backlink. Nó đạt bậc đó vì sở hữu thông tin chính thức về sản phẩm lốp xe Goodyear, cụ thể đến từng mảng EMEA và đội xe. Theo hướng đó, một thương hiệu vừa có tài liệu kỹ lưỡng, có cấu trúc tốt về dòng sản phẩm của chính mình có thể là ứng cử viên first-party mạnh hơn một nhà xuất bản tổng hợp phủ rộng nhưng không sâu vào lĩnh vực cụ thể nào.
Phát hiện về YouTube thêm một lớp đáng chú ý. YouTube chiếm 14 trong 40 nguồn được trích dẫn trên một query mà không có bất kỳ trust entry nào. Điều này gợi ý Perplexity có thể đang vận hành song song ít nhất hai cơ chế: trust registry và một hệ thống trích dẫn riêng dựa trên loại nội dung hoặc tín hiệu khác mà dữ liệu hiện tại chưa tiết lộ.
Trust field thay đổi trạng thái ít nhất ba lần trong hai tháng. Đây là hệ thống đang hình thành, không phải tiêu chuẩn đã đóng, vì vậy cần theo dõi chứ chưa nên tối ưu vội. Câu hỏi thực tiễn đáng đặt ra ngay bây giờ không phải là “làm sao có vẻ uy tín nói chung?” mà là “domain của mình rõ ràng sở hữu chủ đề gì, và nội dung có thể hiện điều đó không?”
Nhận định của Hingewise: nếu trust registry của Perplexity tiếp tục phát triển theo hướng first-party ownership này, sự chuyên sâu và sở hữu chủ đề rõ ràng sẽ được thưởng nhiều hơn độ phủ rộng. Đây là sự dịch chuyển khác biệt so với logic truyền thống của SEO.
Cần kiểm tra gì trước
- Xác định domain của bạn thực sự “sở hữu” chủ đề gì theo kiểu first-party, không phải chủ đề nào bạn muốn phủ
- Kiểm tra xem nội dung trên domain có thể hiện ownership rõ ràng về lĩnh vực đó không, hay đang phủ quá rộng
- Thử các query về sản phẩm/dịch vụ của bạn trực tiếp trên Perplexity để xem đang được trích dẫn thế nào và ở định dạng nào
- Xác định loại query (so sánh, hướng dẫn, địa điểm) có thể kéo thương hiệu bạn vào các tab khác nhau của Perplexity
- Đánh giá xem nội dung video có cần bổ sung vào chiến lược không, vì Perplexity luôn tìm web và kích hoạt tab video cho query hướng dẫn
- Theo dõi trust field qua các build mới, vì đây là hệ thống vẫn đang thay đổi nhanh
Trust field của Perplexity đã thay đổi trạng thái ít nhất ba lần trong hai tháng, build df49f17 (tháng Bảy) khác biệt rõ so với build 7fe6ad4 (tháng Sáu). Ai muốn hiểu Perplexity lựa chọn nguồn ra sao cần theo dõi chính luồng dữ liệu, không chỉ câu trả lời bề mặt.
Nguồn: Search Engine Journal, “How Perplexity Actually Picks Sources: I Read the Stream, Not the Answers”, ghi lại ngày 25/6/2026 (build 7fe6ad4) và 21/7/2026 (build df49f17).
