Insights / Blog

Keenable xây web index riêng cho AI agent, đúng lúc Google và Bing siết chặt API tìm kiếm

Keenable xây web index cho AI agent ngay lúc Bing API bị khai tử và Google ngừng Custom Search. 100 tỷ tài liệu, 26 triệu USD seed. Ý nghĩa gì với thương…
L
Lam Nguyen - Founder
Share
Keenable xây web index riêng cho AI agent, đúng lúc Google và Bing siết chặt API tìm kiếm
ON THIS PAGE

Table of Contents

Chỉ mục web (web index) hiện tại được thiết kế cho người dùng lướt trang và nhấp link. AI agent hoạt động hoàn toàn khác: đọc toàn bộ tài liệu và tổng hợp thông tin từ hàng chục nguồn trong một lần. Keenable, startup vừa gọi vốn 26 triệu USD vòng seed do Accel dẫn đầu, đang xây chỉ mục web thiết kế riêng cho cách AI hoạt động, và ra mắt đúng thời điểm Google lẫn Microsoft cùng siết quyền truy cập API tìm kiếm của mình.

30%lưu lượng web toàn cầu đến từ bot, AI crawler chiếm phần ngày càng lớnCloudflare Radar, 2025
100 tỷtài liệu đã được Keenable lập chỉ mụcKeenable / TechCrunch, tháng 8/2026
11/8/2025ngày Microsoft khai tử Bing Search APIs chính thứcMicrosoft Lifecycle, 2025

AI agent cần chỉ mục web riêng vì sao?

Các chỉ mục tìm kiếm truyền thống được tối ưu để trả về mười liên kết nhanh nhất có thể. Ứng dụng AI, từ chatbot đến autonomous agent (tác nhân tự động), cần điều khác: khả năng retrieval (kéo về và đọc) toàn bộ tài liệu, đối chiếu nhiều nguồn, và grounding (neo câu trả lời vào văn bản nguồn cụ thể).

Đây chính là điều đồng sáng lập Andrey Styskin gọi là “một flywheel hoàn toàn khác với những gì Google học được từ hành vi con người,” trong cuộc phỏng vấn với TechCrunch tháng 8/2026. Styskin có 20 năm kinh nghiệm xây hạ tầng tìm kiếm, từng lãnh đạo mảng tìm kiếm, AI và điện toán đám mây của Yandex trước khi làm hạ tầng web search tại Amazon. Đồng sáng lập Matthias Petri là nhà khoa học AI người Đức.

Cả hai lập luận rằng phục vụ AI agent từ chỉ mục web thông thường sẽ tốn kém đến mức không khả thi nếu không thiết kế lại từ đầu. “Nếu bạn không tối ưu cấu trúc chỉ mục cho một nhiệm vụ cụ thể, chi phí phục vụ và quét toàn bộ internet sẽ khổng lồ vì lượng dữ liệu,” Styskin nói với TechCrunch.

Phân tích xu hướng web crawling (thu thập dữ liệu web tự động) của Cloudflare năm 2025 cho thấy quy mô của sự thay đổi này. Theo dữ liệu Cloudflare Radar công bố năm 2025, khoảng 30% lưu lượng web toàn cầu hiện đến từ bot, trong đó AI crawler (bot thu thập nội dung web để huấn luyện hoặc vận hành mô hình AI) chiếm tỷ trọng đáng kể và đang tăng nhanh. Báo cáo này cũng ghi nhận sự dịch chuyển rõ rệt trong bức tranh AI crawler trong giai đoạn từ tháng 5/2024 đến tháng 5/2025.

API tìm kiếm của Google và Microsoft đang đi về đâu?

Nhiều năm qua, các nhà phát triển xây ứng dụng AI dựa vào hai cổng thương mại chính để truy cập dữ liệu web: Bing Search APIs của Microsoft và Custom Search JSON API của Google. Cả hai hiện đã đóng cửa với nhà phát triển độc lập.

  • Microsoft khai tử Bing Search APIs vào ngày 11/8/2025. Người dùng hiện tại được chuyển hướng sang “Grounding with Bing Search,” một tính năng gói sẵn chỉ khả dụng trong Azure AI Agents, theo thông báo lifecycle của Microsoft.
  • Google ngừng nhận khách hàng mới cho Custom Search JSON API, và tài liệu dành cho nhà phát triển của Google xác nhận dịch vụ sẽ bị ngừng hoàn toàn với khách hàng hiện tại vào ngày 1/1/2027.

Theo Accel partner Zhenya Loginov, người dẫn đầu vòng đầu tư vào Keenable, các nhà phát triển AI hiện có “rất ít lựa chọn khi cần hạ tầng tìm kiếm ở quy mô web,” vì cả hai nền tảng lớn đang ưu tiên sản phẩm gói sẵn và chọn lọc hơn trong việc hợp tác, theo TechCrunch tháng 8/2026. Thay vì cung cấp API truy cập mở, cả Google lẫn Microsoft đều đang dẫn khả năng tìm kiếm web qua các stack AI sản phẩm riêng của họ.

Keenable đang xây dựng gì?

Keenable cho biết đã lập chỉ mục hơn 100 tỷ tài liệu, và API đang được dùng trong môi trường production tại nhiều AI lab và inference provider (công ty vận hành tính toán mô hình AI ở quy mô lớn), bao gồm cả huấn luyện mô hình lẫn phản hồi truy vấn thời gian thực.

Công ty từ chối công bố tên khách hàng cụ thể, nhưng TechCrunch xác nhận đối tác Gradium, một công ty voice AI, đang dùng Keenable để hỗ trợ truy xuất thông tin trực tiếp. Một sản phẩm sắp ra mắt có tên Web Query Language đang được phát triển, với mục tiêu giúp hệ thống AI trả lời câu hỏi bằng cách tổng hợp thông tin từ nhiều nguồn web khác nhau, theo TechCrunch tháng 8/2026.

Styskin cho biết Keenable đã tuyển dụng các cựu đồng nghiệp và đang xây dựng các năng lực retrieval độc quyền ngoài chỉ mục cốt lõi, dựa trên kinh nghiệm trước đây của ông và Petri trong việc phát triển hạ tầng web search cho ứng dụng AI, bao gồm Amazon Alexa.

Điều này có ý nghĩa gì với khả năng hiển thị trên AI?

Nói thẳng: nếu AI agent trả lời câu hỏi bằng cách đọc tài liệu từ một chỉ mục, thì các thương hiệu và nguồn có mặt trong chỉ mục đó mới được trích dẫn. Thương hiệu vắng mặt trong chỉ mục đó thực tế biến mất khỏi tầm nhìn của AI, dù họ đang xếp hạng tốt đến đâu trên Google.

Có ba điểm đáng chú ý dưới góc phân tích của Hingewise, không điểm nào được các nguồn phân tích trực tiếp.

Vấn đề grounding mang tính cấu trúc, không phải kỹ thuật. Khi AI agent neo câu trả lời vào các tài liệu nguồn cụ thể, những tài liệu đó được trích dẫn. Nhưng tài liệu nào được kéo về phụ thuộc hoàn toàn vào chỉ mục AI đang truy vấn và cách chỉ mục đó xếp hạng, lọc nội dung. Khác với SEO truyền thống có một thuật toán chiếm ưu thế để nghiên cứu và tối ưu, hạ tầng AI phân mảnh có nghĩa là không tồn tại một hệ thống xếp hạng duy nhất. Một thương hiệu nổi bật trong chỉ mục này có thể vắng mặt hoàn toàn trong chỉ mục khác.

Nhiều chỉ mục song song đang trở thành tiêu chuẩn, không phải ngoại lệ. Keenable không phải công ty duy nhất lấp khoảng trống sau khi Bing và Google hạn chế API. Kết quả tất yếu là một bức tranh nhiều chỉ mục web độc lập cùng tồn tại bên cạnh sản phẩm gói sẵn của các ông lớn, mỗi chỉ mục có ưu tiên crawling, tín hiệu độ tươi và tín hiệu uy tín riêng. Với thương hiệu tập trung vào khả năng hiển thị AI, câu hỏi “tôi có xuất hiện trong chỉ mục mà AI agent đang truy vấn không?” ngày càng quan trọng hơn, và câu trả lời có thể khác nhau tùy hệ thống.

Cấu trúc trang ảnh hưởng khác hẳn trong ngữ cảnh retrieval. Web Query Language sắp ra của Keenable hướng đến mô hình AI tổng hợp nội dung thực tế, cụ thể từ nhiều nguồn. Các trang thiết kế chủ yếu để người dùng điều hướng, nặng menu và tiêu đề mục nhưng thiếu các câu nêu dữ kiện tự đứng được, có thể hoạt động kém trong ngữ cảnh retrieval dù xếp hạng tốt trên tìm kiếm truyền thống.

Góc nhìn Hingewise

Điều thực sự đang xảy ra đơn giản hơn nhiều so với vẻ ngoài kỹ thuật của nó: “xếp hạng cao trên Google” và “được AI trích dẫn” đang trở thành hai chuyện khác nhau. Một thương hiệu có thể giữ trang 1 Google cho mọi từ khóa quan trọng, nhưng nếu AI agent khách hàng đang dùng truy vấn một chỉ mục không có tên họ, họ vô hình với khách hàng đó, hoàn toàn và tức thì.

Điểm quan trọng mà các nguồn chưa nói rõ: sự phân mảnh chỉ mục tạo ra một vòng phản hồi bất đối xứng. Thương hiệu nào xuất hiện sớm trong các chỉ mục AI thế hệ đầu sẽ tích lũy lợi thế trích dẫn theo thời gian, vì AI được huấn luyện một phần từ các câu trả lời trước của chính nó. Thương hiệu nào vào muộn sẽ phải leo ngược lên từ đầu trong từng chỉ mục mới.

Nhận định của Hingewise: các thương hiệu chịu rủi ro lớn nhất là những đơn vị đầu tư mạnh vào SEO cho Google trong khi mặc định rằng kết quả đó tự động chuyển sang môi trường AI agent. Không có sự chuyển đổi tự động đó. Khoảng cách hạ tầng mà Keenable đang lấp đầy chính là cơ chế giải thích tại sao, và sự phân mảnh này nhiều khả năng sẽ mở rộng trước khi có xu hướng hợp nhất trở lại.

Cần kiểm tra và làm gì trước?

  • Xác định AI agent hay chatbot nào khách hàng trong ngành bạn đang thực sự dùng để tìm thông tin.
  • Hỏi trực tiếp các công cụ AI đó về thương hiệu và chủ đề liên quan: bạn có xuất hiện không, và với nội dung gì?
  • Rà soát xem nội dung trang có chứa các câu dữ kiện tự đứng được không, hay chỉ có cấu trúc điều hướng và menu.
  • Kiểm tra file robots.txt: AI crawler nào đang được phép, chặn, hay chưa được quy định rõ.
  • Đánh giá chiến lược nội dung hiện tại có đang tối ưu cho retrieval (AI kéo và đọc nguyên tài liệu) hay chỉ cho click-through truyền thống.
  • Theo dõi các chỉ mục web mới như Keenable khi họ mở rộng quyền truy cập API và công bố tiêu chí lựa chọn nội dung.

Nguồn:

Keep reading

All articles →
Free · no strings

See what AI says about you, today.

Get the report showing how ChatGPT, Gemini & Perplexity answer about your brand.

Get free report →
Reply within 48 hours.