OKF v0.2 (Open Knowledge Format phiên bản 0.2, định dạng mở để máy đọc kiến thức có cấu trúc) do Google phát hành ngày 25/7/2026 bổ sung năm trường siêu dữ liệu (metadata) về nguồn gốc, tác giả, xác minh, độ mới và trạng thái vòng đời. Chưa có hệ thống AI nào đọc các bundle OKF (gói kiến thức đã xuất bản) trong môi trường thực tế hiện nay. Nhưng v0.2 hé lộ, rõ hơn bất kỳ phiên bản nào trước đó, điều mà các pipeline AI (chuỗi xử lý AI tự động) sẽ sớm đòi hỏi từ những nhà xuất bản muốn nội dung của mình được dùng.
OKF là gì và phiên bản 0.2 thay đổi những gì?
Google giới thiệu Open Knowledge Format vào tháng 6/2026, theo blog Google Cloud. Phiên bản đầu tổ chức kiến thức thành các file markdown liên kết với YAML frontmatter (khối siêu dữ liệu máy đọc được ở đầu mỗi file), mỗi file một khái niệm. OKF v0.1 giải quyết vấn đề cấu trúc: các mảnh kiến thức kết nối với nhau như thế nào?
Phiên bản 0.2 thêm một lớp thứ hai với nhiệm vụ hoàn toàn khác: cho phép người đọc hay AI agent (tác nhân AI tự động thực hiện tác vụ) ra quyết định tin cậy ngay tại phần frontmatter, trước khi chạm vào nội dung thực của file. Theo blog Google Cloud, “phần lớn các lần tương tác với một khái niệm không bao giờ thực sự đến bước truy cập thông tin trong phần thân file.” Frontmatter lọc trước. Phần thân chỉ được đọc khi vượt qua bộ lọc.
OKF v0.2 trả lời được năm câu hỏi tin cậy nào?
Theo blog Google Cloud (tháng 7/2026), mỗi khái niệm trong một bundle v0.2 có thể mang tín hiệu để trả lời năm câu hỏi trước khi người hay agent đọc nội dung:
- Nguồn gốc (Provenance): Khái niệm này được rút ra từ những nguồn nào?
- Quy gán (Attribution): Ai tạo ra nội dung này và lần cuối thay đổi đáng kể là khi nào?
- Xác nhận công thức (Attestation): Nếu khái niệm báo cáo một chỉ số, chỉ số đó có được tính theo cách đã phê duyệt không?
- Độ mới (Currency): Khái niệm còn đủ mới, hay đã qua ngày hết hạn tin cậy?
- Trạng thái vòng đời (Lifecycle status): Khái niệm đang hoạt động, đã lỗi thời hay còn là bản nháp?
Các trường mới mang tín hiệu này gồm: sources (với tín hiệu tùy chọn về tác giả, số lần dùng và lần chỉnh sửa cuối), generated (ai tạo nội dung và khi nào), và verified (danh sách xác nhận từ người, quy trình tự động, hoặc cả hai). Tất cả đều tùy chọn. Một bundle không dùng trường nào trong số này vẫn hợp lệ hoàn toàn theo v0.2, theo blog Google Cloud, nhưng “sự vắng mặt của chúng nay mang ý nghĩa: một khái niệm chưa được xác minh có thể phân biệt được với một khái niệm đã được xác minh.”
Tại sao Google cố tình không tạo điểm tin cậy?
Quyết định thiết kế đáng chú ý nhất trong OKF v0.2 là điều Google chọn không xây dựng. Theo blog Google Cloud và Search Engine Journal (cả hai tháng 7/2026), OKF ghi lại tín hiệu thô thay vì tính điểm tin cậy. Lý do được nêu: điểm số “mang tính chủ quan, không dùng chung được giữa các hệ thống, và lỗi thời ngay khi được viết ra.” Mỗi hệ thống tiêu thụ tự đọc tín hiệu và áp dụng trọng số theo cách riêng.
Từ trường verified, ba bậc tin cậy nổi lên:
- Chưa xác minh: Không có mục xác minh nào trong file.
- Xác nhận bởi máy: Xác nhận chỉ từ quy trình tự động.
- Được người xem xét: Ít nhất một người đã ký duyệt.
Theo blog Google Cloud, đây là “tín hiệu tư vấn, không phải kiểm soát truy cập.”
Những trường bạn không thể điền trung thực mới là bài kiểm thực sự
Search Engine Journal (tháng 7/2026) ghi lại quá trình nâng cấp một bundle OKF hiện có lên v0.2. Nhận xét chính: thêm các trường thì nhanh. Điền trung thực thì không.
Trường staleness (ngưỡng độ cũ của thông tin) buộc bạn trả lời một câu hỏi dễ né: nội dung này thực sự lỗi thời nhanh đến mức nào? Tác giả bài SEJ gán cửa sổ tin cậy 3 tháng cho nội dung về llms.txt, vì “câu chuyện xung quanh nó thay đổi liên tục.” Một khung khái niệm ổn định hơn được gán cửa sổ 1 năm. OKF v0.1 để tất cả các khái niệm ngồi yên với độ mới ngầm định như nhau. v0.2 yêu cầu bạn ghi rõ, trên bản ghi chính thức, cái nào sẽ cũ.
Một trường tác giả bài không thể dùng: attestation, được thiết kế cho các bundle công bố chỉ số đã tính kèm công thức tái tạo được phê duyệt. Tính năng đó dành cho pipeline dữ liệu, không phải bản đồ kiến thức biên tập. Nhận ra khi nào một trường không áp dụng cho bundle của mình cũng là một phần giá trị của bài tập này.
Search Engine Journal gọi toàn bộ quá trình là: OKF “là một bài tự kiểm toán mặc bộ quần áo của định dạng xuất khẩu.”
Cần kiểm tra gì trước khi nội dung của bạn đối mặt bộ lọc tin cậy AI?
Search Engine Journal (tháng 7/2026) gợi ý điểm khởi đầu thực tế: lấy trang quan trọng nhất của bạn và áp dụng ba câu hỏi cốt lõi OKF v0.2 đặt ra cho mọi khái niệm. Trước khi đụng vào định dạng, hãy kiểm tra:
- Bạn có thể gọi tên nguồn chính đằng sau mỗi luận điểm quan trọng trên trang đó không?
- Bạn có biết ngày mỗi luận điểm được một người xác minh lần cuối không?
- Có ngày hết hạn tin cậy thực tế không, tức điểm sau đó thông tin cần được kiểm tra lại?
- Nội dung được tạo bởi người, quy trình tự động hay cả hai?
- Với các chỉ số hoặc con số đã công bố, bạn có thể mô tả cách chúng được tính không?
- Các mối quan hệ giữa các khái niệm chính của bạn có được ghi lại ở đâu ngoài đầu ai đó không?
Điều này có ý nghĩa gì với khả năng hiển thị trên AI search?
Pipeline AI đang bắt đầu lọc theo tin cậy trước khi lọc theo độ liên quan. Đây là hệ quả thực tế của v0.2, dù một thương hiệu có bao giờ đụng vào OKF hay không.
Hãy hình dung người dùng hỏi AI assistant về một sản phẩm. Trợ lý không chỉ tìm kết quả liên quan nhất. Nó ngày càng kiểm tra: ai viết bài này, có người xác minh không, và thông tin còn mới không? Một trang sản phẩm không trả lời được câu nào trong số đó có thể bị bỏ qua, không phải vì sai, mà vì agent không có tín hiệu để xác nhận nó đúng. Đối thủ có trang ghi rõ tác giả, có người ký duyệt và ngày xác minh rõ ràng sẽ có lợi thế cấu trúc trong lần lọc đó.
Góc nhìn Hingewise
Câu hỏi thực tế không phải là có nên triển khai định dạng OKF không, mà là: nội dung nào của bạn thực sự có người ký duyệt, và nội dung nào chỉ được đăng mà không ai xác minh lại?
Ba bậc tin cậy của v0.2 phản ánh thực tế vận hành mà nhiều website chưa bao giờ cần nói rõ. Ví dụ cụ thể: một trang giá sản phẩm được công cụ tự động cập nhật thường xuyên, nhưng không có ai kiểm tra kết quả, sẽ ở mức “xác nhận bởi máy” tốt nhất. Người dùng mặc định nghĩ có người đứng sau đó. Thực tế là không. Một bài giải thích khái niệm được viết cẩn thận 3 năm trước và không ai đụng vào kể từ đó có vấn đề ở chiều ngược lại: có người viết nhưng tín hiệu độ mới bằng không.
Một điều các nguồn không đề cập thẳng: thiết kế không dùng điểm số của Google bền vững hơn vẻ ngoài. Điểm tin cậy do chính hệ thống tạo ra mang căng thẳng nội tại vì bạn được yêu cầu chấp nhận phán xét của hệ thống về chính nó. Tín hiệu thô để mỗi hệ thống tiêu thụ tự trọng số theo ngữ cảnh riêng sẽ thích nghi tốt hơn khi các pipeline AI phân kỳ theo cách dùng. Đây là lựa chọn thiết kế rõ ràng, không phải thiếu sót.
Theo đánh giá của Hingewise: nội dung có rủi ro cao và cập nhật thường xuyên như giá, thông số sản phẩm hay số liệu tài chính là nơi xác minh bởi người quan trọng nhất, vì agent hành động dựa trên dữ liệu cũ hay sai ở đây gây hậu quả thực. Nội dung giải thích ổn định, ít thay đổi có thể hợp lý ở mức xác nhận bởi máy. Xử lý tất cả như nhau là bất cập cấu trúc. OKF v0.2 là định dạng mở đầu tiên làm bất cập đó hiện ra trên giấy trắng mực đen.
Điều đáng theo dõi tiếp: Liệu các pipeline AI sẽ tích hợp tín hiệu tin cậy dạng OKF vào bước retrieval (truy xuất thông tin) như thế nào, và Google Search có bắt đầu ưu tiên nội dung mang tín hiệu rõ ràng so với nội dung không khai báo gì không.
Nguồn:
