Thống Kê Ảo Giác AI (2026): Hơn 40 Số Liệu Về Tỷ Lệ, Benchmark, Và Lý Do Chúng Không Khớp Nhau

Thống kê ảo giác AI 2026: tỷ lệ bảng xếp hạng Vectara, khoảng 22-94% theo Stanford HAI, lý do benchmark làm thay đổi kết quả, và cách đọc tuyên bố của nhà cung cấp.

Cùng một mô hình có thể được đo ở mức 0,7% và 7,6% ảo giác tùy vào benchmark được chạy, và trên 26 mô hình hàng đầu, Stanford HAI ghi nhận khoảng dao động từ 22% đến 94%. Độ chênh lệch đó là sự thật quan trọng nhất về thống kê ảo giác AI năm 2026: thiết kế benchmark quyết định con số nổi bật nhiều hơn hẳn chất lượng mô hình. Tóm tắt bám sát nguồn, nơi mô hình được đưa sẵn văn bản gốc, tạo ra những con số đẹp đẽ xuất hiện trong tài liệu của nhà cung cấp. Các bài kiểm tra open-recall, vốn gần với cách con người thực sự sử dụng những hệ thống này hơn, cho ra những con số tệ hơn cả một bậc độ lớn. Các số liệu dưới đây đến từ bảng xếp hạng ảo giác của Vectara và AI Index 2026 của Stanford HAI.

TL;DR

  • Tỷ lệ ảo giác được báo cáo năm 2026 dao động từ khoảng 0,7% đến 94% tùy theo benchmark (Vectara, Stanford HAI)
  • Gemini-2.0-Flash-001 đạt 0,7% trên tóm tắt bám sát nguồn (Vectara)
  • Cũng mô hình đó đạt 7,6% theo benchmark FaithJudge của Vectara (Vectara)
  • Đó là mức chênh lệch khoảng mười một lần đối với cùng một mô hình (được suy ra)
  • Stanford HAI ghi nhận 22% đến 94% trên 26 mô hình hàng đầu (Stanford HAI, 2026)
  • Các con số đó đo lường ảo giác do xu nịnh gây ra (Stanford HAI, 2026)
  • Đợt làm mới tháng 11 năm 2025 của Vectara sử dụng hơn 7.700 bài viết (Vectara)
  • Đợt làm mới được thiết kế để khó hơn đáng kể (Vectara)
  • Tỷ lệ đo được tăng lên trực tiếp do bài kiểm tra khó hơn (Vectara)
  • Các hàng tốt nhất trên bảng xếp hạng tóm tắt bám sát nguồn ở khoảng 1,8% (Vectara)
  • Các phát hiện của Stanford xuất hiện trong chương Responsible AI (Stanford HAI, 2026)
  • Tóm tắt bám sát nguồn cung cấp cho mô hình văn bản gốc (Vectara)
  • Các benchmark open-recall đòi hỏi mô hình tự tạo ra sự kiện mà không có trợ giúp (Stanford HAI)

1. Khoảng Dao Động Chính Là Số Liệu Thống Kê

Bất kỳ ai trích dẫn một tỷ lệ ảo giác duy nhất đều đang mô tả một benchmark, chứ không phải hiện tượng thực sự. Các tỷ lệ được công bố năm 2026 chạy từ khoảng 0,7% ở đầu tốt nhất của bảng xếp hạng tóm tắt bám sát nguồn của Vectara cho đến khoảng 22% đến 94% trên 26 mô hình hàng đầu mà Stanford HAI thử nghiệm. Đây không phải là những ước tính cạnh tranh cho cùng một đại lượng, mà là các phép đo của những nhiệm vụ khác nhau, và khoảng cách giữa chúng lớn hơn hai bậc độ lớn.

Chỉ sốGiá trịNguồn
Tỷ lệ thấp nhất được công bố, tóm tắt bám sát nguồn0,7%Vectara
Các hàng có kết quả tốt nhất trên bảng xếp hạng đókhoảng 1,8%Vectara
Khoảng dao động trên 26 mô hình hàng đầu22% đến 94%Stanford HAI, 2026
Mô hình đạt con số 0,7%Gemini-2.0-Flash-001Vectara
Cùng mô hình đó theo FaithJudge7,6%Vectara
Tỷ lệ giữa hai phép đo nàykhoảng 11xSuy ra từ số liệu của Vectara
Khoảng cách giữa tỷ lệ công bố thấp nhất và cao nhấthơn hai bậc độ lớnSuy ra
Yếu tố quyết định con sốthiết kế benchmarkVectara, Stanford HAI

Khoảng cách mười một lần đối với cùng một mô hình trên hai benchmark của cùng một tổ chức là bằng chứng rõ ràng nhất hiện có cho thấy những con số này mô tả các bài kiểm tra chứ không phải các mô hình.

Điều này kéo theo một hệ quả thực tiễn thường bị bỏ qua trong các cuộc thảo luận về benchmark. Nếu bạn đang chọn một mô hình cho ứng dụng dựa trên retrieval, nơi hệ thống luôn cung cấp tài liệu nguồn, thì các con số tóm tắt bám sát nguồn mới là con số phù hợp, và tỷ lệ dưới 2% là một kỳ vọng hợp lý. Nếu bạn đang chọn một mô hình để trả lời câu hỏi từ chính kiến thức của nó, thì cũng những con số đó lại gây hiểu lầm nghiêm trọng, và dải 22% đến 94% mới gần với thực tế mà bạn nên chuẩn bị. Phần lớn sự thất vọng khi triển khai thực tế với các hệ thống này bắt nguồn từ việc một đội đã benchmark theo một cách rồi triển khai theo cách khác. Benchmark không sai, nó chỉ đang trả lời một câu hỏi khác với câu hỏi mà việc triển khai đặt ra. Nguồn: bảng xếp hạng ảo giác của Vectara.

2. Tóm Tắt Bám Sát Nguồn: Bài Kiểm Tra Lạc Quan

Benchmark cho ra các con số dưới 1% đang làm một việc cụ thể và hẹp. Tóm tắt bám sát nguồn đưa cho mô hình một tài liệu nguồn và kiểm tra xem bản tóm tắt sinh ra có trung thành với tài liệu đó hay không, điều này loại bỏ yêu cầu mô hình phải biết bất cứ điều gì. Đây là một phép đo thực chất và hữu ích cho một kiểu lỗi, và cũng là phép đo mà các nhà cung cấp hay trích dẫn.

Chỉ sốGiá trịNguồn
Nhiệm vụ được đo lườngđộ trung thành của bản tóm tắt với văn bản nguồn được cung cấpVectara
Tỷ lệ thấp nhất ghi nhận được0,7%Vectara
Dải kết quả tốt nhất thông thườngkhoảng 1,8%Vectara
Số bài viết trong đợt làm mới tháng 11 năm 2025hơn 7.700Vectara
Mục tiêu thiết kế của đợt làm mớilớn hơn, chắc chắn hơn, khó hơnVectara
Tác động của đợt làm mới lên tỷ lệ đo đượccao hơnVectara
Điều mà nhiệm vụ này không kiểm trakhả năng nhớ lại sự kiện không có trợ giúpSuy ra
Lý do các nhà cung cấp trích dẫn nóvì nó cho ra những con số thấp nhấtSuy ra

Chi tiết về đợt làm mới này quan trọng hơn vẻ ngoài ban đầu của nó: ảo giác đo được tăng lên vì bài kiểm tra trở nên khó hơn, chứ không phải vì mô hình kém đi, điều đó có nghĩa là các so sánh theo từng năm trên bảng xếp hạng này không đáng tin cậy khi có sự thay đổi phiên bản. Nguồn: Vectara nói về thế hệ tiếp theo của bảng xếp hạng ảo giác.

3. Open Recall: Bài Kiểm Tra Bi Quan

Các benchmark cho ra những con số hai chữ số và gần ba chữ số đang kiểm tra một điều gì đó gần với cách sử dụng thực tế hơn nhiều. Stanford HAI ghi nhận tỷ lệ ảo giác từ 22% đến 94% trên 26 mô hình hàng đầu trong một benchmark về độ chính xác được báo cáo trong chương Responsible AI năm 2026 của họ. Khi một mô hình phải cung cấp sự kiện từ chính tham số của nó thay vì từ một tài liệu đặt trước mặt, tỷ lệ lỗi tăng vọt.

Chỉ sốGiá trịNguồn
Tỷ lệ thấp nhất trong số 26 mô hình22%Stanford HAI, 2026
Tỷ lệ cao nhất trong số 26 mô hình94%Stanford HAI, 2026
Số mô hình hàng đầu được thử nghiệm26Stanford HAI, 2026
Chênh lệch giữa mô hình tốt nhất và tệ nhất72 điểmSuy ra từ số liệu của Stanford
Chương báo cáo phát hiện nàyResponsible AIStanford HAI, 2026
Kiểu lỗi được đo lườngảo giác do xu nịnh gây raStanford HAI, 2026
Ngày công bố AI IndexTháng 4 năm 2026Stanford HAI
So sánh với tỷ lệ tóm tắt bám sát nguồncao hơn rất nhiềuSuy ra

Chênh lệch 72 điểm giữa mô hình hàng đầu tốt nhất và tệ nhất trên cùng một bài kiểm tra tự nó đã đáng chú ý: lựa chọn mô hình có ý nghĩa cực kỳ lớn ở nhiệm vụ này, nhưng lại gần như không quan trọng ở tóm tắt bám sát nguồn, nơi mọi kết quả đều tập trung ở mức một chữ số thấp. Nguồn: Báo cáo Stanford HAI AI Index 2026.

4. Xu Nịnh Là Một Kiểu Lỗi Riêng Biệt

Cách đóng khung của Stanford đáng được tách riêng khỏi sai sót thông tin thông thường. Ảo giác do xu nịnh gây ra nghĩa là mô hình chiều theo một tiền đề mà người dùng đưa ra, ngay cả khi tiền đề đó sai, đây là một cơ chế khác với việc mô hình đơn giản là không biết điều gì đó. Điều này cũng có nghĩa là tỷ lệ đo được phụ thuộc một phần vào cách câu hỏi được đặt ra, chứ không chỉ vào những gì mô hình biết.

Chỉ sốGiá trịNguồn
Kiểu lỗichiều theo một tiền đề sai của người dùngStanford HAI, 2026
Khoảng tỷ lệ giữa các mô hình22% đến 94%Stanford HAI, 2026
Các mô hình được đánh giá26 mô hình hàng đầuStanford HAI, 2026
Khác biệt so với sai sót thông tin thông thườngcơ chế khác nhauStanford HAI, 2026
Mức phụ thuộc vào cách đặt câu hỏicaoSuy ra
Chương báo cáoResponsible AIStanford HAI, 2026
Phát hiện rộng hơn của AI Index về việc báo cáomức công khai về AI có trách nhiệm chậm hơn năng lựcStanford HAI, 2026
Hàm ý đối với việc đánh giáthiết kế câu lệnh là một phần của phép đoSuy ra

Hệ quả thực tiễn khiến bất kỳ ai triển khai các hệ thống này cũng thấy khó chịu: một mô hình có thể rất chính xác khi được hỏi trung lập và rất kém tin cậy khi người dùng khẳng định một điều sai trước. Bối cảnh triển khai được đề cập trong bài thống kê áp dụng AI trong doanh nghiệp của chúng tôi. Nguồn: Stanford HAI, 12 điểm rút ra từ AI Index 2026.

5. Cách Đọc Một Tuyên Bố Của Nhà Cung Cấp

Kết luận thực tiễn là một danh sách kiểm tra ngắn gọn. Một tuyên bố tỷ lệ ảo giác dưới 1% gần như chắc chắn là kết quả tóm tắt bám sát nguồn, nơi mô hình được cung cấp sẵn tài liệu gốc, và nó không nói lên điều gì về khả năng nhớ lại không có trợ giúp. Câu hỏi đúng không bao giờ là “tỷ lệ ảo giác là bao nhiêu” mà là “trên benchmark nào, ở nhiệm vụ nào, với cỡ mẫu ra sao”.

Chỉ sốGiá trịNguồn
Điều mà một tuyên bố dưới 1% thường đo lườngtóm tắt bám sát nguồnVectara
Điều mà nó không đo lườngkhả năng nhớ lại sự kiện không có trợ giúpSuy ra
Tỷ lệ của cùng mô hình đó trên một bài kiểm tra nội bộ khó hơn7,6%Vectara
Dải tỷ lệ trên các bài kiểm tra kiểu open-recall22% đến 94%Stanford HAI, 2026
Số bài viết trong bộ dữ liệu kiểm tra hiện tại của Vectarahơn 7.700Vectara
Số mô hình nằm trong khoảng của Stanford26Stanford HAI, 2026
Những câu hỏi cần đặt ra với bất kỳ tuyên bố nàobenchmark nào, nhiệm vụ nào, cỡ mẫu nàoSuy ra
Việc so sánh giữa các nguồn có hợp lệ hay khôngkhông, nếu phương pháp không khớp nhauSuy ra

Các triển khai dựa trên retrieval thực sự nằm gần đầu lạc quan hơn, vì chúng tái tạo lại đúng điều kiện của benchmark lạc quan, đó là cách hợp lý duy nhất để sử dụng những con số thấp đó. Điều ngược lại cũng đúng: một chatbot trả lời các câu hỏi mở mà không có retrieval nên được đánh giá theo dải bi quan, và việc trích dẫn con số bám sát nguồn cho sản phẩm đó là một sai lầm về phạm trù chứ không chỉ là phóng đại. Bối cảnh về tìm kiếm và retrieval được đề cập trong bài thống kê tìm kiếm AI của chúng tôi, còn bối cảnh về bức tranh mô hình nằm trong bài thống kê AI mã nguồn mở. Nguồn: Đánh giá độ trung thành của LLM trong RAG bằng các bảng xếp hạng đang phát triển.

Tóm Tắt: Ảo Giác AI Qua Các Con Số

Chỉ sốGiá trịNguồn
Tỷ lệ thấp nhất được công bố0,7%Vectara
Dải kết quả tốt nhất, tóm tắt bám sát nguồnkhoảng 1,8%Vectara
Cùng mô hình đó theo FaithJudge7,6%Vectara
Tỷ lệ giữa các phép đo nàykhoảng 11xSuy ra
Khoảng dao động trên 26 mô hình hàng đầu22% đến 94%Stanford HAI
Chênh lệch giữa mô hình tốt nhất và tệ nhất72 điểmSuy ra
Số mô hình được Stanford HAI thử nghiệm26Stanford HAI
Kiểu lỗi mà Stanford đo lườngảo giác do xu nịnh gây raStanford HAI
Số bài viết trong bộ dữ liệu kiểm tra đã làm mới của Vectarahơn 7.700Vectara
Mục tiêu thiết kế của đợt làm mớikhó hơnVectara
Tác động lên tỷ lệ đo đượccao hơnVectara
Nhiệm vụ trong tóm tắt bám sát nguồntrung thành với nguồn được cung cấpVectara
Nhiệm vụ trong các benchmark open-recalltự tạo ra sự kiện không có trợ giúpStanford HAI
Chương báo cáo tại Stanford HAIResponsible AIStanford HAI
Ngày công bố AI IndexTháng 4 năm 2026Stanford HAI
Khoảng dao động trên toàn bộ các tỷ lệ được công bố năm 2026hơn hai bậc độ lớnSuy ra

Phương Pháp Và Nguồn

  • Các tỷ lệ tóm tắt bám sát nguồn, phần so sánh FaithJudge và đợt làm mới bộ dữ liệu kiểm tra tháng 11 năm 2025 đến từ bảng xếp hạng ảo giác công khai của Vectara cùng tài liệu đi kèm (kho lưu trữ bảng xếp hạng, thông báo về bảng xếp hạng thế hệ mới).
  • Khoảng 22% đến 94% trên 26 mô hình hàng đầu, cách đóng khung về xu nịnh và bối cảnh chương Responsible AI đến từ AI Index 2026 của Stanford HAI, công bố vào tháng 4 năm 2026 (báo cáo, các điểm rút ra, trang chủ AI Index).
  • Bối cảnh phương pháp luận về lý do thiết kế bảng xếp hạng quyết định độ trung thành đo được đến từ các nghiên cứu đã công bố về các benchmark RAG đang phát triển (arXiv).
  • Lưu ý về dữ liệu: các số liệu trong bài tổng hợp này không được lấy trung bình, so sánh hay trình bày như một tỷ lệ duy nhất. Vectara đo độ trung thành với một tài liệu được cung cấp; Stanford HAI đo một kiểu lỗi khác trong những điều kiện khác. Đợt làm mới tháng 11 năm 2025 của Vectara đã chủ động tăng độ khó của bài kiểm tra, vì vậy các tỷ lệ trước và sau thay đổi đó không thể so sánh với nhau, và sự suy giảm biểu kiến có thể phản ánh bài kiểm tra khó hơn chứ không phải mô hình kém đi. Các số liệu riêng theo từng mô hình thay đổi nhanh chóng khi phiên bản mới ra mắt, và bất kỳ kết quả nào của một mô hình cụ thể cũ hơn một quý nên được xem là đã lỗi thời. Phép đo xu nịnh của Stanford phụ thuộc vào cách đặt câu lệnh, đây là một phần của thiết kế thử nghiệm chứ không phải một đặc tính cố định của các mô hình. Vectara là nhà cung cấp thương mại các sản phẩm AI dựa trên retrieval, điều này khiến họ có lợi ích trong các benchmark mà việc bám sát nguồn (grounding) cho kết quả tốt. Các hàng được đánh dấu là suy ra là các phép tính số học hoặc suy luận trực tiếp từ các số liệu đã công bố.
  • Cập nhật lần cuối: ngày 2 tháng 8 năm 2026. Chúng tôi cập nhật bài tổng hợp này theo quý khi Vectara làm mới bảng xếp hạng và Stanford HAI công bố các phiên bản AI Index mới.

Dùng thử VoxBooster — 3 ngày dùng thử miễn phí.

Nhân bản giọng thời gian thực, soundboard và hiệu ứng — ở mọi nơi bạn đã nói chuyện.

  • Không cần thẻ tín dụng
  • ~30ms độ trễ
  • Discord · Teams · OBS
Dùng thử miễn phí 3 ngày