谷歌搜索 AI 概览准确率仅 90%,易受虚假信息影响
谷歌 AI 概览准确率 90%,但每小时可能吐 5700 万条错误答案
《纽约时报》近日报道,谷歌的 AI 概览(AI Overviews) 准确率约为 90%。这一数据的背后是每年超过 5 万亿次的搜索量——相当于每秒钟 158 万次搜索,意味着每小时可能会生成超过 5700 万条错误答案,平均每分钟接近 100 万条错误信息。这准确率听起来还行,但乘以搜索量就知道问题有多大。
初创公司 Oumi 对谷歌搜索进行评估,采用 SimpleQA 基准分析了 4326 次搜索结果。结果显示,谷歌的 Gemini 2 在去年 10 月的准确率为 85%,而到今年 2 月,Gemini 3 这一数字提升至 91%。看起来进步了,但群里在传 Oumi 的评估方法主要依赖于 AI 工具,这可能导致数据偏差。此外,谷歌对同一搜索查询可能生成不同的概览,增加了结果的不确定性。
错误比例不降反升
具体来看,AI 概览与原始信息来源不符的比例已从 Gemini 2 的 37% 上升至 Gemini 3 的 56%。有开发者试了说,这意味着用户在看到某些概览时,往往会发现与之不符的链接,或者准确的概览中却引用了错误的信息。更离谱的是,有记者甚至发布虚假博客后,谷歌在次日的概览中引用了相关内容——显示 AI 概览容易被操纵。
用户遭遇自相矛盾
用户 斯蒂芬·潘瓦西 在搜索摔跤手 胡克·霍根(Hulk Hogan) 的死讯时,AI 概览明确表示 “没有可信报告显示霍根已去世”,但页面下方却出现了 “霍根之死谜团加深” 的文章标题。这一自相矛盾的现象引发了用户对 AI 生成内容的可靠性质疑。
面对这些问题,谷歌发言人出来反驳,认为 Oumi 的测试方法并未能真实反映搜索行为。有开发者指出,这种回应像是在甩锅,毕竟虚假博客被当天引用是实打实的事。
接下来盯着看什么
谷歌内部会不会调整 AI 概览的触发逻辑?这会让做内容审核和事实核查的公司难受,但可能会让那些靠标题党蹭流量的网站受益——只要 AI 概览还在瞎引用,他们就有机会。