首个高考志愿AI测评发布:千问多项表现超过人类志愿咨询师
千问AI高考志愿Agent客观题全对,人类咨询师平均错10.7%
6月23日,友松实验室放出了国内首个高考志愿AI测评报告,测试对象是千问高考志愿Agent——结果它44道客观题全部答对(100%正确率,相当于考试拿满分),而对照组的53名人类志愿咨询师平均只答对89.3%(相当于每10道题错1道多)。
谁做的测评,凭什么能信
友松实验室是一个专注人工智能与教育决策研究的独立团队,不是某家公司的内部部门。他们长期盯着大模型能力评估、教育场景里的AI应用,还有学生升学选择中的信息、认知和决策问题,研究成果已经被多所高校和科研机构拿去用。这次搞的测评基准,目的是给快速冒出来的高考志愿AI产品立一套公开、可复现、可扩展的评估框架,明确AI在当前阶段到底能干啥、不能干啥。
为什么选千问当第一个靶子
群里在传,千问高考Agent是基于夸克8年高考服务数据和经验搭起来的,产品形态、数据积累和用户覆盖在行业里算有代表性,所以报告把它列为第一个测评对象。人类对照组由53名志愿填报咨询师组成,平均从业年限4.6年(差不多是干了快5年的老手)。
测评到底测了什么
测评覆盖四个环节,正好对应考生和家长从查资料、看规则,到排方案、做决策的完整流程:高考志愿基本事实与规则、模拟志愿填报、开放式咨询和志愿推荐报告。每个环节都想看看AI跟人类谁更靠谱。
结果有多猛,数字告诉你
- 客观题:千问44题全对,准确率100%(满分);人类咨询师平均正确率89.3%(相当于错5道左右)。
- 模拟志愿填报:千问给出的方案包含6个可录取志愿,没出现显性偏好违背,而且命中了事后评估的最优结果;人类咨询师平均只给出5.3个可录取志愿(比AI少0.7个)。
- 开放式咨询:评审专家在100场匿名对比中,有58次更倾向千问的版本(也就是58%的情况选AI);千问回答“可直接向学生和家长展示”的比例是56.0%,高于人类咨询师回答的33.0%(相差23个百分点)。有开发者试了说,千问在专业路径拆解、风险提示和表达清晰度上确实更稳定。
报告里那些刺眼的结论
看过报告的人指出,在测评设定的任务范围内,千问的多项表现已经干到了资深人类咨询师的水平,尤其在稳定性、精确性、结构化表达与响应效率上更占便宜。但报告同时捅破了另一层:人类咨询师的价值没法替代。尤其在收入预期、就业判断这种需要结合个体情况谨慎校准的话题上,咨询师更能给贴近实际的建议;在亲子协商、价值取舍这类场景里,结构再完整的AI方案也换不来人与人之间的沟通和判断。
接下来盯着看什么
报告建议,AI更适合高效完成信息核验、资料整理和方案初筛,人类咨询师则可以多聚焦家庭沟通、价值取舍和个性化判断。这会让传统志愿填报咨询机构难受——如果AI能稳定输出90分以上的方案,家长为什么还要花几千块请咨询师?但同时,那些能借助AI做增量、把精力腾给深度沟通的咨询师会受益,毕竟机器搞不定的“人情世故”才是真正的溢价空间。