资讯
Task-Aligned vs. Human-Aligned: Why AI’s Next Benchmark Should Be Us
📋总体概括
作者借斯坦福2026年AI指数报告的数据指出,前沿模型在专为AI设计的难题基准Humanity's Last Exam上一年内提升约30个百分点,行业惯于将刷榜高分视为AI进步的铁证。但作者提出质疑:现有评测是任务对齐而非人类对齐,衡量的是机器擅长之事,而非人类真正需要的能力。文章呼吁AI的下一条基准应以人为尺度,关注模型能否贴合人类真实需求与价值,而非单纯追逐分数。
⚡关键信息
- ▸斯坦福2026年AI指数报告显示,前沿模型在Humanity's Last Exam上一年内提升约30个百分点
- ▸Humanity's Last Exam是专为让AI难以通关而设计的基准,原本的「难关」正被迅速攻破
- ▸过去需数年才能实现的性能跃升,如今几个月即达成,排行榜每隔数月就被洗牌一次
- ▸作者不否认模型能力,但认为现有评测体系是任务对齐,忽略了人类对齐这一更关键维度
- ▸文章主张下一代AI基准应以人类真实需求为衡量标准,而非继续优化机器擅长的任务分数
🔥犀利点评
刷榜文化是AI行业最省事的自嗨:出题人专为AI设计考卷,再为AI考高分欢呼,闭环完美但与社会需求几乎无关。30个百分点的跃升证明了算力和数据的威力,也恰恰暴露了评测的空洞——当基准被快速刷穿,它度量的就不再是智能,而是过拟合的速度。作者点破的「人对齐」方向才是真问题,但恐怕没人愿意做,因为对齐人类无法写进发布会PPT。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文 →