全球知名AI评测机构Artificial Analysis近日正式将智能基准评分系统升级至v4.2版本。新版测试体系引入了大量更复杂、高度贴近真实工作场景的实操题目,同时新增了大量不对外公开的私有测试集,从根源上遏制AI模型通过针对性训练“应试刷分”的行业乱象。受本次评测规则升级影响,多款此前在旧版榜单中排名靠前的主流AI模型,新版得分均出现大幅下滑。这一变化直接推动市场重新审视过往各类AI排行榜的参考可信度,也标志着全球AI评测机构开始正视并着手解决基准测试容易被“应试技巧”操纵的行业痛点,推动AI评测体系向更贴合真实使用体验的方向迭代。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



