2026-09-07 · AI 资讯
数据频繁更迭引发争议,OpenAI面临大模型基准测试信任危机
OpenAI近期发布的GPT-6 Astra在测试数据上引发了行业争议。由于发布后页面多次变动且关键幻觉率指标在短时间内反复调整,外界对该模型评测数据的准确性产生了强烈质疑,不少观点直指其存在“刷榜”行为。
OpenAI对此回应称数据调整是为了获取“最佳真实估计值”,并强调测试条件的影响。然而,类似的数据罗生门现象此前在多家头部AI厂商身上均有发生,严重损害了行业基准测试的公信力。
业内专家呼吁行业应尽快建立透明且统一的评测规范,强制要求公开所有测试条件。当前的信任危机已对企业客户及投资者的判断构成负面影响,显示出单纯的性能指标已无法维持AI公司的市场叙事。
