GPT-5 测试被质疑作弊,故意避开难题刷高分
2025 年 8 月 12 日
OpenAI 在 GPT-5 的发布会上因一张比例失调的图表引发争议,随后被发现其在 SWE-bench Verified 测试中仅完成了 477 道题,却展示了 74.9% 的高分,而 Anthropic 的 Claude Opus 4.1 则是在完整 500 道题中获得 74.5% 的成绩。SemiAnalysis 指出,OpenAI 少做的 23 道题可能影响成绩公平性。此外,SWE-bench Verified 测试集由 OpenAI 设计,被质疑存在规则偏向。而在 IOI 2025 竞赛中,OpenAI 的内部模型取得佳绩,但该模型并非公开版本。这些细节引发对测试标准和营销策略的讨论。
2026-09-16
OpenAI 总裁称已进入 AGI 时代,GPT-6 可自主工作 24 小时2026-09-16
OpenAI 将于 10 月 14 日下线 GPT-5.52026-09-09
OpenAI 推出 GPT-Images-2.5,生图快 50%2026-09-06
OpenAI 多次修改 GPT-6 Astra 测试数据,部分成绩大幅变化2026-08-18
GPT-5.6 Sol 视觉能力大幅提升,测试得分暴涨 3 倍2026-08-14
GPT-5.6 Sol 超高速模式已向部分客户群体开放有限预览2026-08-11
OpenAI 全新 GPT Image 模型亮相2026-08-11
OpenAI 推出 GPT-5.6-Cyber 面向安全人员开放更强 AI 能力查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。