97AI.PRO
2026-08-24 · AI 资讯

基准测试表现惊人,匿名模型Ox Alpha性能超越主流梯队

被称为“牛来大模型”的Ox Alpha于8月20日在OpenRouter平台正式亮相。尽管其幕后团队身份神秘,但凭借强悍的性能表现,该模型在技术社区引发了广泛关注。在功能定义上,它专为长周期智能体任务及复杂的生产环境编码需求设计,支持文本、图像与视频的多模态输入,并提供了长达104.8万token的超大上下文窗口。

在独立研究员本·戴维斯(Ben Davis)对软件工程基准DeepSWE的评估中,Ox Alpha表现出超越传统巨头的实力。在10个子任务测试中,该模型通过率达到80%,明显优于Claude Fable 5(65%)、GLM-5.3(62%)及GPT-5.6 Sol(52%)。此外,OpenCode智能体已率先接入该模型,并为其预留了每天高达100万亿token的调用上限。

虽然目前这些基准数据尚未被DeepSWE官方排行榜正式收录,但初步测试已展现出Ox Alpha在代码处理逻辑上的巨大潜能。随着更多开发者参与预览测试,该模型极有可能在接下来的AI基建竞争中占据重要的一席之地。

相关模型(97AI 可直接调用)