阿里Qwen3.8-Max上线:2.4万亿参数,OSWorld计算机使用基准跑赢GPT-5.6和Fable 5

📅 2026-08-04 👁 45 阅读

阿里巴巴发布Qwen3.8-Max,2.4万亿参数MoE模型,OSWorld计算机使用基准86.1分超越GPT-5.6 Sol Max和Fable 5。API定价仅为Opus 5的1/3,权重下周开源。

阿里巴巴千问团队昨晚发布Qwen3.8-Max,一款2.4万亿参数的混合专家(MoE)多模态大模型,直指自主软件工程和长周期企业任务这一前沿赛道。

最引人注目的数据来自OSWorld-Verified基准——衡量AI智能体在桌面环境中操作能力的测试。Qwen3.8-Max拿到86.1分,超过GPT-5.6 Sol Max的83.2和Fable 5的85.0。它还在PaperBench(93.0)、TerminalBench 2.1(86.6)、Vision2Web(69.0)等基准上领先。

阿里展示了几个实际场景:从空文件夹出发,独立完成一个16天的软件项目;把法务团队一周的审阅量压缩到一小时;在数千轮交互中持续迭代芯片设计方案。这些演示来自官方,尚未被独立验证。

价格方面,Qwen3.8-Max API定价为每百万token输入2美元、输出6美元,不到Claude Opus 5总价的1/3,不到GPT-5.6 Sol Max的1/4。国内定价为每百万token输入12元、输出36元。对于需要大量token的智能体工作流,这个价差会快速放大。

阿里宣布权重将于下周开源,同时开源Qwen3.8-27B。但许可证尚未公布——如果采用Apache 2.0等宽松许可,将首次允许企业自部署Max级千问模型;如果像月之暗面Kimi K3那样使用限制性自定义许可,影响会打折扣。

在Arena榜单上,Qwen整体排名仅次于Anthropic Claude系列,处于全球第一梯队。