8月3日,阿里巴巴旗下千问(Qwen)团队正式推出千问3.8-Max。这款模型总参数量高达2.4万亿,激活参数为95B,不仅是千问家族中规模最大、能力最强的成员,也是该系列首次开源Max级别模型的权重。相关权重文件计划于下周在Hugging Face和ModelScope这两个开源社区上线。
在定价策略上,千问3.8-Max通过阿里云旗下的千问AI平台提供API调用服务。具体费用为:输入每百万tokens收费2.0美元,输出每百万tokens收费6.0美元,隐式缓存每百万tokens收费0.25美元。
基准测试结果显示,千问3.8-Max在编程智能体和通用智能体等多项指标上,表现与Anthropic的Fable5相当,部分指标甚至实现了超越。以PaperBench为例,千问3.8-Max得分93.0,高于Fable5的88.8;CoWorkBench得分为74.8,与Fable5的75.9十分接近;WideSearch方面,两者分别取得81.9和81.2的分数,基本持平。
性能层面,千问3.8-Max在多个核心指标上与Anthropic Claude Fable 5保持同步或领先。多模态能力同样亮眼。需要说明的是,Fable 5的部分结果可能涉及回退机制,千问团队已在注释中对此进行了专门说明。
**编程能力:从空文件夹到生产级交付**
为了验证自主编程实力,千问团队选取了三个真实案例进行测试,全程无需人工介入。
第一个案例是十天级的自动编程任务。模型从零开始构建oh-my-cli项目,自主运行约16天,期间累计完成265次commits、提交127个PR并处理151个issues。它成功将用户反馈、社区最佳实践以及自测结果统一纳入工程循环,实现了从需求自动领取、代码生成到测试验证的完整闭环。
第二个案例侧重于复现并超越学术论文。模型独立工作了约125小时,编写了约7,600行代码,执行超过1,100步操作,并完成了33轮GPU训练,完整复现了《Unified Data Selection for LLM Reasoning》论文中的六项主要结论。随后,模型进入“自我进化”阶段,提出并测试了18种改进方案,最终在竞赛级数学基准AIME24上,比原论文方法再提升2.7分。
第三个案例展示了其在挑战赛中的竞争力。在WWW2025多模态对话意图识别挑战赛中,面对526支人类队伍,千问3.8-Max经过45次提交迭代,准确率从0.60提升至0.853,最终击败了其中的458支队伍,胜率达87%。
**办公与长程任务:数百职业场景的生产级验证**
千问团队还在数百种高价值职业场景中,检验了千问3.8-Max的实际交付能力。
在E-Commerce Bench(一项为期365天的电商经营模拟基准)测试中,千问3.8-Max取得了¥416,252的收益,回报倍数达到4.16倍。这一成绩不仅超越了第二名GLM 5.2达38%,较上一代千问3.7-Max也提升了152%。
**芯片设计:500轮交互,面积缩减81%**
在芯片设计优化任务中,千问3.8-Max展现了出色的长程自主规划能力。
此次优化的目标是一个G CD/RSA密码硬件加速器的逻辑门数量。在没有参考设计和人工干预的情况下,模型历经约500轮交互和71次评估,跨越13个关键里程碑,将初始设计的8,298个门优化至678个,在所有参评模型中表现最优。
在物理实现层面,芯片面积从106×106 µm²大幅收缩至46×46 µm²,布线长度由33,369 µm降至4,187 µm。同时,芯片实现了500 MHz频率下的时序闭合,整体面积缩减比例达到81%。
**多模态能力:视觉贯穿执行全流程**
千问3.8-Max的视觉能力并不局限于“看懂图片”,而是作为一种持续的反馈回路,贯穿整个任务执行过程。
在执行任务时,模型会持续观察中间产物——包括检查页面布局、物体方向及动画效果等。一旦发现偏差,它能自主定位问题并进行修正。千问团队将这种能力定义为“原生视觉反馈回路”。
基准测试数据进一步佐证了其实力:在OSWorld-Verified测试中,千问3.8-Max得分86.1,超过Fable5的85.0;AndroidWorld得分为85.3,虽略低于Fable5的88.8但差距极小;而在ParametricCAD Bench中,其得分91.5,超过了Fable5的87.5。
为了方便开发者接入,千问团队还同步推出了千问-MM-Plugins,为各类智能体框架提供图像与视频处理、多模态记忆以及视觉工具调用等扩展支持。
**开放接入:支持Claude Code、Codex等主流框架**
目前,千问3.8-Max已通过千问AI平台提供API服务。该接口支持OpenAI兼容协议和Anthropic兼容协议,可直接集成到Claude Code、Codex、Qoder CLI、千问 Code以及OpenClaw等主流开发工具中。
此外,API还支持reasoning_effort参数来调节推理深度,提供三种模式:xhigh(默认值,适用于复杂任务)、medium(平衡准确性与速度)以及low(侧重优化速度与成本)。
随着模型权重的即将开源,千问3.8-27B也将同步在Hugging Face和ModelScope发布,供社区使用。
