2026年08月08日 星期六
目录

2.4万亿参数!阿里巴巴发布最新大模型Qwen3.8-Max,性能直追Claude!

人工智能AI2026-08-03
8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max。总参数量达到2.4万亿(激活参数95B),采用稀疏MoE架构与混合注意力机制,上下文长度支持100万Tokens。这是Qwen家族迄今最强大的模型,也是千问首次将Max级别模型开源。01 性能评测权威三方榜单Arena显示,阿里Qwen模型仅次于Anthropic的Claude系列,整体性...

1.jpg

  8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max。总参数量达到2.4万亿(激活参数95B),采用稀疏MoE架构与混合注意力机制,上下文长度支持100万Tokens。这是Qwen家族迄今最强大的模型,也是千问首次将Max级别模型开源。

01 性能评测

  • 权威三方榜单Arena显示,阿里Qwen模型仅次于Anthropic的Claude系列,整体性能处于全球大模型第一梯队;

  • 在科研复现评测PaperBench中,Qwen3.8-Max较上代大幅提升28.2分,以93.0分创下评测新高;

  • 在CodeArena榜中位居全球第四;

  • 在评估智能体电脑操作能力的OSWorld-Verified评测中,以86.1分位居主流模型首位。

02 自主编程质变

  Qwen3.8-Max最核心的突破,在于“自主编程”能力实现了质的跨越。

  两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手;而如今的Qwen3.8,可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人工干预。

  只需一句“创建一个自进化的智能体Harness”,Qwen3.8便像一位资深工程师一样,从零开始自主搭建循环工程框架,编排智能体自动领取和执行任务。人类工程师还可以通过钉钉随时向它提出新要求。模型独立编程运行约16天后,产出了一个Hermes Agent级别的、真实可用的自进化智能体框架“oh-my-cli”。

  整个项目累计完成265次代码提交、127个PR、151个issues,目前已完全开源,完整过程公开保存在GitHub仓库中。

03 高效且专业的办公能力

  在专业办公场景,Qwen3.8-Max的效率提升同样惊人。

  一支法务团队在数百份法律文档中标注千余个相关条款,通常需要一周时间——Qwen3.8一小时内就能完成。

  一个篮球数据分析团队逐帧标注160小时以上的比赛录像,Qwen3.8数十分钟即可精准拆解8400多个攻防回合,并一次性输出球员战术画像和教练报告。

  在量化投资领域,它能调度约330个子智能体协同工作,完成约6000次因子回测。在365天长周期电商经营模拟基准E-Commerce Bench中,Qwen3.8以416,252元的总资金成绩取得第一,实现4.16倍回报。

04 自主复现论文,自我进化

  在科研场景中,Qwen3.8-Max连续自主工作约125小时,成功复现了AI Reasoning相关论文的核心结论,并进行了四轮自我进化探索。

  复现之后,它提出并测试多种改进方案,最终在竞赛级数学基准AIME24上比论文原方法再提升2.7分。

  此外,在阿里云天池平台举办的WWW2025多模态对话意图识别挑战赛中,它在24小时内击败了458支人类参赛队伍。

05 多模态与智能体

  Qwen3.8-Max原生支持视觉理解,上下文长度达1M Tokens。

  它能跨页理解200页的财报,将100小时的长视频组织成可检索、可追溯的Graph记忆。在执行过程中,它会持续审视自己的中间产物,一旦出错便自主定位、重新规划并修正。

  在芯片设计沙箱内,模型历经约500轮交互,将硬件门数从8,298门精简至678门。

06 API定价与开源

  API即日起上线千问AI平台,定价如下:

  国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。

  国际价格仅为Anthropic Opus 5的40%(输入)与24%(输出)。

  千问AI平台还为Token Plan用户推出限时优惠:夜间使用新模型享5折Credits消耗。

  模型权重将于下周正式开源,同时开源Qwen3.8-27B,这是Qwen-Max级别模型首次面向社会开放开源权重。


扫描二维码手机访问

文章目录