Qwen4 家族首度曝光:Max、Flash 与Plus 三线齐发,Qwen4 27B 现身

9 月22 日,阿里巴巴ATH 事业群Token Foundry 的Qwen LLM 项目负责人刘大一恒在2026 云栖大会登台演讲,讲题是《Qwen:迈向真实世界智能体》。但台上的大萤幕却打出「Qwen4 系列Coming Soon」,下方并列三个名字:Qwen4-Max、Qwen4-Flash & Qwen4-Plus、Qwen4-27B。这是Qwen4 家族第一次公开露面。整场演讲没有宣布任何模型上线,Qwen4 目前仍在训练阶段,阿里端出来的是路线图,并不是能下载的模型。

Qwen4 家族首度曝光:Max、Flash 与Plus 三线齐发,Qwen4 27B 现身- 榜哥

Max 攻能力上限,Flash 与Plus 顾CP 值,27B 留给本机

据至顶网在现场的报导,刘大一恒给出的Qwen4 规划分成三条线:以Max 追求能力上限,以Flash 和Plus 兼顾效率与价格,另外提供面向本地部署的27B 版本。

27B 出现在Qwen4 名单里,社群的反应最直接。 X 上有人留言「有27B 就行」,也有人追问上一代的35B 是不是不做了。 这个尺寸会被期待,是因为Qwen3.8-27B 在9 月16 日成为Hugging Face 史上获赞数最多的开源大模型,超越FLUX.1、DeepSeek-R1、Kimi-K3 等热门模型。

Qwen4 还在训练,5 兆到10 兆是Qwen4.5 与Qwen5 的目标

刘大一恒把Scaling 称为迈向ASI 的路径。他回顾Qwen2.5 时代的旗舰规模是72B,如今Qwen3.8-Max 的总参数已达2.4T,两年间增加约33 倍;基于新架构的Qwen4 已投入训练,后续Qwen4.5、Qwen5 计画把总参数量推向5 兆至10 兆。

Qwen4 家族首度曝光:Max、Flash 与Plus 三线齐发,Qwen4 27B 现身- 榜哥
SOURCE

刘大一恒1993 年生,2020 年入选华为「天才少年计画」,2021 年转往阿里巴巴达摩院,主导Qwen1 到Qwen3.5 全系列的预训练。今年3 月前负责人林俊旸离职、周靖人转任首席科学家之后,他接下Qwen 的统筹工作,这次也是他第一次站上云栖大会主论坛。

RSI 的对外实证,一个月跑完33 轮

阿里在大会上把递回自我改进(Recursive Self-Improvement,RSI)的成果摊开来讲。 Qwen3.8-Max 已能在训练流程里自行搭建训练步骤、构造训练资料、设计实验并定位缺陷,在人类完全没有参与的情况下运作超过一个月,完成33 轮有效迭代,Artificial Analysis 指数从40 分升到45 分,提升12.5%。

同一套机制也被带到推理与晶片设计。 Qwen3.8-Max 在先前没接触过的平头哥新款GPU 上,自行调校下一代Qwen3.8-Flash 的推理框架,单一实例的吞吐量提升96%。在工业级EDA 环境中,它只拿到一份真实的汇流排模组规格,自主执行超过60 小时、调用工具逾万次,最后把晶片面积缩减42%、标准元件数量降低29%、功耗降低59.5%。

新架构先开源,Qwen3.8-Flash 训练成本剩九分之一

Qwen 官方帐号早在8 月26 日就把Qwen3.8-Flash 权重开源,并说明它属于Qwen4 架构的前导版本:125B 参数外加51B N-gram 嵌入,每个token 只激活约6B,训练成本约为Qwen3.7-Plus 的九分之一,原生262K 上下文,可通过YaRN 延伸至1M。

价格也一并公布。正式版在QwenCloud API 上线后,每百万input token 收0.16 美元(约NT$5.2),每百万output token 收0.47 美元(约NT$15.3)。阿里同时交出开源成绩单:已开源460 多个Qwen 模型,累计下载超过30 亿次,社群衍生的模型超过30 万个。 大会上另公布,光是最近一个月,Qwen3.8 相关模型的下载量就超过5,600 万次,衍生模型超过1,900 个。

全模态、语音与视频模型同步更新

Qwen4 之外,阿里在同一场大会上更新了其他模态的模型。全模态模型Qwen3.8-Omni 把视频、音讯、图片与文字纳入同一套理解框架,阿里称整体成本较上一代降低90% 以上,现场展示的应用包括从长片素材自动剪出成片,以及依一句话为音乐生成MV。

语音家族Qwen-Audio-3.1 分成语音转写、语音合成与即时互动三条产品线,另有基于新架构的Qwen-Audio-3.1-ASR-Next 与TTS-Next 两款新模型;同传模型Qwen3.8-LiveTranslate 首次登场,字均延迟从2.8 秒降到2.3 秒,而人类同传的平均延迟在4 秒以上。视频生成方面,Wan3.0 支援单次生成30 秒视频,在Artificial Analysis 的文生视频与视频两个榜单都排第一。阿里巴巴ATH 技术副总裁郑波在现场说,三年内会出现一个原生全模态统一模型,体验不再受模态边界限制。

结语

把27B 放进Qwen4 家族,说明阿里的开源路线没有收手;把5 兆到10 兆参数写进时程,也让下一代模型的训练成本问题更早浮上台面。接下来要盯Qwen4-27B 开出什么授权条件,以及本机硬体门槛落在哪里,这决定它能不能复制Qwen3.8-27B 在社群带起的本机部署热度。

赞 (0)
摩榜哥摩榜哥

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注