大模型

Qwen3-Max 把 2.4T MoE 开源了,但真正有意思的是 27B

阿里一次放出 2.4T 参数的 MoE 旗舰和 27B 稠密模型,都瞄准 Coding 和 Cowork。开源打到这个量级,开发者今天能拿走哪张牌?

Qwen3-Max 把 2.4T MoE 开源了,但真正有意思的是 27B

阿里这次一口气甩出两张牌。

一张是 Qwen3-Max,2.4T 参数的 MoE 旗舰,对标 GPT-5、Gemini 2.5 Pro、Claude 4.5 Opus 这种闭源天花板。另一张是 Qwen3-27B 稠密模型,单卡/双卡消费级显卡就能跑起来微调。

两个模型同时瞄准两个场景:Coding(代码生成、Agent 编程)和 Cowork(多 Agent 协作)。

牌摊开了,问题就来了——开发者真正会拿走哪一张?


2.4T 这个数字到底意味着什么

先把最大的误解拆掉:MoE 2.4T 不是 2.4T 都在跑

MoE(Mixture of Experts)的全量参数是 2.4T,但每次推理只激活其中一小撮 Expert。Qwen 系列的典型激活比在 10% 以内。换句话说,你看到的"2.4T"更像一份能力目录——模型知道很多事情,但回答一个问题时只调用其中一部分。

这个数字真正的意义在于三件事:

  1. 知识容量上限高。训练阶段压缩进去的模式比稠密模型多。RAG、复杂指令、长链条推理这些吃"见过的题型多"的任务,天然占便宜。
  2. 对标闭源旗舰的姿态。2.4T 这个量级直接放进开源,国内之前没几家敢这么干。Llama 4 Maverick 也就 400B 激活参数、Llama 4 Behemoth 还是 preview。Qwen 这波把开源上限直接跳了一档。
  3. 跑起来的门槛没变低。全量部署 2.4T MoE 依然要一堆 H100/H200,显存按 TB 算。一般开发者碰不到,碰到的也是企业级推理服务商。

所以 Max 这张牌,对绝大多数开发者来说是个信号,不是个工具


27B 才是这波真正的开源炸弹

回头看 27B 稠密模型,这才是开发者今天能上手的那张牌。

几个关键点:

  • 单张 RTX 4090 / 5090 就能跑推理,INT4 量化后 24GB 显存就能塞下
  • 双卡 A100 / H100 可以微调,LoRA / QLoRA 完全可行
  • 稠密架构,没有 Expert 路由那种部署坑,vLLM、SGLang、TensorRT-LLM 现成支持

我自己更在意的是它面向的场景:Coding + Cowork 同时开源

之前开源模型往往"通用还行、Agent 不行"——能写两段代码,但接到 Claude Code、Cline、Cursor 那种工具调用链上就开始掉链子。Qwen 这波把 Coding(代码生成、工具调用、规划)和 Cowork(多 Agent 协作、角色扮演、任务拆解)一起打出来,本质上是在告诉社区:这两条工作流的开源底座我们包了


Coding + Cowork 双线押注

为什么是这两条线?因为钱在那里,人也在那里。

Coding Agent 是 2024 年下半年到 2025 年最拥挤的赛道。Anthropic 把 Claude Code 做成产品级体验,Cursor 估值飙到上百亿,Devin、Cline、Codex CLI 一个接一个。底层模型的能力直接决定这些产品能走多远。

Cowork(协作 Agent) 则是 Agent 框架的主战场。LangGraph、CrewAI、AutoGen 这些框架把"多个 Agent 怎么分工、怎么通信、怎么共享状态"抽象成图 / 状态机。底层模型的角色扮演能力、指令遵循能力、长上下文稳定性,决定了这些框架能撑起多复杂的任务。

Qwen 把 Coding 和 Cowork 两个方向的能力同时开源,等于把这两条线的开源底座做实了。对中国团队来说,复现一个 Cursor 或者 CrewAI 级别的东西,模型这一层不再需要重做。


开源拉到 2T 级,中国团队的反应速度

横向看一眼节奏:

  • Meta / Llama 系列:Llama 3 开到 405B,Llama 4 Maverick 400B 激活、Behemoth 还在 preview
  • Mistral:一直走中小模型路线,Mixtral 系列的 MoE 没破 200B
  • DeepSeek:V3 是 671B MoE,这次之前最接近的开源大模型

Qwen 这次 2.4T MoE 直接跳了一档。背后是工程能力和算力储备的双重赌注。

几个值得注意的细节:

  • 阿里在 2024 年就铺过 Qwen2.5 系列,开源节奏没断过
  • 这次同步放出 Max + 27B,说明团队已经在做"旗舰 + 落地"的产品矩阵化打法
  • 时隔数月回归,一次性把上限拉到对标闭源旗舰的位置——这是给国内大模型竞争定调的动作

对中国开发者来说,最直接的影响是:复现前沿 Agent 模型的模型成本被压到了极低。27B 能跑、能微调、能接到任何 Agent 框架里。Coding 工具链的下一波开源产品,大概率会站在 Qwen 27B 上面。


现在能拿它干嘛

如果你今天就想动手,几个立刻能跑的路径:

1. 拉权重,本地部署 27B

# Hugging Face 上拉 Qwen3-27B
pip install transformers accelerate vllm

# 用 vLLM 起服务
vllm serve Qwen/Qwen3-27B-Instruct \
  --tensor-parallel-size 2 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9

显存需求参考(FP16):
- 单卡推理:≥ 60GB(A100 80G、H100 80G)
- INT4 量化推理:24GB(4090 / 5090 可冲)
- LoRA 微调:双 80G 起步
- QLoRA 微调:单 24G 可行

2. 接 Coding Agent 框架

Qwen 系列的 tool calling 一直是开源里最稳的之一。直接塞到 Claude Code 风格的 CLI 工具里,或者接到 Cline、Roo Code 这种 IDE 插件里,都不用改太多代码。

# 示例:用 OpenAI 兼容协议调用本地 vLLM
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="Qwen/Qwen3-27B-Instruct",
    messages=[
        {"role": "system", "content": "你是一个 Python 工程师"},
        {"role": "user", "content": "帮我写一个 FastAPI 接口,读 CSV 返回 JSON"}
    ],
    tools=[
        {
            "type": "function",
            "function": {
                "name": "run_shell",
                "description": "执行 shell 命令",
                "parameters": {
                    "type": "object",
                    "properties": {"cmd": {"type": "string"}},
                    "required": ["cmd"]
                }
            }
        }
    ]
)

3. 接到 LangGraph / CrewAI

把 base URL 指向本地 vLLM 即可。LangGraph 的 ChatOpenAI 兼容层、CrewAI 的 OpenAI-compatible LLM,都吃这套。

几个要注意的坑

  • 许可证:Qwen 系列多数走 Apache 2.0 或 Qwen 自家 License,商业使用前看清楚细则
  • 显存:27B 全精度吃 54GB 左右,量化是必须的;Max 版本基本告别本地
  • 工具调用:不同 Qwen 子版本对 tool calling 的支持有差异,部署前先跑一下官方 eval

写在最后

Qwen 这波不是"又发了个大模型"那么简单。

它一次性把三个信号同时打出来:开源上限对标闭源旗舰落地能力下沉到消费级显卡Coding 和 Cowork 两个 Agent 战场同时铺底座

对国内做 Coding Agent、Agent 框架、AI IDE 的团队来说,这是一次"模型层不拖后腿"的机会。剩下的拼的是工程、产品和分发——这些才是更难的事。

来源:Latent Space, Qwen 3 Max: 2.4T MoE + 27B Dense Open Sourced, https://www.latent.space/p/ainews-qwen-38-max24t-and-27b-new

来源: https://www.latent.space/p/ainews-qwen-38-max24t-and-27b-new