小红书开源 dots3-note,昇腾 0 Day 适配说明了什么
8 月 14 日,小红书 dots 实验室开源了 dots3-note preview 大模型;第二天(8 月 15 日),华为官微就宣布昇腾完成对该模型的 0 Day 适配。模型发布当天算力平台同步接上,这个"发布即适配"的节奏,比模型本身更值得聊。
这是个什么模型
dots3-note preview 是 dots3 系列的第一个开源版本:280B 总参数、16B 激活参数的 MoE 架构,512K 超长上下文,支持文本、视觉、语音全模态理解,权重挂在 Hugging Face 的 dots-studio/dots3-note-prev。
它的背景牌面不小。据机器之心报道,上个月(7 月)同系列的 dots-note-3.0 在 IMO 2026 国际奥数竞赛中拿下了官方认证的满分 42 分,是 AI 首次做到这件事。这次开源的 preview 版本没有继续卷数学题,而是把重心放在"长程真实生活任务"上——旅行规划、婚礼筹备、开店经营这类没有标准答案、条件会随时变化、可能持续数小时甚至数天的任务。
技术上,dots 实验室公布了两个关键机制:一个是 TEMPO 强化学习方法,把很长的任务轨迹切成多个 macro-step,模型中途从"干活模式"切到"自评模式",用工具和推理估计当前进展的价值,把评价变成训练信号,解决长任务奖励稀疏的问题;另一个是 Self-Critiquing 自评机制,配合主动记忆(官方演示里是一个 memory.md 文件),让模型在环境中边探索边记录规则、自我纠错。他们还开源了两套评测基准 VibeSearchBench 和 VibeLifeBench,据官方数据,Claude Opus 5、GPT-5.5 这类头部模型在这两套基准上都没达到及格线——说明"把能力稳定维持数小时"是全行业都没解决的难题,不是某一家的问题。
0 Day 适配:国产算力生态的关键一步
昇腾这次做的 0 Day 适配,对象是 Atlas 800 A3 和 Atlas 900 A3 SuperPoD 超节点,基于 vLLM Ascend 开源推理引擎,做了三件实事:
- FlashComm 通信优化:把 AllReduce 拆成 ReduceScatter + AllGather,把列向独立算子挪到两阶段通信之间执行,消除多卡间的重复计算,降低推理时延;
-
- FUSED_MC2 通算融合:把 MoE 层原本多段独立的 Kernel 合并成单一大算子,减少 Kernel 启动次数,提升 MoE 推理吞吐;
-
- MTP 投机推理:原生支持模型的多 token 预测能力,单次前向生成多个候选 token 再校验,降低增量解码时延。
这几项都是实打实的推理优化,不是"能跑就行"的糊弄。对开发者来说,意义在于:国产模型 + 国产芯片 + 开源推理框架的闭环正在成型。以前开源一个模型,大家默认等几周甚至几个月才有国产算力适配,现在变成"发布当天就能部署",迁移成本被压到最低。对合规要求高、数据不能出境的企业来说,这是一个现实可选的私有化路径——模型权重在手里,跑在昇腾上,数据全程不出内网。
- MTP 投机推理:原生支持模型的多 token 预测能力,单次前向生成多个候选 token 再校验,降低增量解码时延。
实用部分:怎么用、怎么选、有哪些坑
1. 个人开发者先别急着本地部署。 280B 总参数虽然只激活 16B,但权重本身很大,单张消费级显卡跑不动,需要多卡甚至超节点,个人机器不现实。想体验能力,直接用官方 API 入口(dots.ai/platform)最快;想私有化部署,参考昇腾官方给的 vLLM Ascend 部署文档(docs.vllm.ai 里有 Dots3-Note 的适配教程),先评估手头有多少卡再动手。
2. 想本地研究的话,权重下载用现成工具:
from huggingface_hub import snapshot_download
# 下载 dots3-note preview 权重(体量很大,先确认磁盘空间)
snapshot_download(
repo_id="dots-studio/dots3-note-prev",
local_dir="./dots3-note-prev",
)
```
**3. 选型判断。** 如果你的场景是"多模态输入 + 长程自主任务"(比如读图、规划、跨多步执行),dots3-note preview 值得试;如果只是日常写代码、问答,它不是最优选,同类里专注编程的模型更多。另外 preview 版本官方自己也承认体验和细节还在优化,正式版据称近期也会开源,生产环境接入前先观察。
**4. 几个坑。** 两套 VibeBench 基准是官方自建的,跑分看看就好,第三方独立评测还没跟上;512K 上下文是能力上限,实际长任务里 Agent 的上下文管理做不好,再长的窗口也白搭;还有,同类"长程 Agent"开源模型这周密集发布(DeepSeek V4 Pro 正式版、智谱 GLM-5.3 都主打 Agent 能力),选型时建议拿自己的真实任务横向测一遍,别只看发布稿。
**5. 部署环境提前备好。** 想在内网跑这类 MoE 大模型,光有卡不够:显存、KV cache、多卡通信带宽都得先摸底。280B 总参模型即使量化,单机也吃力,Atlas 900 A3 这种超节点才是目标形态。没有现成集群的团队,可以先在云上租昇腾实例跑通流程,验证稳定性和吞吐再考虑自建,别一上来就买硬件。
## 结尾
模型发布当天算力平台就 0 Day 适配,这个信号比单个模型的跑分更值得关注——大模型竞争已经从"谁的模型强"进入"谁的生态全"的阶段,算力、框架、模型三者绑得越紧,开发者迁移成本越低。国产模型 + 国产芯片这条路,你所在的公司开始认真考虑了吗?评论区聊聊。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐


所有评论(0)