返回研究
Model Card whaletech / W1-4B-dLLM-Base · 2026 · 04

W1-4B-dLLM-Base

强大的语言建模,不一定只能依赖自回归。

Hugging Face 技术 README 体验 W1-Instruct
Whaletech 横幅
W1-4B dLLM 演示

技术使用与推理文档:TECHNICAL_README.md

✨ 概述

W1-dLLM 是一个扩散式语言模型。

它建立在一个简单、但如今越来越清楚的想法之上:

强大的语言建模,不一定只能依赖自回归。

而今天,这个判断第一次不再只是一个猜想。

我们看到了一组非常有分量的结果同时出现:

  • 稳定的优化过程
  • 在灵活长度文本上的真实扩展能力
  • 强烈的自我修改与纠错能力
  • 小参数模型上的明显泛化
  • 以及越来越明确的信号:扩散式语言模型正在走出过去"半自回归"的过渡状态

它开始展现的,是一种更本质的能力:

真正的并行生成能力。

这个模型不只是会生成文本。

它更像是在隐空间里先形成、再修改、再细化自己的表达,然后才把它稳定地落实到语言之中。

在某个中期 checkpoint,当模型第一次展现出这种能力的时候,全公司的人聚集在同一个屏幕前,仿佛在看新生儿的降临。

而这件事,非常重要。


🧠 模型结构

W1-dLLM 采用基于扩散 Transformer 的语言建模结构,而不是标准的自回归解码器。

核心配置

  • 48 个扩散 Transformer 模块
  • 若结合输入嵌入层与最终输出层,可视为 50 层模型
  • 词表大小:64,512
  • 隐藏维度:2,048
  • 注意力内部维度:3,072
  • 前馈网络维度:7,168

关键组件

  • 时间步嵌入
  • 旋转位置编码
  • 自适应层归一化调制
  • 均方根归一化
  • SwiGLU 前馈网络

我们认为最关键的几点

1. 扩散 Transformer 结构本身非常重要

这不是"换一个外壳",而是能力成立的基础。

2. 自适应 LayerNorm 调制非常关键

没有它,扩散过程中的条件控制和训练稳定性都会明显受影响。

3. 一些经典自回归 Transformer 优化可以迁移

例如,扩大注意力内部维度依然有效。

4. 双向注意力必须从预训练阶段就一起设计

双向能力不能只在推理阶段"补"出来。

如果希望模型真正并行地思考、修订、收敛,就必须在结构和预训练阶段一起设计。


⚙️ 训练特征

这次训练里,一个非常重要的工程结论是:

扩散式语言模型需要足够大的 batch size。

在我们的训练中,当 batch size 超过 500 之后,模型的训练状态、稳定性和效率都会明显更好。

这和很多自回归训练经验并不完全一致,也说明扩散式训练在规模化时有自己独特的最优区间。

硬件利用

我们同时观察到,训练过程中 模型浮点运算利用率稳定在约 45%

这个数字非常重要。

它说明这条路线并不只是"理论上并行",而是已经在真实硬件利用上展现出实际价值。

对于一个大批次、强并行的扩散语言模型来说,45% MFU 已经进入很有工程意义的区间。

而这显然还不是上限。

优化过程

训练损失在整个过程中持续下降,而且异常稳定:

  • 没有坍塌
  • 没有回滚
  • 没有明显的不稳定阶段

更重要的是,即使在同一批数据上继续训练,损失仍然能继续往下走。

这给了我们一个很强的信号:

扩散式训练可能显著缓解数据枯竭问题。

高质量数据依然极其重要,甚至对小参数扩散语言模型来说可能更重要。

但这次我们看到的是:

高质量数据不只值钱,而且可以被更充分、更反复地利用。


🔍 我们发现了什么

1️⃣ 隐空间思考不是表象,它真的存在

从预训练开始,我们就有意识地让模型学习一种更偏全局观的隐空间思考范式。

最终出现的,不只是更像样的表面思维链。

模型似乎真的会在表达之前,先组织、回看、重构自己的想法

更让我们兴奋的是,我们观察到模型在这一过程中会在不同语言之间跳转:

  • 英文
  • 韩文
  • 日文
  • 中文
  • 以及一些符号化表达

这些内容会短暂出现,然后再逐渐稳定到某一种最终语言形态。

这并不像简单的多语言混杂。

它更像是模型在潜在表示中先寻找更合适的内部表达,再把它压缩到最终可见的语言表面。

模型的思考,并不等于它最终输出的文本。


2️⃣ 它不是只会续写,而是真的会一边并行一边修改

这次训练里最令人兴奋的一点,是模型展现出了很强的:

  • 修改
  • 纠错
  • 反思
  • 收敛到更好的答案

但真正关键的是,这种修改发生在并行生成过程本身

这不是先线性生成,再回头补救。

模型更像是在整体展开的同时,不断修订并收敛自己的当前预测。

在刷榜的时候,我们看到模型:

  • 最后才提交最终答案
  • 反复修复答案候选
  • 在结束前修补最终选择

这和很多"披着扩散外壳"的半自回归系统很不一样。

我们的结论越来越明确:

双向注意力的能力,不能只在推理时补出来。

它必须从预训练开始就和模型结构一起被设计进去。

一旦这件事做对了,模型表现出来的就不再是半自回归。

而是更接近:

真正的并行扩散生成。


3️⃣ 灵活长度文本,这次真的被做出来了

训练高质量扩散式语言模型本身就很难。

而能处理灵活长度文本,则更难。

不同提示词天然就应该对应不同长度的回答。

所以长度不是边缘变量。

它本身就是质量的核心变量之一。

当我们真正把"长度"当成一等公民去处理之后,模型在灵活文本上的扩展能力才明显出现。

长度不是边角细节,而是建模质量的核心问题。


4️⃣ 小模型也能泛化,这一点非常关键

即使在相对不大的参数规模下,模型依然展现出清晰的泛化能力。

而且只需要少量监督微调数据,就可以把模型调到我们想要的方向上。

这会直接改变部署叙事。

它意味着扩散式语言模型不一定只适合做研究。

它也很可能适合一条非常实用的路线:

  • 便宜
  • 好用

5️⃣ 并行能力终于不再只是口号

过去很多扩散式语言模型系统,本质上还是半自回归模型。

但这次不一样。

我们看到的,是更强烈、更明确的真实并行生成能力

而且这种并行,并不只是"同时吐出多个词元"。

它意味着三件事同时发生:

  • 同时生成
  • 同时修改
  • 同时收敛

同时生成,同时修改,同时收敛。

这直接关系到:

  • 吞吐
  • 时延
  • 成本
  • 产品可行性

在词元消耗越来越大的今天,这件事尤其有吸引力。


6️⃣ 自蒸馏不是想象

我们越来越相信,自蒸馏 会成为这条路线继续释放并行潜力的关键一步。

今天看到的并行水平,还远远没有达到上限。

通过自蒸馏,我们有机会:

  • 进一步减少扩散步数
  • 让每一步处理更多词元
  • 降低完成生成所需的总步数
  • 在保持质量的同时提升吞吐

换句话说,就是:

每一步更大、总步数更少、速度更快、词元更便宜。

而这件事的意义,不只是推理更便宜。

它意味着扩散式语言模型的效率曲线,还远远没有被走完。

今天看到的速度,还不是这条路线真正的速度。


🌍 为什么这件事重要

过去很多人会把扩散式语言模型看成:

  • 一种有趣的替代路线
  • 一种研究方向
  • 或者一种不同的解码方法

但这次的结果指向的是更深的一件事:

它可能真的是一种新的语言模型范式。

最重要的不是某一个单点指标。

而是一组很罕见的优势,可能正在同时成立

  • 更便宜、更稳定的训练动态
  • 更高效的 GPU batch 利用
  • 更强的吞吐能力
  • 更低的首词元返回时延
  • 更便宜的词元单价
  • 通往隐空间思考的自然路径
  • 通往自我修改的自然路径
  • 更灵活的建模方式
  • 更广阔的后训练优化空间

说得更直接一点:

扩散式语言模型的价值,现在已经不是哲学问题。

它正在成为工程现实。


🖼️ 走向更大的融合

我们也正在积极探索文字、图像等更大规模融合的扩散模型

我们相信,扩散式建模不只适用于语言。

它同样可能为今天以视觉—语言—动作模型为基础的具身智能系统,尤其是机器人模型,提供另一条替代性的思路。

所以,今天看到的并不是终点。

甚至可能还不是真正的开始。


⚠️ 局限性

我们也希望对这件事保持清醒。

这套系统并不意味着扩散模型已经在所有维度上替代了自回归模型。

眼下最令人兴奋的能力仍然很早期:

  • 隐空间推理
  • 迭代式自我修改
  • 跨模态统一扩散建模

这些方向都还缺少足够成熟、足够标准化的评估体系。

所以我们应该保持野心,也保持诚实。

即便如此,眼下的信号已经足够强,让我们可以明确说出这句话:

扩散式语言模型的上限,远远还没有被真正看到。


💥 我们相信什么

我们相信,自己正在做一件真正重要的事情。

我们希望把词元的价格打下来,把快、便宜、好用刻进模型的基因里。

价格屠夫,一定有市场。

而这条路,还有太多空间没有被探索。


🤝 加入我们

如果你也拥有:

  • 诚实可靠的品格
  • 强烈的好奇心
  • 愿意探索未知的勇气

欢迎考虑加入我们。

在蓝色鲸鱼,我们拥有:

  • 充足的 GPU 资源
  • 高效的迭代节奏
  • 优秀而投入的同事
  • 始终热烈的技术氛围

期待和你一起,在更广阔的世界里,继续探索那些尚未被定义的可能。


Whaletech 横幅