DIURNA

每日一页,AI 发生了什么

古罗马把元老院的决议刻在白板上,立于广场,叫 Acta Diurna——人类第一份日报。这里制式相同:一天一页,只挑真的发生了的事。每条先给一句话,想知道细节再展开。

第 I 期 · 2026-08-28 周五

智谱揭下 Ox Alpha 的匿名马甲、腾讯开源 770B 的 Hy4,国产开源旗舰两天连发三款。

9 条

01 — 头条

智谱确认“Ox Alpha”就是 GLM-5.3-Flash,权重按 MIT 开源

匿名跑了 62 万亿 token 的神秘模型揭底:320B-A18B,十万张国产芯片训出,港股当天收涨超 12%。

开源模型智谱国产芯片多模态

展开

这条新闻真正的分量不在参数量,而在于它把三件事同时做成了:全流程跑在国产芯片集群上、性能进入第一梯队、权重按 MIT 开源。以往这三个条件通常只能满足两个。

更值得琢磨的是它的发布方式。GLM-5.3-Flash 没有先发榜单,而是化名 Ox Alpha 在 OpenRouter 和 OpenCode 上匿名开放,靠真实调用量说话——正式发布前就处理了 62 万亿 token,公开可用后头三天又吃下 11 万亿。揭底后它在 OpenRouter 上排到编程类第一,占该平台周流量近 31%(10.3 万亿 token)。先让开发者用脚投票、再公布身份,这套打法比刷分更有说服力。

据多家科技媒体报道,它在 Artificial Analysis 智能指数上得 57 分,与 Claude Opus 4.8 持平,高于 DeepSeek V4 Pro 的 53 分。它也是 GLM-5 系列里第一个原生多模态的模型,支持文本、图像、视频、视觉文档以及交错输入。

对做后训练的人来说,MIT 许可意味着可以直接拿它当 SFT 和 RL 的 base,不用绕许可条款。

South China Morning Post →

腾讯混元开源 Hy4 preview:770B 总参、49B 激活

今天发布即开源,百万级上下文,203 项真实工程任务的人工评测里压过 GLM-5.3 与 Kimi K3。

开源模型腾讯混元MoE长上下文

展开

稀疏度是这个模型最扎眼的地方:770B 总参数只激活 49B,激活比例约 6.4%,比大多数同量级 MoE 都更激进。这意味着它的推理成本更接近一个 50B 级别的稠密模型,但容量按 770B 算。

评测方式也值得单独说一句。腾讯给出的主口径不是公开榜单分数,而是找了 163 位专家、设计 203 个真实工程任务做人工打分,Hy4 preview 拿到 2.99/4.00,GLM-5.3 是 2.92,Kimi K3 是 2.94。三家咬得很紧,用人工评测而非刷榜来定胜负,本身就是个信号——公开榜单的区分度在头部模型之间已经不太够用了。

API 定价为输入每百万 token 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。除了开源权重,还可以通过腾讯云 TokenHub 和 OpenRouter 调用,WorkBuddy 与 CodeBuddy 上首两周免费。

腾讯官网 →

02 — 模型与产品

通义开源 Qwen3.8-Flash-Next,提前把 Qwen4 的架构拿出来试水

125B 主干外挂 51B 的 N-gram 查找表,每 token 只激活 6B,注意力四层里三层走线性架构。

开源模型通义千问模型架构MoE

展开

这个模型的定位和当年 Qwen3-Next 之于 Qwen3.5 是一样的——不是为了打榜,是让社区提前适配 Qwen4 的架构。要预告的有四件事:混合注意力、门控残差流、N-gram 嵌入、Muon 优化器。

最新鲜的是 N-gram 嵌入层:在第 2 层放一张两千万条的 bigram/trigram 查找表,靠确定性查表而不是参数计算来加容量,在 NVIDIA 设备上还支持把这部分 offload 到主机内存。它占了 51B 参数,但不参与逐 token 的激活计算,所以磁盘权重 180B、实际每 token 只动 6B。另外还挂了一个 4B 的多 token 预测模块。

两个部署上的坑要注意:许可是 qwen-community-1.0,不是 Apache-2.0,商用前得读条款;最小部署配置是 TP2,单卡跑不起来。vLLM 和 SGLang 都已支持。

MarkTechPost →

03 — 论文

TTPO:不要标签,也能在测试时接着训推理模型

伪标签一错就污染整个 teacher;作者发现与投票不一致的 rollout 基本都错,于是两边不对称处理。

后训练测试时训练自蒸馏强化学习

展开

卡点在哪:RL 和 on-policy 自蒸馏(OPSD)这两条主流后训练路线都依赖 ground-truth 标签,所以做不了测试时训练。最自然的替代是拿多数投票的伪标签顶上,但这条路很脆——投票一错,teacher 就被污染,错误会顺着每个 token 传下去。

这篇的关键观察是:这个失败模式是不对称的。跟伪标签不一致的那些 rollout,无论投票本身对不对,通常都是错的。也就是说,惩罚不一致的一支比信任一致的一支要安全得多。

于是 TTPO 把两支分开处理:一致的 rollout 走 OPSD 蒸馏,不一致的走 Grouped RL 惩罚。再叠一层 token 级筛选——蒸馏时给已经收敛的位置降权,RL 只罚那些“自信的错误”。这样即便伪标签频繁出错,两个方向的更新都还站得住。

结果:完全无标签的情况下,在五个竞赛级 benchmark 上追平了有标签监督的 OPSD;Qwen3-1.7B 在测试时训练中从 38.0% 提到 45.2%;关掉 thinking 时提升 25.2% 到 36.4%,并且有明显的跨任务泛化。

arXiv 2608.27448 →

进化策略能比 GRPO 覆盖更广的推理空间

GRPO 训着训着熵就塌了、大 K 的 Pass@K 上不去;这篇从理论和实验两头论证 ES 靠种群多样性能撑住覆盖度。

后训练GRPO进化策略强化学习

展开

卡点在哪:进化策略(ES)作为省显存的后训练方案已经用起来了,但它的优化行为一直没人系统研究过,导致说不清它到底什么时候比 GRPO 更合适——默认印象是“效果差一点的省内存替代品”。这篇要做的就是把这个印象推翻。

理论上,作者证明经 verifier 投影后的种群 Jensen-Shannon 多样性越高,Pass@K 越好。实验上,GRPO 出现典型的熵坍缩,而 ES 在提升 Pass@1 的同时还拿到比 GRPO 更高的 Pass@K。

有个反直觉的发现值得单独记一笔:ES 会让整个模型的参数大幅漂移,但真正带来任务收益的只是一小撮幅度较大的更新。这种功能上的稀疏性说明,参数动得多不等于功能变化广——held-out 评测也确认没有出现灾难性遗忘。

实用结论有两条:一是给出了先 GRPO 后 ES 的顺序训练方案,用 GRPO 拿 Pass@1、用 ES 补 Pass@K;二是模型越大,ES 需要的种群规模反而越小。

arXiv 2608.27351 →

用弱模型写的半截推理前缀,撑住 RLVR 的探索空间

不改算法、不加 SFT,把小模型生成的部分推理轨迹塞给大模型当开头,靠“陌生前缀”打断它的过度自信。

RLVR探索熵坍缩后训练

展开

卡点在哪:RLVR 确实能提推理能力,代价是策略熵往下掉,推理覆盖收窄,大 k 情况下的 pass@k 反而退化。现有缓解手段几乎都在算法正则化上打转,跨模型的非参数扰动这条路基本没人走。

这篇的做法简单得有点朴素:让目标模型基于一个更小、更弱的语言模型生成的部分推理轨迹继续往下写。这些不熟悉的前缀会打断模型的过度自信,把它推到不同的推理路径上去。作者还实证研究了分布差异是如何影响 RLVR 探索动力学的。

吸引人的地方在于它的省事:不需要额外 SFT、不需要精巧的奖励设计、也不需要复杂 prompt,就能缓解熵坍缩。多个数学 benchmark 上稳定优于原始 RLVR,而且 k 越大,收益越明显——说明推理覆盖是真的被撑开了,不是把分数挪了个位置。

arXiv 2608.27420 →

TailSFT:把 SFT 阶段已经学会的样本丢掉,给后面的 RL 留余地

SFT 时过滤掉已经拟合的序列、只学分布尾部,换来覆盖度更高、更适合跑 GRPO 的初始化。

后训练SFTGRPO覆盖度

展开

卡点在哪:大家都知道 RL 后训练在“已经很能打的 base 模型”上最有效,但很少有人反过来问——现有 pipeline 产出的中间 checkpoint,真的是最适合拿去做 RL 的那个吗?

做法是对 SFT 做一个很小的改动:训练过程中把已经拟合好的序列过滤掉,把学习集中在建模不足的尾部区域。过滤准则的具体选择,作者用受控实验加理论分析做了论证。

效果分两段看。第一段,OLMo-3 7B 上数学和代码评测的 pass@16 常有提升,最多 17 个百分点绝对值,而额外计算开销很小。第二段更关键:这些高覆盖的 checkpoint 拿去跑后续 GRPO,pass@1 还能再涨最多 4 个百分点——证明它确实是更好的 RL 初始化。作者另外给了一个轻量诊断,用来判断什么场景下 TailSFT 值得上。

往大了说,这篇主张的是分阶段看待模型开发:中间 checkpoint 的好坏,应该用“它能多好地支撑下一阶段训练”来评判,而不是看它自己的分数。作者阵容是 Sadhika Malladi、Samy Jelassi、Dylan Foster、Jordan T. Ash 和 Akshay Krishnamurthy。

arXiv 2608.25756 →

04 — 工具与生态

vLLM 同步放出 Hy4-preview 的官方部署配方

模型开源当天配方就挂上去了:需 vLLM 0.29.0+,16 张 B200 或 8 张 B300 起步。

推理框架vLLM部署投机解码

展开

开源模型现在的实际可用性,很大程度上取决于推理框架跟进的速度,day-0 recipe 已经成了旗舰发布的标配动作,而不是锦上添花。

基本启动命令是 vllm serve tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --attention-backend FLASHMLA_SPARSE,另外通过 speculative-config 打开 MTP 投机解码(模型自带一个 10B 的 MTP 层,推荐 3 个投机 token)。工具调用和思考段分别需要 --tool-call-parser hy_v4--reasoning-parser hy_v4

门槛还是很实在的:770B 的权重哪怕转成 FP8,也要 16 张 B200 起步。个人开发者短期内基本只能走 API 或者等量化版本。

vLLM Recipes →

GGUF 量化在两天内全部跟上

unsloth 已把 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 都量化好,凌晨还在更新。

本地部署量化GGUFHuggingFace

展开

值得留意的不是量化本身,而是响应速度——旗舰模型发布到本地可跑的量化版落地,窗口已经压缩到 24 到 48 小时。

不过要泼盆冷水:Flash-Next 是磁盘权重 180B 的多模态 MoE,GLM-5.3-Flash 更是 320B,量化之后对消费级显卡依然吃力。真正能在个人机器上跑起来的还是 27B 那一档——Qwen3.8-27B 的 GGUF 下载量已经接近 780 万。

另一个可以顺手观察的信号:HuggingFace trending 前 20 里超过一半是 Qwen3.8 系列的衍生版本,量化、abliterated、uncensored 各种口味都有。社区二次加工的重心押在哪一家,从这个榜单一眼能看出来。

Hugging Face →