AITOP

5月13日

19:12

arXiv cs.AI@Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

精选75

该论文提出了一种新的语言模型后训练原则：将稀缺的标注验证数据优先用于最强模型（教师）进行稀疏奖励强化学习（如GRPO），然后通过稠密奖励蒸馏（如OPD）将行为迁移到小模型（学生）。实验表明，在固定学生模型大小（Qwen3-1.7B）下，先对8B教师进行RL再蒸馏，效果优于直接在学生上运行GRPO。该原则强调避免在未准备好的策略上使用稀缺数据，而是通过“稀疏奖励发现→稠密迁移→学生侧稀疏奖励”的流程优化资源分配。

论文后训练强化学习知识蒸馏奖励设计 Qwen3

推荐理由：这篇论文为资源受限的团队提供了明确的训练策略——用最强模型做探索、用小模型做部署，做模型压缩或后训练的开发者可以直接参考这个稀疏到稠密的分配原则来提升效率。

15:51

Perplexity@perplexity_ai

精选65

Perplexity AI 发布了关于在 NVIDIA GB200 NVL72 Blackwell 机架上部署后训练 Qwen3 235B 模型的新研究。研究表明，GB200 不仅是训练平台，更是大型 MoE 模型高吞吐推理的重大升级，性能显著优于 Hopper 架构。该工作展示了如何利用 Blackwell 的硬件特性优化推理效率，为大规模 AI 服务提供新思路。

AI模型推理模型 Perplexity Qwen3 NVIDIA GB200 MoE

推荐理由：做大规模模型推理部署的团队值得关注——GB200 在 MoE 模型上的推理效率提升显著，Perplexity 的实践给出了可直接参考的优化路径。

5月11日

19:03

arXiv: DeepSeek（学术论文）

70

该研究揭示了共享输出Token预算时，长思维链会挤占答案空间，导致准确率下降的“耦合税”现象。在GSM8K、MATH-500等任务中，非思维链模式在≤2048 Token下表现更优，且Qwen3模型呈逆缩放规律。作者提出截断-浪费分解模型预测关键点，并通过拆分预算生成方法（如IRIS）将MATH-500准确率提升至83.6%。结果表明测试时推理应被视为预算分配问题。

论文思维链 Token预算推理模型 Qwen3 DeepSeek-R1

推荐理由：该工作对当前LLM推理优化具有实际指导意义，提醒研究者在固定输出长度场景中平衡推理链与答案空间，避免盲目延长思维链。