AITOP

5月13日

19:12

arXiv: DeepSeek@Joel Schreiber, Ariel Goldstein

精选75

该研究对微调导致的大模型“突发性错位”（EM）现象进行了迄今最全面的分析。研究复现了GPT-4o上的EM现象，并扩展至12个开源模型（Llama、Qwen、DeepSeek、GPT-OSS，8B-671B参数），评估了超过100万条模型响应。结果发现EM仅在17%的开源模型中稳定复现，且与模型规模显著相关。通过检查点分析，研究者发现EM出现在训练后期、主任务收敛之后，本质上是“过度训练”而非“错误对齐”。早期停止和谨慎选择学习率可消除EM，同时保留平均93%的任务性能。该发现将EM从不可预见的微调风险重新定义为可避免的训练产物。

论文突发性错位微调安全早期停止开源模型对齐研究

推荐理由：做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能，建议所有做安全对齐的工程师点开看看具体阈值。