🧠大模型 / LLM
arXiv · cs.LG / cs.CL · 2026-08-24
GRPO 等基于组的强化学习方法通过为每个 prompt 采样多个响应来避免训练 critic,但一个可靠的 critic 往往能带来更高的数据效率。作者提出一套稳定、高效训练 critic 的方法,有望显著提升 LLM 强化学习训练的效率与稳定性。
LLM强化学习GRPO
arXiv · cs.LG · 2026-08-24
连续扩散/流式语言模型已能达到与离散 LM 相当的性能,但现有连续框架仍缺乏收敛性保证。ConvergeFlow 提出一种可证明收敛到 token embedding 的语言流,为连续语言模型的训练提供了理论根基。
LLM 架构扩散模型流匹配
HuggingFace Daily Papers · arXiv 2608.20953
针对 4-bit 量化后模型性能下降的问题,作者提出"量化感知修复"(Quantization-Aware Healing):直接从原始未压缩模型蒸馏,比量化感知训练更快、更稳地恢复压缩模型的性能,为低比特 LLM 部署提供了一条实用路径。
LLM 效率量化开源