logprob共1篇
从 vLLM V0 迁到 V1:强化学习中,先保证正确,再考虑修正-未完纪

从 vLLM V0 迁到 V1:强化学习中,先保证正确,再考虑修正

PipelineRL 的迁移记录:依次对齐 processed logprob、V1 运行默认值、在途权重更新与 fp32 输出头,让训练轨迹接近 V0 参考,再评估异步与离策略修正。
彩雨伞的头像-未完纪钻石会员彩雨伞11小时前
0310