Skip to main content

看到一个如何训练领域特定模型的文章写得非常好,作者使用 GRPO 微调了 qwen2.5-coder-7B, 实现了一个生成日程表的大模型