摘要: 目录0x00 论文概述0x00.1 生成流程0x00.2 主要专业术语0x01 SFT训练0x01.1 配置环境0x01.2 准备训练数据0x01.3 编写训练脚本0x01.4 自定义损失函数0x01.5 训练结果展示0x02 GRPO强化学习0x02.1 奖励函数0x02.1.1 stage1奖励 阅读全文
posted @ 2026-07-21 18:20 adolf_stalin 阅读(40) 评论(1) 推荐(1)
该文被密码保护。 阅读全文
posted @ 2025-06-22 00:29 adolf_stalin 阅读(14) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-06-14 10:13 adolf_stalin 阅读(0) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-06-12 11:33 adolf_stalin 阅读(16) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-05-18 15:17 adolf_stalin 阅读(0) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-03-09 10:56 adolf_stalin 阅读(5) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-02-23 09:19 adolf_stalin 阅读(0) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2025-02-01 22:46 adolf_stalin 阅读(0) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2024-09-23 23:33 adolf_stalin 阅读(0) 评论(0) 推荐(0)
该文被密码保护。 阅读全文
posted @ 2024-09-22 22:39 adolf_stalin 阅读(0) 评论(0) 推荐(0)