非常好的工作,在较难使用rule评估的任务上给出评估方法。我有如下几个问题: 1. 泛化能力:评估数据集和训练数据集应该做了良好的区分,是否能有更独立的数据集进行评测?类似于未被训练的其他任务。 2. 对比实验:基础模型估计很少能拿到类似领域数据,是否拿SFT微调过后的其他模型去做和SFT/RL模型的对比更加合理? 3. 评估模型&GRPO:GRPO一个显著工程优势是省去评估模型节省显存开销,如果这一步不做省略,同样的开销PPO的效果会不会更好? 4. 更大模型?
非常好的工作,在较难使用rule评估的任务上给出评估方法。我有如下几个问题: