Skip to content

rl效果问题 #2

Description

@kimoji919

非常好的工作,在较难使用rule评估的任务上给出评估方法。我有如下几个问题:

  1. 泛化能力:评估数据集和训练数据集应该做了良好的区分,是否能有更独立的数据集进行评测?类似于未被训练的其他任务。
  2. 对比实验:基础模型估计很少能拿到类似领域数据,是否拿SFT微调过后的其他模型去做和SFT/RL模型的对比更加合理?
  3. 评估模型&GRPO:GRPO一个显著工程优势是省去评估模型节省显存开销,如果这一步不做省略,同样的开销PPO的效果会不会更好?
  4. 更大模型?

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions