Skip to content

一些有关flow-grpo的问题 #169

Description

@stein-kristina

您的工作非常棒,这个仓库给了我莫大的帮助,非常感谢!!但由于本人是RL新手,对这方面不太熟悉,有一个小问题,就是我看到您在flow-grpo对的训练配置中设置了gradient_step_per_epoch=2,也就是一个epoch内前一半是on-policy,后一半是off-policy,请问这跟完全on-policy的策略在video模型上训练效果哪个好呢?为什么呢?恳请您在百忙之中不吝赐教。

Metadata

Metadata

Assignees

No one assigned

    Labels

    discussionDiscussion about experiment configs, phenomena and etc.

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions