非常感谢您完善的工作!
我们目前基于DiffusionNFT做图像编辑的RL,想请问训练时低分辨率+少采样步情况下,sample结果reward很低,效果很差,但是实际推理发现对于高分辨率+完整采样步下的效果也有长进,注意到了您之前说的“在图像上我发现low-resolution的收益可以转移到high-resolution”的说法,我有两个疑问:
- 如果提高训练的分辨率/采样步,是否可以使得训练效果变好?
- 考虑进一步的semi-hard样本筛选、off-policy注入等策略,需要建立在训练setting上还是推理的setting上?
非常感谢您完善的工作!
我们目前基于DiffusionNFT做图像编辑的RL,想请问训练时低分辨率+少采样步情况下,sample结果reward很低,效果很差,但是实际推理发现对于高分辨率+完整采样步下的效果也有长进,注意到了您之前说的“在图像上我发现low-resolution的收益可以转移到high-resolution”的说法,我有两个疑问: