diff --git a/examples/dppo/lora/sd3_5/geneval_teacher.yaml b/examples/dppo/lora/sd3_5/geneval_teacher.yaml index 6468bc53..a03d2277 100644 --- a/examples/dppo/lora/sd3_5/geneval_teacher.yaml +++ b/examples/dppo/lora/sd3_5/geneval_teacher.yaml @@ -1,6 +1,4 @@ # Checkpoint: https://huggingface.co/Jayce-Ping/GenEval-Teacher -# DPPO teacher config migrated from private flow_dppo/geneval.yaml. -# Mapping: grpo + mask_type: kl_adv -> dppo + kl_mask_type: v-based; kl_beta=0. # Trains SD3.5-Medium LoRA on dataset/geneval with GenEval reward (float32, sync). # Environment Configuration diff --git a/examples/dppo/lora/sd3_5/ocr_teacher.yaml b/examples/dppo/lora/sd3_5/ocr_teacher.yaml index 7c92d4e3..0b7a9a55 100644 --- a/examples/dppo/lora/sd3_5/ocr_teacher.yaml +++ b/examples/dppo/lora/sd3_5/ocr_teacher.yaml @@ -1,6 +1,4 @@ # Checkpoint: https://huggingface.co/Jayce-Ping/OCR-Teacher -# DPPO teacher config migrated from private flow_dppo/ocr.yaml. -# Mapping: grpo + mask_type: kl_adv -> dppo + kl_mask_type: v-based; kl_beta=0. # Trains SD3.5-Medium LoRA on dataset/ocr with OCR reward (sync). # Environment Configuration diff --git a/examples/dppo/lora/sd3_5/pickscore_teacher.yaml b/examples/dppo/lora/sd3_5/pickscore_teacher.yaml index 02310c7f..8bce38db 100644 --- a/examples/dppo/lora/sd3_5/pickscore_teacher.yaml +++ b/examples/dppo/lora/sd3_5/pickscore_teacher.yaml @@ -1,6 +1,4 @@ # Checkpoint: https://huggingface.co/Jayce-Ping/Pickscore-Teacher -# DPPO teacher config migrated from private flow_dppo/pickscore.yaml. -# Mapping: grpo + mask_type: kl_adv -> dppo + kl_mask_type: v-based; kl_beta=0. # Trains SD3.5-Medium LoRA on dataset/pickscore with PickScore reward (async). # Environment Configuration