🎯 Use Case
Hermes
Skill
fine-tuning-with-trl
TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.
Post-TrainingTRLReinforcement LearningFine-TuningSFTDPOGRPORLOORLHFPreference AlignmentHuggingFace文件路径
optional-skills/mlops/training/trl-fine-tuning/SKILL.md