OMA Skills Hub by OMA · Open Modus Accelerator
🎯 Use Case Hermes Skill

fine-tuning-with-trl

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

仓库: NousResearch/hermes-agent · v1.0.1 · by Orchestra Research · MIT

Post-TrainingTRLReinforcement LearningFine-TuningSFTDPOGRPORLOORLHFPreference AlignmentHuggingFace
文件路径
optional-skills/mlops/training/trl-fine-tuning/SKILL.md

查看源文件 (raw) ↗