OMA Skills Hub by OMA · Open Modus Accelerator
🎯 Use Case Hermes Skill

simpo-training

Reference-free preference alignment, simpler than DPO.

仓库: NousResearch/hermes-agent · v1.0.0 · by Orchestra Research · MIT

Post-TrainingSimPOPreference OptimizationAlignmentDPO AlternativeReference-FreeLLM AlignmentEfficient Training
文件路径
optional-skills/mlops/simpo/SKILL.md

查看源文件 (raw) ↗