training-llms-megatron
from Orchestra-Research/AI-research-SKILLs
Trains large language models (2B-462B parameters) using NVIDIA Megatron-Core with advanced parallelism strategies. Use when training models >1B parameters, need maximum GPU efficiency (47% MFU on H100
v1.0.0MIT
367
Lines
1,262
Words
22
Code Blocks
Languages
bash
08-distributed-training/megatron-core/SKILL.md