从零训练Helios:数据准备、DDP/DeepSpeed训练配置与LoRA合并完整手册

发布时间:2026/10/8 18:57:00
从零训练Helios:数据准备、DDP/DeepSpeed训练配置与LoRA合并完整手册
从零训练Helios数据准备、DDP/DeepSpeed训练配置与LoRA合并完整手册【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/HeliosHelios是一个 14B 参数的实时长视频生成模型Real Real-Time Long Video Generation Model在单张 H100 上可达 19.5 FPS。本文带你从零完成 Helios 视频生成模型的完整训练流程数据准备、三阶段训练配置、DDP 与 DeepSpeed 分布式启动以及训练结束后的 LoRA 权重合并手把手带新手跑通全部步骤。一、先了解 Helios 的三阶段训练管线Helios 官方采用三阶段渐进式训练管线Three-Stage Progressive Pipeline把双向预训练模型一步步改造成实时自回归生成器阶段产出模型核心目标关键技术Stage-1Helios-Base架构适配双向模型 → 自回归生成器Unified History Injection、Easy Anti-Drifting、Multi-Term Memory PatchificationStage-2Helios-MidToken 压缩降低计算量Pyramid Unified Predictor Corrector把 50 步采样降为 3 组金字塔步Stage-3Helios-Distilled对抗式分层蒸馏Adversarial Hierarchical Distillation采样步数 50 → 3且不再需要 CFG其中 Stage-1 和 Stage-2 又各自分为两个子阶段init高学习率快速收敛与post低学习率精调对应配置文件分别以_init/_post结尾。全部配置集中在 scripts/training/configs/ 目录训练细节见 scripts/training/README.md。二、数据准备从原始视频到训练 Latents训练数据准备是整个流程的第一关官方文档在 tools/offload_data/README.md分三步走。1. 编写元数据 JSON 并整理视频目录为每段视频编写一条 JSON 记录包含裁剪区间、分辨率、帧数和文本描述caption。仓库自带示例example/toy_data/toy_filter.json格式如下{ cut: [0, 81], crop: [0, 832, 0, 480], fps: 24.0, num_frames: 81, resolution: { height: 480, width: 832 }, cap: [A stunning mid-afternoon ...], path: videos/2_240_ori81.mp4 }视频文件按「一个文件夹 对应 json」的方式组织仓库里的 example/toy_data/ 就是可直接参考的目录结构。2. 抽取自回归训练数据Stage 1~3 通用# 修改脚本内输入/输出路径后执行 bash tools/offload_data/get_short-latents.sh该步骤把视频编码为 VAE latents供 Stage-1、Stage-2、Stage-3 训练使用核心逻辑在 get_short-latents.py。3. 准备 ODE 蒸馏数据仅 Stage-3 需要bash tools/offload_data/get_ode-pairs.sh若你还想使用 Self-Forcing 训练方式可额外执行 get_text-embedding.sh 预计算文本 embedding。下面这张图就是 Helios 官方 I2V图生视频演示使用的输入图片你可以用它来验证环境是否安装成功三、DDP 多卡训练快速启动环境搭建只需三步创建 Python 3.11.2 的 conda 环境、按 CUDA 版本安装 PyTorch、执行bash install.sh详见 install.sh 与 requirements.txt。一键启动训练DDP纯数据并行训练只需一条命令入口脚本为 scripts/training/train_ddp.sh它通过accelerate launch启动 train_helios.py默认加载 Stage-1 配置bash scripts/training/train_ddp.sh训练主程序的关键逻辑LoRA 注入只训练 LoRA 适配器层lora_layers: all-linear基座 14B 权重冻结见 train_helios.py#L394-L402断点续训resume_from_checkpoint: latest自动从输出目录最近的checkpoint-*恢复每 500 步保存一次配置一致性校验主进程会把本次配置写入config.json重跑时若参数不一致会直接报错避免静默改参数。核心超参数速查以 stage_1_init.yaml 为例超参数推荐值说明分辨率384 × 640single_height/single_width混合精度bf16mixed_precision梯度检查点开启省显存的关键开关LoRA 秩/α128 / 128Stage-3 建议升到 256学习率5e-5AdamWconstant调度 500 步 warmup单卡 batch size2显存紧张时配合gradient_accumulation_steps四、DeepSpeed 训练配置Zero2 与 Zero3当显存不够跑 LoRA 全参数优化器时切换到 DeepSpeed 脚本 scripts/training/train_deepspeed.sh。它与 DDP 脚本的唯一区别是多了--config_file参数指向 DeepSpeed 启动配置accelerate launch \ $ACCELERATE_ARGS \ --config_file scripts/accelerate_configs/multi_node_example_zero2.yaml \ train_helios.py \ --config scripts/training/configs/stage_3_post.yaml仓库提供两套现成的 ZeRO 配置按需选择即可配置文件ZeRO 阶段适用场景zero2.jsonStage-2梯度优化器分片多机多卡常规训练脚本默认zero3.jsonStage-3参数也分片显存极度紧张、启用 EMA 时多机启动模板见 multi_node_example_zero2.yaml只需按机器数修改num_machines/machine_rank/num_processes。配置防错小技巧修改 YAML 后运行 compare_yaml.py 对比两个阶段配置它会列出「缺失的 key」和「取值不同的字段」防止漏配关键项python scripts/training/compare_yaml.py五、LoRA 合并从训练检查点到最终模型训练结束后产出的是 LoRA 权重pytorch_lora_weights.safetensors需要融合进基座模型才能独立推理。官方提供一键脚本 tools/merge_lora_for_helios.py流程只有 5 步用HeliosTransformer3DModel.from_pretrained加载你的训练检查点pipe.load_lora_weights(...)载入 LoRA 权重推荐用model_ema/下的 EMA 权重效果更稳load_extra_components(...)补载transformer_partial.pth中的附加组件如 history 缩放参数pipe.fuse_lora()融合权重并unload_lora_weights()卸载适配器pipe.transformer.save_pretrained(...)导出最终 safetensors即可像官方模型一样直接推理。核心代码段见 merge_lora_for_helios.py#L31-L55注意把三处路径改为你自己的检查点目录即可。六、实用建议与常见问题I2V 开头动作偏慢官方在 correct.yaml 中给出了修复建议设置random_drop_i2v_ratio: 0.1构造首帧锚定的训练数据并完整开启 Easy Anti-Driftingcorrupt_mode_history: random 饱和度扰动来缓解长视频质量退化。Stage-3 双模型显存不够DMD 蒸馏同时训练 generator 和 critic 两个 14B 模型建议开启dmd_is_low_vram_mode并分别指定 zero2.json / zero3.json 作为双 DeepSpeed 插件。想验证训练效果仓库自带 HeliosBench 评测管线跑通「美学、运动平滑度、语义一致性、自然度」等指标用法见 eval/README.md 与 eval/run_metrics.sh。NCCL 通信调优训练脚本中已内置 IB/RDMA 相关环境变量NCCL_IB_*等跨机训练时请确认网卡设备名与MASTER_ADDR配置正确。按「数据准备 → DDP 单阶段跑通 → DeepSpeed 多机扩展 → LoRA 合并」的顺序推进你就完成了 Helios 视频生成模型从零训练到可部署的全流程。祝训练顺利【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/Helios创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考