LongCat-Video视频编码与后处理:帧率、CRF与画质参数的最佳配置
LongCat-Video视频编码与后处理帧率、CRF与画质参数的最佳配置【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 视频生成基础框架支持文生视频、图生视频、视频续写与音频驱动数字人Avatar生成。跑完之后拿到手的 MP4 到底清不清晰、顺不顺手一半取决于模型另一半取决于视频编码与后处理帧率fps、CRF 画质参数、libx264 编码器以及 480p/720p 的超分辨率精修阶段。本文带你定位这些参数在代码中的位置并给出一套开箱即用的最佳配置。先搞懂参数都写在哪里LongCat-Video 的视频保存只走两条路翻遍所有 demo 脚本都逃不出这两个入口保存方式适用任务代码位置torchvision.io.write_video文生视频 / 图生视频 / 续写 / 长视频 / 交互式生成run_demo_text_to_video.py、run_demo_video_continuation.pysave_video_ffmpeg封装 imageio ffmpeg 命令行音频驱动 Avatar 数字人需要把音轨混进 MP4longcat_video/audio_process/torch_utils.py# 基础任务torchvision 直接落盘libx264 CRF 18 write_video(output_t2v.mp4, output_tensor, fps15, video_codeclibx264, options{crf: f{18}})# Avatar 任务ffmpeg 编码视频 裁剪音频 混合音轨 save_video_ffmpeg(output_tensor, save_path, audio_path, fpssave_fps, quality5)理解这两段代码就看懂了全项目的画质旋钮。帧率怎么选15fps 与 30fps 的两段式策略LongCat-Video 采用先低帧率生成、后时间超分的粗到细coarse-to-fine策略帧率参数不是随手定的第一阶段480p 生成VAE 原生输出15fps所有 demo 里fps15就是这么来的第二阶段720p 精修generate_refine默认同时做空间和时间超分帧数翻倍15fps → 30fps若只想提清晰度不提帧率把spatial_refine_only设为True输出仍保持 15fps。fps 15 if spatial_refine_only else 30 write_video(output_t2v_refine.mp4, output_tensor, fpsfps, video_codeclibx264, options{crf: f{10}})这个逻辑在 run_demo_text_to_video.py、run_demo_long_video.py 中完全一致。新手记住一句话中间产物存 15fps最终成片存 30fps与模型的生成节奏对齐播放最自然。Avatar 数字人分支略有不同v1.0 默认16fpsv1.5 默认25fps见 run_demo_avatar_single_audio_to_video.py。因为音画同步对帧率敏感save_fps同时决定了音频特征的插值帧率get_audio_embedding(..., fpssave_fps*audio_stride)不建议随意改动否则口型容易漂移。CRF 参数最佳配置为什么是 18 和 10CRFConstant Rate Factor是 x264 的核心画质旋钮数值越小画质越高、文件越大0 无损23 是默认51 最差。项目里的三档取值各有分工CRF用途出处18第一阶段 480p 中间产物视觉接近无损且体积可控run_demo_image_to_video.py10720p 精修后的最终成片最大限度保留 AI 生成细节run_demo_text_to_video.py0无损high_quality_saveTrue时启用-preset veryslow归档级画质longcat_video/audio_process/torch_utils.py给新手的最佳实践成片分享、发社交媒体 →CRF 1823足够18 是肉眼无损甜点位需要逐帧检查 AI 生成质量评估手、脸等细节→CRF 10避免压缩伪影干扰判断想再压缩体积 → 可把options里追加preset如slow在相同 CRF 下减小文件牺牲编码速度。后处理流水线音频裁剪与音视频混合Avatar 任务的save_video_ffmpeg是一条完整的 ffmpeg 后处理流水线值得理解它的四步走torch_utils.py编码视频imageio 以quality5映射到中等 CRF写出临时 MP4裁剪音频按视频时长T / fps截断音轨二次裁剪视频再按实际音频时长回裁视频保证音画严格等长混合输出libx264aac-shortest得到最终成片开启high_quality_saveTrue则升级为CRF 0 veryslow无损重编码。这套以音频为准来回互裁的技巧是 AI 视频音画同步落盘的通用做法值得在自己的项目里直接复用。常见问题速查为什么中间视频有点糊正常的——第一阶段只出 480p/15fps 且 CRF 18最终以 refine 阶段的 720p/30fps 成片为准如何切换 480p / 720p通过生成接口/Avatar 脚本的resolution参数控制480p 显存友好720p 细节更好官方推荐有显存余量直接上 720p想改分辨率或步数num_frames、height/width在 pipeline_longcat_video.py 的generate_t2v/generate_i2v/generate_refine中定义输出尺寸需符合 32 的倍数约束bucket 配置见 longcat_video/utils/buckcet_config.py环境依赖编码依赖imageio-ffmpeg见 requirements.txt与系统 ffmpeg安装文档在 README.md 中已给出 conda 安装命令。总结LongCat-Video 的编码与后处理配置其实很克制15fps/CRF18 的中间产物 30fps/CRF10 的最终成片 Avatar 分支的音画同步流水线兼顾了速度、体积与 AI 生成细节的保真度。新手只要记住帧率对齐模型两段式、CRF 成片别高于 18就能在不动模型的前提下拿到最稳定的输出画质。【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考