MoneyPrinterTurbo 是一个开源制作流程,可将主题或自定义脚本转换为短视频。它可以生成旁白、提取素材搜索词、检索库存剪辑、合成语音、时间和风格字幕、添加音乐、渲染纵向或横向视频、创建多个变体,并可选择发布到 TikTok、Instagram 和 YouTube Shorts。
最好将其理解为一个装配系统,而不是一个自治的编辑团队。大语言模型可能会写出看似合理但错误的主张;库存搜索可能会返回视觉相关但语义错误的镜头;文本转语音可能会读错名字;技术上成功的渲染可能仍然节奏较弱或权利不明确。它的真正优势是通过 WebUI、API、CLI 和代理技能使管道可检查和可定制。
当前项目包括哪些内容
| 舞台 | 当前能力 | 人类责任 |
|---|---|---|
| 脚本 | AI 生成或用户提供的多种语言脚本 | 来源研究、事实审查、基调和披露 |
| 视觉搜索 | 本地媒体加上 Pexels、Pixabay 和 Coverr 检索 | 许可证据、主题准确性和视觉连续性 |
| 语音 | Edge TTS、Azure Speech、SiliconFlow、Gemini、MiMo、ElevenLabs 和 Chatterbox | 同意、发音、提供商条款和语音质量 |
| 字幕 | TTS 时间戳或本地 faster-whisper 转录;可配置的样式 | 校对、时间安排、换行符和可访问性 |
| 音频 | 随机或选定的背景音乐,带音量控制 | 音乐许可和清晰的旁白组合 |
| 渲染 | 1080×1920 时 9:16 和 1920×1080 时 16:9,剪辑持续时间控制和批处理 | 起搏、安全区、压迫和设备 QA |
| 出版 | 三个社交平台的可选 Upload-Post 集成 | 帐户安全、最终批准、字幕和平台合规性 |
在选择提供商之前选择工作流程
该存储库支持云 LLM、网关和本地服务,包括 Kimi/Moonshot、OpenAI、Gemini、DeepSeek、Qwen、Azure OpenAI、xAI Grok、MiniMax、 Ollama、OneAPI 和 LiteLLM。较长的提供商列表并不意味着每个组合都得到同等维护。从一种受支持的配置开始,保留已知良好的样本,然后一次更改一层。
| 工作流程 | 推荐起点 | 主要权衡 |
|---|---|---|
| 快速原型 | Cloud LLM,Edge TTS,在线股票和时间戳字幕 | 最低设置,但提示和搜索词离开机器 |
| 品质旁白 | 审阅脚本、高级 TTS 和发音词典 | 更高的 API 成本和声音/相似度政策工作 |
| 本地敏感 | Ollama,本地资产,自托管 Chatterbox 和 faster-whisper | 更多硬件、更多维护和更慢的执行速度 |
| 高产量 | API/CLI,固定配置、媒体缓存和批量渲染队列 | 需要可观察性、并发限制和编辑采样 |
| 品牌活动 | 自定义脚本、批准的素材/音乐/字体库和手动发布门 | 减少“一键点击”,但权利和声誉风险大大降低 |
安装和操作要求
当前的自述文件建议使用 Windows 10、macOS 11 或主流 Linux 发行版以及 Python 3.11 或更高版本。它列出了最低 4 个 CPU 核心和 4 GB RAM,推荐 6 到 8 个核心和 8 GB RAM,并表示 GPU 是可选的。 GPU 对于 faster-whisper、批处理工作和较繁重的本地处理非常有用。云密集型工作流程更多地依赖于 CPU、内存和网络可靠性。
部署选项包括 Windows 包、基于 uv 的本地安装、Docker Compose、Google Colab、WebUI、API 和 CLI。推荐的容器命令使用来自 GitHub 容器注册表的预构建映像。在生产中固定版本或图像摘要而不是跟踪 最新的。扫描依赖项和容器,在映像外部存储配置,并将 WebUI 绑定到本地主机,除非故意配置经过身份验证的网络访问。
| 方法 | 最适合 | 控制添加 |
|---|---|---|
| Windows 包 | 快速个人评估 | 验证正式版本并在试用期间避免使用敏感的 API 密钥 |
| uv本地安装 | 需要可重现的 Python 依赖项的开发人员 | 使用锁文件、隔离环境和固定提交 |
| 码头工人 | 可重复的服务或团队部署 | 固定摘要、限制端口、安装最小卷、以非 root 身份运行 |
| 科拉布 | 临时实验,无需本地设置 | 不要上传机密资产或将机密保留在笔记本中 |
| API/CLI | 自动化和批量集成 | 身份验证、队列限制、幂等性和结构化日志 |
尽早发现错误的生产工作流程
- 定义受众并声明。 写下一项成果、目标平台、持续时间、语言和号召性用语。
- 一代人之前的研究。 构建包含日期、引言、数字和需要注意事项的声明的源表。
- 锁定脚本。 大声朗读,删除不支持的陈述并标记发音。
- 创建拍摄列表。 给每句话一个视觉目的,而不是接受松散相关的素材。
- 生成低成本草稿。 使用一种声音、更少的变体和短片来验证结构。
- 审查资产和许可证。 记录每个外部剪辑和曲目的源 URL、贡献者、下载日期和适用许可证。
- 复习旁白和字幕。 正确的名字、数字、时间、行长和说话者的强调。
- 故意渲染变体。 改变一个变量——镜头、声音、节奏或镜头——而不是一次性改变所有变量。
- 执行最终平台质量检查。 在手机上打开和关闭声音观看;检查安全区和压缩。
- 先手动发布。 仅在经过批准、回滚和帐户控制验证后才启用自动上传。
影片许可需要每项资产的证据
自述文件将 Pexels、Pixabay 和 Coverr 描述为免费高清资源的来源。 “免费”并不等于不受限制。许可条款可能会发生变化,并可能对徽标、可识别人员、财产、敏感上下文、再分发或独立转售施加规则。保留每个下载资产的确切来源和许可证状态,而不仅仅是来自库存站点的注释。
自动语义匹配还可以创建诽谤性或误导性的组合:随机可识别的人可能会出现在有关欺诈、疾病或犯罪的叙述中。拒绝暗示不支持的身份、位置或因果关系的镜头。当主题敏感时,使用抽象或自有的视觉效果。
该存储库指出,捆绑的样本音乐来自 YouTube,并表示如果存在侵权,请将其删除。该警告是在商业发布之前用您自己的文档库替换捆绑曲目的原因。同样,字体也有单独的许可证;包含在存储库中并不一定授予所有广播或商业权利。
脚本和视觉质量标准
| 尺寸 | 通过条件 | 常见的自动化故障 |
|---|---|---|
| 钩子 | 最初几秒钟的具体承诺或紧张 | 通用“在当今快节奏的世界”开头 |
| 证据 | 每个事实主张都映射到当前来源 | 确信发明的统计数据或过时的事实 |
| 镜头相关性 | 镜头说明了确切的句子或有意的隐喻 | 关键字与错误的对象、国家/地区或活动匹配 |
| 起搏 | 剪辑改变支持意义而不会让观众疲惫不堪 | 固定时长的剪辑忽略句子节奏 |
| 语音 | 名称、缩写和数字自然 | 发音错误或情绪不匹配 |
| 字幕 | 准确、可读且位于平台安全区域内 | 错误的换行符、时间漂移或隐藏的下部文本 |
| 音频混合 | 手机扬声器上的旁白仍然清晰易懂 | 音乐在过渡时掩盖辅音或剪辑 |
| 权利 | 资产、音乐、字体、声音和相似证据均已存档 | 假设搜索提供商的可用性等于许可 |
字幕计时:快速与准确
默认边缘方法使用 TTS 时间戳,不需要 GPU 并且速度快。耳语方法使用本地 faster-whisper 转录渲染的音频,并且可能更好地反映真实的交付,但它会下载模型并增加计算。记录的默认 Whisper 模型大约为 3 GB; large-v3-turbo 被描述为一种更小、更快的替代方案,容量约为 1.6 GB。使用您的语言、名称和音乐进行测试,而不是假设较大的模型总是能创建更好的可读字幕。
无论使用哪条路径,自动时间戳都是草稿。限制行数,避免拆分名称或语法单元,并确保标题足够长以便阅读。对于多语言输出,请在 TTS 之前翻译并审阅脚本;翻译完成的字幕可能会破坏时间并增加每帧的文本量。
安全和隐私边界
配置可能包含 LLM、演讲、股票媒体和发布 API 密钥。切勿提交 config.toml、在支持屏幕截图中共享它或将其烘焙到公共容器层中。使用单独的受限凭证、提供商预算和轮换。如果 WebUI 或 API 端口暴露在本地主机之外,请添加身份验证、TLS、网络限制和速率限制;视频生成端点会消耗金钱、磁盘和CPU。
自动发布尤其重要。记录的 Upload-Post 配置可以在渲染后公开生成的视频。首先将 YouTube 可见性设置为私有或不公开,并保持自动上传禁用状态,直到存在明确的批准门槛。成功的渲染永远不应该等于发布的许可。
衡量总生产经济性
该软件已获得 MIT 许可,但运行可能会产生 LLM、TTS、库存 API、代理、发布、计算、存储和审核成本。衡量每项成本 已接受 视频,不是每次渲染。包括被拒绝的变体和编辑时间。一条生成十个草稿但只有一个可用结果的管道的生产力并没有提高十倍。
| 公制 | 公式 | 它揭示了什么 |
|---|---|---|
| 录取率 | 已发布的候选人 ÷ 已提交的候选人 | 因提示、资产或声音弱而造成的浪费 |
| 修正时间 | 每接受分钟的人工编辑分钟数 | 自动化是否减少了实际劳动力 |
| 变动成本 | 所有 API 和计算支出 ÷ 接受的视频 | 提供者和变体经济学 |
| 权利覆盖范围 | 有证据的资产 ÷ 使用的外部资产 | 商业出版准备 |
| 索赔准确性 | 经过验证的事实主张 ÷ 事实主张 | 编辑可靠性 |
| 保留值 | 按模板划分的平台观看时间和完成率 | 更高的吞吐量是否可以改善观众的观看效果 |
替代方案
| 选项 | 最适合 | 权衡 |
|---|---|---|
| MoneyPrinterTurbo | 开放、可定制的素材视频自动化 | 设置和编辑/法律控制权仍然由您掌控 |
| CapCut | 快速创建者编辑、模板和手动润色 | 较少可编程的端到端自动化 |
| Adobe Premiere Pro | 专业的编辑、音频、色彩和交付控制 | 更高的技能和手工生产时间 |
| Descript | 以文字记录为主导的编辑、语音和协作审核 | 托管商业工作流程和不同的定制模型 |
| Runway | 生成视频镜头而不是库存组装 | 更高的发电成本和一致性挑战 |
| 自定义 FFmpeg 管道 | 具有精确确定性媒体要求的团队 | 更多的工程设计,但最大程度的控制和可审计性 |
常见问题
是否需要 GPU?
不会。该项目表示,云密集型工作流程可以在没有云的情况下运行。 GPU 有助于 faster-whisper、批量生成和更繁重的本地处理。
我可以使用自己的脚本和媒体吗?
是的。支持自定义脚本和本地资产,并且通常更适合品牌和权限控制。
每个生成的视频都可以安全地获利吗?
不需要。审查每项声明、资产、曲目、字体、声音、相似性和平台规则。开源代码许可并不清除输出输入。
它支持多种语言吗?
它支持多语言脚本和多个 TTS 提供商,但输出质量取决于所选的模型、语音、术语和本机审核。
是否应该启用自动发布?
只有在手动工作流程经过最终批准、凭证安全、平台设置、回滚和事件处理后。
最好的第一次测试是什么?
根据经过验证的脚本制作一个 20-30 秒的视频,记录每个资产许可证,测量校正时间并将其与现有的编辑器工作流程进行比较。
主要来源
上次审核日期为 2026 年 7 月 25 日。提供商支持、依赖项、平台 APIs 和源许可证发生变化;固定已部署的修订版本并在生产前重新检查所有外部条款。




