中文 AI
语音生成器

旁白、对白、配音。
全部本地。全部无限。

在你自己的 GPU 上使用 36+ 种情绪化语音风格。没有云端。没有积分。没有别人接触你的音频。克隆声音,在 10 种语言间切换,并按需无限制作。

本地运行在你的 PC 36+ 种情绪 声音克隆 无积分无上限

Windows Defender 验证 默认私密 无限生成

听见 Foundry 正在运行

直接看看 Demodokos Foundry:多语言真实语音、背景音乐和录音棚级声音效果,全部在一台机器上本地生成。点击扬声器即可开启声音。

为什么本地更强

每个云端语音工具都有同样三个问题。这个没有。

你的文件永远不离开电脑

你的脚本、声音克隆和音频都留在硬盘上。不会上传。没有别人保存你的作品。也没有人拿它训练模型。

本地运行,所以更快

由你的 GPU 渲染声音。短音频几秒即可完成。你不用等待服务器,也不用和别人共享队列。

没有积分。不必计数。

想生成多少遍都可以。同一句重做十次也没关系。尝试每种情绪。没有计费表在跑,也不会用完额度。

真正的音频工作,第一周就能回本

作者、创作者和工作室用 Foundry 替代按字符计费的云端账单,摆脱字符限制,并比传统录音棚排期更快地发布内容。

独立作者、YouTuber 和游戏工作室正在使用。100% 本地。没有使用上限。

作者和自助出版者

作者和自助出版者

一个晚上就能旁白整本小说,而不是支付 3,000 美元以上录音棚费用。任何句子都能几秒内重录。你的手稿永远不离开机器,未发布草稿保持私密。

YouTuber 和内容创作者

YouTuber 和内容创作者

批量生成干净的配音、开场钩子和 Shorts。生成十种不同读法,用不同声音测试缩略图,一个下午完成一周视频。没有按词收费。

游戏工作室和广告代理

游戏工作室和广告代理

无需预约配音演员即可原型化 NPC 对白、不同语气版本和多语言广告文案。不断调整语气和情绪,直到台词成立,然后本地导出。

开始 7 天免费试用

试用期间不收费。可随时取消。运行在带 NVIDIA GPU 的 Windows PC 上。

从空白页到成品音频,只需 5 个简单步骤

无需预约录音棚,无需按字符付费。语音与音乐的完整流程都在你的 Windows 电脑上运行,每页用时不到一分钟。

第一次使用? 开始之前,先看 4 分钟的安装与首次启动教程。
1/ 5
第 1 步

挑选或打造一个声音

可以直接使用内置声音预设,克隆你自己或一段参考录音,也可以生成一个全新的声音。克隆的声音只保存在你的硬盘上,永远不会上传到服务器。

2/ 5
第 2 步

粘贴脚本,为每个角色配音

把一个章节、一整本书、一份视频大纲或一个对白文件直接放进来。重新设计的脚本编辑器会在粘贴的瞬间把内容拆分成台词,你可以为每个角色指定专属声音,导演一整组配音阵容,而不只是一个旁白。

3/ 5
第 3 步

逐句指导情绪

把任意段落标记为平静、兴奋、耳语、愤怒、讽刺或介于其间的任何状态,每种情绪有 5 个强度等级。声音仍是同一个角色,改变的只是情绪。

4/ 5
第 4 步

生成任意风格的音乐,支持 50 种语言

原创配乐、氛围循环、带人声的完整歌曲、纯器乐铺底。任何曲风、任何情绪,可用 50 种语言中的任意一种演唱。为旁白配乐,或单独写一首曲子,然后直接拖到时间轴上。不需要第二个工具,也不需要额外订阅。

5/ 5
第 5 步

用 DSP 和声音特效雕琢每一句

为单句或整条音轨加上录音棚级别的效果。一键把旁白变成外星人、恶魔或老式电台广播,再叠加混响、均衡、自动调音、共振峰移位和故障效果,全部非破坏性。完整的 DSP 机架已内置,无需插件,也无需外部 DAW。

你需要什么

Foundry 在配备 NVIDIA 显卡的 Windows 上运行。以下是简要概览。

操作系统

Windows 10 或 11,64 位
为 Windows 工作站优化
推荐 SSD/NVMe 硬盘

显卡

6 GB+ 显存的 NVIDIA 显卡
任意 RTX 系列,含 GTX 1080,推荐 12 GB+

显存档位

6–8 GB:性能降低
16 GB+:+ 多语言 Creative AI
24 GB+:+ 卓越 Creative AI
32 GB+:+ 极致性能

须知

安装包:约 70 MB
首次启动模型包:约 20–25 GB
后续提供更多模型包

常见问题

Demodokos Foundry 可以离线工作吗?

可以。所有 AI 生成、声音克隆和音频处理都在你的 GPU 上本地运行。提示词、脚本、声音样本和生成的音频不会上传到云服务。不过,登录和许可证验证仍需要互联网连接。如果 Foundry 长时间无法连接认证服务器,可能会将你退出登录。

Demodokos Foundry 会把我的音频文件上传到云端吗?

不会。你的音频文件、声音样本、提示词、脚本、项目数据和生成内容都保留在本地电脑上。Foundry 不会把创作内容上传到云端 AI 服务进行生成或处理。

运行 Demodokos Foundry 需要什么 GPU?

配备至少 4 GB VRAM 的 NVIDIA GPU 可以运行部分 Speech 模型,但质量会有所降低。6 GB 是更实用的起点;若要获得 Music 和 Speech 的最佳综合性能,建议使用 12 GB 或更多 VRAM。配备至少 8 GB VRAM 的 AMD GPU 可通过 Vulkan 运行 Music 和 Speech,但 AMD 支持仍处于实验阶段。建议使用支持 CUDA 的 NVIDIA GPU。

我有 AMD GPU,可以使用吗?

可以。配备至少 8 GB VRAM 的 AMD GPU 可通过 Vulkan 运行 Music 和 Speech。AMD 支持仍处于实验阶段,稳定性可能不如 NVIDIA/CUDA;后者可提供目前最成熟的 Foundry 体验。

Demodokos Foundry 支持 macOS 或 Linux 吗?

Foundry 目前支持 64 位 Windows 10 和 Windows 11。暂不提供原生 macOS 或 Linux 版本。

Demodokos Foundry 多少钱?

Creator 计划为每月 $15.00,Professional 计划为每月 $49.00。另有优惠的年度付费方案。两个计划都包含不限次数的本地 AI 音乐和语音生成,不按生成次数扣除积分;项目大小、时长和高级功能仍受所选计划限制。另含 7 天免费试用。

有免费试用吗?

有。Demodokos Foundry 提供 7 天免费试用,可使用所选许可证的全部功能。试用通过 PayPal 进行 0 美元授权;除非你在试用结束后继续订阅,否则不会收费。你可以在试用到期前随时取消。

我可以随时取消订阅吗?

可以,随时进入“账单 > 取消”操作。取消后不会进行下一次续费,并会在当前计费周期结束时生效:月付计划为当前月份结束,年付计划为当前年度结束。在此之前你仍可完整使用。已支付款项不予退还,也不收取取消费用。免费试用期间可随时取消且不会收费。

我可以用 Demodokos Foundry 克隆自己的声音吗?

可以。导入一段你的声音录音,或你已获授权使用的其他声音,Foundry 就会在本地电脑上创建声音克隆。克隆声音可使用 40 多种情绪和说话风格,每种都有 5 个强度等级,并且不按字符或生成次数收费。

Demodokos Foundry 支持哪些语言?

Demodokos Foundry 支持 50 种语言的音乐生成和歌词创作,以及 10 种语言的语音与声音生成。Creative AI 智能体针对英文对话进行了优化。高 VRAM 系统可运行更大的 Creative AI 模型,这些模型能理解更多语言,并在多语言歌词创作、文本分析和旁白处理方面表现更强。

Demodokos Foundry 使用开源还是专有 AI 模型?

Demodokos Foundry 使用基于开源基础开发的专有 AI 系统和经过适配的模型。Demodokos 会对这些基础进行广泛修改、扩展和进一步适配,然后再将其整合进自有的音乐、语音和音频制作架构。

Music v4 引擎建立在经过修改的 ACE-Step 1.5 基础上,并将光谱通量引导的稳定机制直接集成到生成过程中。Speech v4 通过进一步适配和大规模架构改造推进了 Qwen3-TTS,而 Creative AI 则在自定义智能体流水线中使用受约束的 Qwen3 语言模型。Demodokos 还将 Meta 的 AudioSeal 技术重新设计为 Tonotope,这是一套轻量级 AI 来源标记系统,可直接嵌入生成音频并保持不可听。

所有 AI 推理都通过基于 GGML 和 ONNX 构建的自定义 C++ 推理栈在本地运行。

Demodokos Foundry 只是开源 AI 模型的套壳吗?

不是。所谓套壳,通常只是在现有模型上增加一个新界面,而底层技术和工作流程基本不变。Foundry 远不止如此。

Demodokos 会修改和扩展模型本身,并围绕它们构建专有的生成、声音一致性、编排和音频处理系统。Music v4 和 Speech v4 的改动会直接影响音乐稳定性、说话者身份、表达能力和长篇内容的一致性。

这种差异在富文本文档式 Speech Editor 中尤其明显。它把熟悉的文档写作体验与专为口语制作设计的工具结合起来,包括可视化说话者和演绎提示、背景音乐和音效插入、重叠对话、自然串话、采样级精确时序,以及可视化调节的 DSP 效果。每句话都可以在上下文中试听、编辑或重新生成,并可单独控制语速、音高、音量和演绎方式。

Foundry 的智能体流水线还能处理整本书:拆分章节、总结和分析内容、检查图片和 OCR 文本、识别说话者、根据 AI 生成的角色描述创建声音,并准备旁白。另一条旁白流水线可以改写文本、选择合适的说话者,并逐句选择符合内容的情绪。

之后,项目还可继续进入音乐生成、分轨、局部修复、时间线编排、混音和最终导出。Foundry 不是第三方模型的前端,而是一套将长篇文本从文档直接转化为成品声音的本地一体化音频制作环境。

Demodokos Foundry 与 ElevenLabs 有什么不同?

ElevenLabs 是一套按月度使用积分计量的云平台。Demodokos Foundry 则是在 Windows 上本地运行的音频制作环境:生成任务由你自己的 GPU 执行,脚本、声音和音频保留在本机,输出也不按字符或单次生成积分计量。

Foundry 面向的是完整制作,而不是彼此孤立的生成任务。其富文本文档式 Speech Editor 让你可以在熟悉的文档界面中写作、分配说话者、逐句指导情绪和演绎、插入音乐和音效、制作重叠对话与串话、在上下文中重新生成任意句子,并直接调整语速、音高、音量、时序和 DSP。智能体工作流程还可通过章节拆分、文本与图像分析、说话者识别、声音设计和旁白指导来处理整本书。

音乐生成、分轨、局部修复、时间线混音和自动化也都集成在同一桌面应用中。核心区别在于:Foundry 是私密、一体化的本地工作室,而不是按积分计算用量的云服务。

Demodokos Foundry 适合企业使用并符合 GDPR 吗?

是。Demodokos Foundry 旨在支持符合 GDPR 的工作流程。所有 AI 生成、声音克隆和音频处理都在你自己的硬件上运行,因此企业内容、客户音频、专有声音录音、内部脚本和机密旁白会留在你的环境中,而不会发送给云端 AI 提供商。任何云端 AI 提供商都不会接收或保留你的创作内容。这让组织能够直接掌控生成流程中的数据并保持数据主权,因此 Foundry 特别适合企业、法务团队、医疗机构、媒体公司及其他对隐私敏感的工作。

Demodokos Foundry 符合欧盟 AI Act 吗?

是。Demodokos Foundry 旨在满足欧盟 AI Act 中适用的透明度要求。生成音频会在元数据中标明为 AI 生成,并带有 Tonotope - - Demodokos 的高强度、不可听 AI 来源水印。