XiaoHu.AI学院

No Result

View All Result

Login

XiaoHu.AI学院

No Result

View All Result

Home AI 工具

OpenVoice：轻松克隆任何声音用多种语言说话并可控制情感口音

by 小互

2024年4月25日

in AI 工具

0

SHARES

1.4k

VIEWS

Share on Facebook Share on Twitter

由MyShell TTS开发。它能够仅使用一小段参考发言者的音频片段来复制其声音，然后能生成多种语言的语音。

OpenVoice能对声音风格的精细控制，包括情感、口音、节奏、停顿和语调，同时能够复制参考发言者的音色。

支持的语言包括英语（英国、美国、印度、澳大利亚）、西班牙语、法语、中文、日语和韩语。

主要功能：

准确的音色克隆：OpenVoice能够精确地克隆参考音色，并在多种语言和口音中生成语音。
灵活的声音风格控制：允许用户对声音的情绪、口音、节奏、停顿和语调进行详细的调整，提供个性化的声音输出。
零样本跨语言声音克隆：OpenVoice 实现了对大规模多语言数据集之外的语言进行零样本声音克隆，即使这些语言未在训练集中出现也能进行声音复制。
高效的计算性能：相比于市场上现有的商业API，OpenVoice 在保持高性能的同时，计算成本大大降低。

OpenVoice V2的新增特性：

更好的音频质量： 采用新的训练策略以提升音频质量。
原生多语言支持： V2 版本原生支持英语、西班牙语、法语、中文、日语和韩语。
集成 MeloTTS： V2 版本引入了 MeloTTS 技术，通过 pip install git+https://github.com/myshell-ai/MeloTTS.git 进行安装，这是一个新的文本到语音转换系统，增强了声音的自然度和表现力。
免费商业使用： 自2024年4月起，V1和V2版本均以 MIT 许可证发布，支持商业和研究用途的免费使用。

技术方法：

声音样式和语言的解耦设计：
- OpenVoice 的设计哲学是将声音的不同特性（如音色、风格、语言）进行解耦，使得可以独立控制各个参数，从而达到灵活调整的目的。这一设计减少了模型的大小和复杂性，提高了操作的灵活性和推断速度。
基础发音者TTS模型与音色转换器：
- 基础发音者TTS模型：这一模型允许对风格参数进行控制，如情绪和口音等。它是一个单发音者或多发音者模型，可以通过改变输入的风格和语言嵌入来输出不同风格的语音。
- 音色转换器：这一组件采用编码器-解码器结构，负责将基础发音者的音色转换为参考发音者的音色。通过这种方式，即使基础声音与目标声音风格不同，也能保持原有风格的同时改变音色。
训练策略和数据处理：
- 在训练过程中，采用了大量的多语种、多风格的音频样本。通过这些样本，模型学习如何准确复制音色并控制声音的不同风格。使用特定的损失函数来确保在保留风格的同时去除或转换音色，从而实现高质量的声音生成。

网站：http://research.myshell.ai/open-voice

GitHub：http://github.com/myshell-ai/OpenVoice

技术报告：https://arxiv.org/pdf/2312.01479.pdf

在线演示：http://lepton.ai/playground/openvoice

创建自己的语音机器人：http://myshell.ai

Related Posts

Meta AI提出了一种新的语言模型架构“Large Concept Model (LCM) 让模型更像人类思考

XiaoHu.AI日报

Meta AI提出了一种新的语言模型架构“Large Concept Model (LCM) 让模型更像人类思考

2024年12月25日

阿里巴巴推出QVQ-72B 一个基于Qwen2-VL-72B的新型多模态推理模型

XiaoHu.AI日报

阿里巴巴推出QVQ-72B 一个基于Qwen2-VL-72B的新型多模态推理模型

2024年12月25日

Fireworks AI新功能能够将图像或PDF等非文本内容转化为LLM可理解的结构化文本

AI 工具

Fireworks AI新功能能够将图像或PDF等非文本内容转化为LLM可理解的结构化文本

2024年12月24日

Hume AI推出全能文本与语音引擎 OCTAVE 根据文本实时生成特定人格特质的声音

XiaoHu.AI日报

Hume AI推出全能文本与语音引擎 OCTAVE 根据文本实时生成特定人格特质的声音

2024年12月24日

Anthropic 公布了一种全新的 AI 越狱技术可以轻松破解所有前沿模型

AI 论文

Anthropic 公布了一种全新的 AI 越狱技术可以轻松破解所有前沿模型

2024年12月23日

INFP：基于音频驱动的双人对话中的互动头像生成能自动区分谁在说话，谁在听

AI 项目

INFP：基于音频驱动的双人对话中的互动头像生成能自动区分谁在说话，谁在听

2024年12月22日

No Result

View All Result

Login

© 2024 Xiaohu.AI

Are you sure want to unlock this post?

Unlock left : 0

Are you sure want to cancel subscription?