YuE:开源AI音乐生成模型,根据歌词生成完整的歌曲和伴奏

原创 2025-03-31 10:55:21新闻资讯
1260

在人工智能技术飞速发展的今天,音乐创作领域也迎来了前所未有的变革。YuE 作为一款开源的音乐生成基础模型,正在重新定义音乐创作的边界。它不仅能够将歌词转化为完整的歌曲,还能支持多种语言、风格和生成模式,为音乐创作者和爱好者提供了一个强大的工具。

Yue1.webp

一、YuE 是什么?

YuE 是一个由香港科技大学(HKUST)和多模态艺术投影(M-A-P)团队共同开发的开源 AI 音乐生成基础模型。它的名字在中文中意为“音乐”和“快乐”,寓意着通过技术让音乐创作变得更加简单和愉悦。YuE 的核心功能是将歌词转化为完整的歌曲,包括主唱和伴奏部分,支持多种语言和风格。

YuE 的开发团队希望通过这一模型,推动音乐创作的民主化,让更多人能够轻松创作出高质量的音乐作品。与市场上其他封闭的音乐生成工具不同,YuE 是完全开源的,允许用户自由使用、修改和分发其代码和模型权重。

二、功能特色

  1. 多语言支持
    YuE 支持多种语言,包括英语、中文(普通话和粤语)、日语和韩语。用户可以根据自己的需求选择不同的语言生成歌曲,这使得 YuE 成为一个真正全球化的音乐生成工具。

  2. 多种生成模式
    YuE 提供了两种主要的生成模式:

    • CoT(Chain-of-Thought)模式:无需参考音频,直接根据歌词和风格标签生成歌曲。

    • ICL(In-Context-Learning)模式:通过提供参考音频(如混音、主唱或伴奏),生成与参考音频风格相似的歌曲。ICL 模式支持单轨和双轨输入,双轨模式通常能获得更好的音乐质量。

  3. 实时交互界面
    YuE 提供了基于 Gradio 的用户界面(YuE-UI),支持批量生成、输出选择和续写功能。用户可以在交互时间轴上可视化生成进度,快速预览音频输出,并保存/加载会话(JSON 格式)。这一界面优化了用户体验,即使在只有 8GB 显存的 GPU 上也能流畅运行。

  4. 音乐延续功能
    YuE 支持音乐延续功能,允许用户在已有的音频基础上继续生成新的音乐内容。这一功能特别适合需要逐步完善音乐作品的创作者。

  5. 硬件友好
    YuE 通过量化模型和 FlashAttention 技术,优化了显存使用,使得在有限硬件资源下也能高效运行。例如,YuE-exllamav2 和 YuEGP 是专为显存有限的用户设计的优化版本。

YuE.webp

三、技术细节

  1. 模型架构
    YuE 由两个主要阶段组成:

    • Stage 1:负责将歌词和风格标签转化为初步的音乐序列。

    • Stage 2:对 Stage 1 的输出进行细化,生成最终的高质量音频。

  2. 硬件需求

    • 显存要求:生成长序列需要较大的显存。对于 24GB 或更少显存的 GPU,建议一次生成不超过 2 段;对于 80GB 或更大显存的 GPU(如 H800 或 A100),可以生成更多段落。

    • 生成时间:在 H800 GPU 上生成 30 秒音频需要约 150 秒,而在 RTX 4090 GPU 上需要约 360 秒。

  3. 训练方法
    YuE 采用了大规模的多模态训练数据集,涵盖了多种音乐风格和语言。通过链式思考(CoT)和上下文学习(ICL)技术,YuE 能够生成结构化和风格化的音乐作品。

  4. 开源许可
    YuE 采用 Apache 2.0 许可证,允许用户自由使用、修改和分发其代码和模型权重。创作者可以将 YuE 生成的音乐用于商业项目,只需注明“YuE by HKUST/M-A-P”即可。

四、应用场景

  1. 音乐创作
    YuE 为音乐创作者提供了一个强大的工具,可以快速生成高质量的歌曲,节省创作时间。无论是初学者还是专业音乐人,都可以利用 YuE 探索新的创作灵感。

  2. 影视配乐
    在影视制作中,YuE 可以快速生成符合剧情氛围的背景音乐,帮助导演和配乐师更高效地完成工作。

  3. 广告音乐
    广告行业需要大量高质量的背景音乐,YuE 可以根据广告主题和风格快速生成合适的音乐,提升广告的吸引力。

  4. 教育与娱乐
    YuE 可以用于音乐教育,帮助学生理解音乐创作的基本原理。同时,它也可以作为娱乐工具,让用户轻松创作个性化的音乐作品。

  5. 多语言音乐创作
    YuE 的多语言支持使其成为全球音乐创作者的理想工具,特别适合需要跨语言创作的项目。

五、相关链接

六、总结

YuE 作为一款开源的音乐生成基础模型,正在重新定义音乐创作的边界。它不仅提供了强大的功能和灵活的生成模式,还通过开源许可和社区支持推动了音乐创作的民主化。无论是专业音乐人还是普通爱好者,都可以利用 YuE 探索新的创作可能性。随着技术的不断发展,YuE 有望成为音乐创作领域的一个里程碑,为全球创作者带来更多的灵感和机会。

ai音乐生成 ai生成音乐 ai模型
THE END
ai资讯
关注ai行业发展,专注ai软件推荐。

相关推荐

gpt币子下架了?别慌!老张拆解真相:AI模型和币圈下架大不同
别闹了!GPT-4o根本不是加密货币 最近粉丝私信刷爆了。都在问GPT币下架的事。我一看就笑了。GPT-4o是OpenAI的AI模型啊。它和比特币、以太坊半毛钱关系没有。这事我跟踪了半...
2026-04-02 新闻资讯
213

AI模型是什么意思?一文说清核心概念
什么是AI模型? AI模型就是人工智能系统的核心组件。它本质上是一个文件或程序。经过大量数据训练后,它能识别模式、做出预测或自主决策。简单说,它是个“知识包”。比如识...
2026-04-02 新闻资讯
255

HunyuanVideo-Foley:腾讯混元团队开源的一款端到端视频音效生成模型
HunyuanVideo-Foley 是腾讯混元团队研发并开源的一款端到端视频音效生成模型,其核心使命是通过人工智能技术,为无声视频自动生成高质量、高同步的音效与背景音乐,打造真正意...
2025-08-29 新闻资讯
1084

Seed-OSS:原生512K长上下文与可控推理的开源大语言模型
一、Seed-OSS是什么?Seed-OSS是字节跳动Seed团队开源的大语言模型系列,标志着字节跳动首次进军开源大模型赛道。这一系列模型以其360亿参数的规模、原生512K超长上下文支持...
2025-08-22 新闻资讯
1052

RynnEC:阿里达摩院开源的一款专为具身智能设计的世界理解模型
RynnEC是阿里巴巴达摩院开源的一款专为具身智能设计的世界理解模型,属于多模态大语言模型(MLLM)范畴。其核心目标是赋予AI系统对物理世界的深度理解能力,使机器人或智能体...
2025-08-13 新闻资讯
903

RynnVLA-001:基于视频生成与人体轨迹预训练的视觉-语言-动作模型
RynnVLA-001是阿里巴巴达摩院自主研发并开源的视觉-语言-动作(Vision-Language-Action, VLA)模型,专为具身智能(Embodied AI)场景设计。该项目通过大规模第一人称视角视频...
2025-08-13 新闻资讯
981