• 发文
  • 评论
  • 微博
  • 空间
  • 微信

英伟达发布全新 AI 音频模型 Fugatto

前方智能 2024-11-26 11:22 发布于广东 发文

编译/前方智能

英伟达近日推出了一款名为 Fugatto(全称为 Foundational Generative Audio Transformer Opus 1)的 AI 音频模型。这款模型不仅能通过文字提示生成音乐和音效,还能对现有音频进行修改和转换,创造出前所未有的声音组合。

图源:英伟达

据英伟达介绍,Fugatto 具备多项独特功能,比如可以将钢琴演奏的音乐转换为人声演唱,能够调整语音的口音和情绪,甚至可以创造出"尖叫的萨克斯"或"犬吠般的小号声"等超现实音效。该模型采用了创新的 ComposableART 技术,能够将训练过程中分别出现的音频特征进行组合,从而产生全新的声音效果。

在技术层面,研究团队使用了来自全球多个开源数据集的约 2000 万个音频样本进行训练,形成了一个拥有 25 亿参数的大规模模型。该项目由来自印度、巴西、中国、约旦和韩国等多个国家的研究人员共同开发,这种多元化的团队构成也使得模型在处理多语言和多重口音方面表现出色。

英伟达应用深度学习研究副总裁 Bryan Catanzaro 表示,生成式 AI 技术将为音乐、游戏和普通创作者带来全新的创作可能性。不过,考虑到生成式技术可能带来的潜在风险,英伟达目前尚未计划对外发布这项技术。

声明:本文为OFweek维科号作者发布,不代表OFweek维科号立场。如有侵权或其他问题,请及时联系我们举报。
2
评论

评论

    相关阅读

    暂无数据

    前方智能

    专注于AI产业媒体,探索AI前沿

    推荐商品

      举报文章问题

      ×
      • 营销广告
      • 重复、旧闻
      • 格式问题
      • 低俗
      • 标题夸张
      • 与事实不符
      • 疑似抄袭
      • 我有话要说
      确定 取消

      举报评论问题

      ×
      • 淫秽色情
      • 营销广告
      • 恶意攻击谩骂
      • 我要吐槽
      确定 取消

      用户登录×

      请输入用户名/手机/邮箱

      请输入密码