英偉達(NVDA.US)推出新AI模型Fugatto，可修改並生成新聲音

智通財經 · 11/26 11:45

英伟达(NVDA.US)推出了一款用于生成音乐和音频的新型人工智能(AI)模型，旨在为制作音乐、电影和视频游戏的人们提供服务。

智通财经APP获悉，英伟达(NVDA.US)推出了一款用于生成音乐和音频的新型人工智能(AI)模型，旨在为制作音乐、电影和视频游戏的人们提供服务。

根据英伟达的说法，这款模型名为Fugatto(Foundational Generative Audio Transformer Opus)，可以使用任何文本和音频文件来生成或修改音乐和声音。

例如，该模型可以根据文本提示创建音乐片段，从现有歌曲中删除或添加乐器，改变声音中的口音或情绪，甚至发出从未听过的声音。

英伟达应用音频研究经理、管弦乐队指挥兼作曲家Rafael Valle表示：“我们希望创建一个能像人类一样理解和产生声音的模型。”

英伟达指出，广告代理商可以使用Fugatto快速定位多个地区的现有广告，并在配音中加入不同的口音和情感。此外，视频游戏开发者可以使用人工智能模型修改游戏中预先录制的资产，以适应用户在玩游戏时不断变化的动作。

Fugatto可以使小号发出狗吠声或萨克斯管发出喵喵声。该公司补充说，通过微调和少量的歌唱数据，研究人员发现它可以处理未经预先训练的任务，比如从文本中生成高质量的歌声。

英伟达表示，Fugatto的完整版本使用了25亿个参数，并在包含32个Nvidia H100 Tensor Core GPU的Nvidia DGX系统上进行了训练。该模型的整体工作耗时一年多。

Fugatto可能会与Runway等初创公司以及 Meta Platforms(META.US)等大公司的类似技术展开竞争。10月，Meta 发布了名为Movie Gen的人工智能模型，该模型可以根据用户提示创建逼真的视频和音频剪辑。

今年 2 月，ChatGPT制造商OpenAI推出了Sora，它可以根据文本指令创建逼真且富有想象力的场景。这家由微软(MSFT.US)支持的公司尚未向公众发布文本转视频模型。

英偉達(NVDA.US)推出了一款用於生成音樂和音頻的新型人工智能(AI)模型，旨在爲製作音樂、電影和視頻遊戲的人們提供服務。

智通財經APP獲悉，英偉達(NVDA.US)推出了一款用於生成音樂和音頻的新型人工智能(AI)模型，旨在爲製作音樂、電影和視頻遊戲的人們提供服務。

根據英偉達的說法，這款模型名爲Fugatto(Foundational Generative Audio Transformer Opus)，可以使用任何文本和音頻文件來生成或修改音樂和聲音。

例如，該模型可以根據文本提示創建音樂片段，從現有歌曲中刪除或添加樂器，改變聲音中的口音或情緒，甚至發出從未聽過的聲音。

英偉達應用音頻研究經理、管絃樂隊指揮兼作曲家Rafael Valle表示：「我們希望創建一個能像人類一樣理解和產生聲音的模型。」

英偉達指出，廣告代理商可以使用Fugatto快速定位多個地區的現有廣告，並在配音中加入不同的口音和情感。此外，視頻遊戲開發者可以使用人工智能模型修改遊戲中預先錄製的資產，以適應用戶在玩遊戲時不斷變化的動作。

Fugatto可以使小號發出狗吠聲或薩克斯管發出喵喵聲。該公司補充說，通過微調和少量的歌唱數據，研究人員發現它可以處理未經預先訓練的任務，比如從文本中生成高質量的歌聲。

英偉達表示，Fugatto的完整版本使用了25億個參數，並在包含32個Nvidia H100 Tensor Core GPU的Nvidia DGX系統上進行了訓練。該模型的整體工作耗時一年多。

Fugatto可能會與Runway等初創公司以及 Meta Platforms(META.US)等大公司的類似技術展開競爭。10月，Meta 發佈了名爲Movie Gen的人工智能模型，該模型可以根據用戶提示創建逼真的視頻和音頻剪輯。

今年 2 月，ChatGPT製造商OpenAI推出了Sora，它可以根據文本指令創建逼真且富有想象力的場景。這家由微軟(MSFT.US)支持的公司尚未向公衆發佈文本轉視頻模型。

譯文內容由第三人軟體翻譯。

以上內容僅用作資訊或教育之目的，不構成與富途相關的任何投資建議。富途竭力但無法保證上述全部內容的真實性、準確性和原創性。

英伟达(NVDA.US)推出新AI模型Fugatto，可修改并生成新声音