英偉達發(fā)布全新 AI 音頻模型 Fugatto
編譯/前方智能
英偉達近日推出了一款名為 Fugatto(全稱為 Foundational Generative Audio Transformer Opus 1)的 AI 音頻模型。這款模型不僅能通過文字提示生成音樂和音效,還能對現(xiàn)有音頻進行修改和轉(zhuǎn)換,創(chuàng)造出前所未有的聲音組合。
圖源:英偉達
據(jù)英偉達介紹,F(xiàn)ugatto 具備多項獨特功能,比如可以將鋼琴演奏的音樂轉(zhuǎn)換為人聲演唱,能夠調(diào)整語音的口音和情緒,甚至可以創(chuàng)造出"尖叫的薩克斯"或"犬吠般的小號聲"等超現(xiàn)實音效。該模型采用了創(chuàng)新的 ComposableART 技術(shù),能夠?qū)⒂柧氝^程中分別出現(xiàn)的音頻特征進行組合,從而產(chǎn)生全新的聲音效果。
在技術(shù)層面,研究團隊使用了來自全球多個開源數(shù)據(jù)集的約 2000 萬個音頻樣本進行訓練,形成了一個擁有 25 億參數(shù)的大規(guī)模模型。該項目由來自印度、巴西、中國、約旦和韓國等多個國家的研究人員共同開發(fā),這種多元化的團隊構(gòu)成也使得模型在處理多語言和多重口音方面表現(xiàn)出色。
英偉達應用深度學習研究副總裁 Bryan Catanzaro 表示,生成式 AI 技術(shù)將為音樂、游戲和普通創(chuàng)作者帶來全新的創(chuàng)作可能性。不過,考慮到生成式技術(shù)可能帶來的潛在風險,英偉達目前尚未計劃對外發(fā)布這項技術(shù)。
原文標題 : 英偉達發(fā)布全新 AI 音頻模型 Fugatto

請輸入評論內(nèi)容...
請輸入評論/評論長度6~500個字
最新活動更多
-
即日-9.1立即下載>> 【限時下載】ADI中國三十周年感恩回饋助力企業(yè)升級!
-
即日-9.16點擊進入 >> 【限時福利】TE 2025國際物聯(lián)網(wǎng)展·深圳站
-
10月23日立即報名>> Works With 開發(fā)者大會深圳站
-
10月24日立即參評>> 【評選】維科杯·OFweek 2025(第十屆)物聯(lián)網(wǎng)行業(yè)年度評選
-
11月27日立即報名>> 【工程師系列】汽車電子技術(shù)在線大會
-
12月18日立即報名>> 【線下會議】OFweek 2025(第十屆)物聯(lián)網(wǎng)產(chǎn)業(yè)大會
推薦專題