PCDIY!業界新聞
不是只有 AI 這麼簡單:GAN 研究成果如何重塑視訊會議,以 GAN 研究成果為基礎的 NVIDIA Maxine 雲端 AI 視訊串流 SDK於 CVPR 2021 大會中展示
(本資訊由廠商提供,不代表PCDIY!立場) 2021-06-25 12:06:44在 NVIDIA (輝達) 研究人員開發的人工智慧 (AI) 協助下,從床上起床、打開筆電電源和網路攝影機,便能在每次進行視訊通話時,呈現完美的畫面。
NVIDIA 針對視訊會議推出的 NVIDIA Maxine SDK,背後運用眾多深度學習模型,其中包含 Vid2Vid Cameo,該模型使用生成對抗網路 (GAN),只要使用單一人像平面照片,就能在視訊通話中合成出說話者栩栩如生的立體頭像。
參與者只需要在加入視訊通話前先上傳一張參考圖片,可以是自己的真實照片或卡通圖片,就能使用這項功能。開會時,AI 模型會抓取每個人的即時動作,接著將這些動作套用在先前上傳的靜態圖片上。
這意味著只要與會者先上傳好穿著正式服裝的照片,就算剛起床且頂著一頭亂髮、身上還穿著睡衣,直接進行會議也沒問題,因為 AI 會將與會者的臉部動作套用在靜態的參考照片上,在會議平台中顯現出體面的打扮。要是與會者將身體轉向左邊,這項技術可以調整視角,讓這個人看起來像是正對著網路攝影機。
除了讓與會者看起來體面之外,這項 AI 技術還能將視訊會議所需的頻寬減少十倍,以避免出現畫面抖動和延遲的情況。該技術很快就會在 NVIDIA Video Codec SDK 中,作為 AI Face Codec 供大家使用。
這項專案的共同作者,也是 NVIDIA 的研究人員劉洺堉(Ming-Yu Liu)表示:「許多人使用的網路頻寬有限,但還是想要與親友們流暢地在網路上聊天,而這項技術除了能協助他們之外,此基本技術還能協助動畫師、照片編輯員和遊戲開發者完成手上的工作。」
NVIDIA 本週將於著名的 Conference on Computer Vision and Pattern Recognition (CVPR) 大會上發表 Vid2Vid Cameo,這是 NVIDIA 在這場線上大會中發表的 28 篇論文之一。Vid2Vid Cameo也可以在 AI Playground 上找到,任何人都可以在那裡親身體驗我們的研究演示。
人工智慧在大會上搶盡風頭
為了向經典的竊盜類電影還有 Netflix 的熱門節目致敬,NVIDIA 的研究人員在某次的視訊會議中,讓他們的對話頭像 GAN 模型大顯身手。在演示的過程中強調 Vid2Vid Cameo 的重點功能,包括臉部重新定向、動畫化身和資料壓縮。你可以透過以下影片更加暸解Vid2Vid 及Vid2Vid Cameo。這些功能很快就會出現在 NVIDIA Maxine SDK 內,為開發人員提供經最佳化調整的預先訓練模型,以用於視訊會議及直播串流中的視訊、音訊及擴增實境效果。
開發人員已經可以使用 Maxine AI 的效果,包括智慧降噪、視訊畫質提升與人體姿勢預估。供免費下載的 SDK 還能搭配 NVIDIA Jarvis 平台使用,以用於包括轉錄和翻譯在內的對話式 AI 應用項目。
AI 向你打招呼
Vid2Vid Cameo 只需要兩個元素,便能建立出用於視訊會議的逼真 AI 對話頭像,包含一張使用者的臉部照片以及一個視訊串流內容,其將決定這個影像要如何進行動作。該模型在 NVIDIA DGX 系統上使用 18 萬個高品質對話頭像的資料集來進行訓練。該網路學習辨識二十個關鍵點,以便在沒有人類加以標柱的情況下,針對臉部動作建立模型。這些關鍵點針對包括眼睛、嘴巴和鼻子在內的特徵位置進行編碼。
接著,模型會從通話者的參考圖片中擷取這些關鍵點,通話者的圖片可以事先發送給其他參與視訊會議的人,或從過往的會議中重複使用。如此一來,視訊會議平台只需發送說話者臉部關鍵點的動作資料,而不用在每一個與會者之間發送龐大的即時視訊串流內容。
對接收者來說,GAN 模型在接收端使用這些資訊來合成一個模仿參考圖片外觀的視訊內容。
這項技術只需要壓縮和來回發送頭部位置及關鍵點,不用發送完整的視訊串流內容,便能將視訊會議的頻寬需求減少十倍,讓用戶擁有更流暢的通話體驗。因此,可以在不影響視覺品質的情況下,配合各種頻寬環境來調整模型,以傳輸不同數量的關鍵點。
使用者也能自由調整產生出的對話頭像視角,從側面或正面顯示、調低或調高攝影機的角度。照片編輯員同樣能將這項功能應用在平面照片上。
NVIDIA 的研究人員發現,Vid2Vid Cameo 可以產生更為真實清晰的結果,不管參考圖片和視訊內容是否出自同一個人,還是當 AI 把一個人的動作轉移到另一個人的參考圖片上,它的表現都比最先進的模型更出色。
後面這項功能可以把說話者的臉部動作,用在視訊會議裡的數位化身上,並讓它們動起來,甚至是讓遊戲或卡通人物呈現出更有真實感的表情和動作。
Vid2Vid Cameo 模型論文的作者為 NVIDIA 研究人員 Arun Mallya和兩位來自台灣的 Ting-Chun Wang、和 Ming-Yu Liu。NVIDIA Research 團隊由全球兩百多名科學家組成,專注於 AI、電腦視覺、自動駕駛車、機器人和繪圖等領域。
在此特別感謝於 Netflix 播出的《紙房子》影集中,替教授進行英語配音的演員 Edan Moses,感謝他為上述我們最新的 AI 研究成果影片所做出的貢獻。
- 發表您的看法
請勿張貼任何涉及冒名、人身攻擊、情緒謾罵、或內容涉及非法的言論。
請勿張貼任何帶有商業或宣傳、廣告用途的垃圾內容及連結。
請勿侵犯個人隱私權,將他人資料公開張貼在留言版內。
請勿重複留言(包括跨版重複留言)或發表與各文章主題無關的文章。
請勿張貼涉及未經證實或明顯傷害個人名譽或企業形象聲譽的文章。
您在留言版發表的內容需自負言論之法律責任,所有言論不代表PCDIY!雜誌立場,違反上述規定之留言,PCDIY!雜誌有權逕行刪除您的留言。
最近新增
- 《七騎士Re:BIRTH》聯名快閃咖啡廳今起登場 官方釋出限定序號 免費領取四皇「孫悟空
- 創見推出DrivePro Body 10D穿戴式攝影機, 全面支援前線執勤與蒐證
- 凱擘大寬頻與國際資安專家趨勢科技獨家續約 強化居家網路防護網
- 深化產學合作能量!華碩攜手臺大培育AI即戰力
- 毛孩家庭如臨大敵!冬天潮濕空氣讓你越清反而越臭!? 石頭科技 F25 ACE Pro 全新超微泡沫洗地技術 解決異味困擾
- NAS也能上水冷!」JONSBO N6 ,9 硬碟、雙電源、長顯卡、雙塔,玩家與專業用戶的「多工存儲怪獸」!
- Red Hat 收購 Chatterbox Labs,強化 AI 信任與安全防護
- 行競科技十年浸沒式冷卻電池創新於 CES 2026 完整落地 首度呈現 EV、ESS 與 AI 資料中心 BBU 三大應用
- LIAN LI 聯力推出 Vector V100R MINI 緊湊型 mATX 機殼,建議售價NTD 1,590 元
- 全漢 FSP 正式推出 VIC GD 系列,為次世代高效能平台而生 金牌效率 × ATX 3.1 × 極高性價比,登錄升級至 5 年保、2 年快換!
- 記憶體、SSD漲價阻升級?全漢「鈦」挺你! 鈦金效率 × A++ 靜音 × 工業級三防漆,FSP出手半價相挺!
- 網石於 The Game Awards 2025公開 《七大罪:Origin》全新預告片
最多人點閱
- SP廣穎電通將於德國2015 Embedded World展示全方位工控系列產品
- IEM於台北國際電玩展熱血開打,購買Intel Core i5/i7處理器系列+SSD 750即得限量好禮
- AMD發表全球首款GPU硬體虛擬化產品線
- 希捷科技:2016年六大科技趨勢
- InWin 805 NVIDIA EDITION機殼爆紅,迎廣GeForce GTX特仕版機箱正式開賣!
- 2024開學季筆電選購指南: 10大熱銷筆電推薦榜
- Windows 10 搭載 Office 版本聲明稿 Office Mobile 、 Office 2016 與 Office 365 版本差異說明
- Lenovo聯想持續拓展伺服器市場,瞄準中型企業推出ThinkServer系列伺服器
- 你的人生「升級」了沒?倒數十天!Windows 10開闊你的無限視野
- 全新Intel Core X系列處理器- Intel Core i9 極致版處理器 重裝上陣
- 微軟攜手研華、凌華與新漢 以Azure IoT Suite串聯物聯網大未來
- PLEXTOR展現軟實力,一舉推出三大獨家軟體
