我創造了自己的互動式數碼分身——你現在可以跟「她」對話了
一位外國記者搵咗間科技公司幫手,整咗個同自己一模一樣嘅「數碼分身」,唔單止樣貌把聲似到足,仲可以幫手回答讀者問題!
點解重要
想像下如果你去旅行或者放假,都有個「分身」幫你處理公司啲客嘅查詢,係咪好方便呢?呢項技術代表未來我哋每個人都可能有一個數碼助手,幫手做啲重複性嘅工作。
新手貼士
如果你想試下整 AI 影片,可以留意文中提到嘅 Synthesia 或者 HeyGen 呢類平台,只要輸入文字,個虛擬人像就會幫你講出嚟,唔使自己出鏡㗎!
術語小字典
數碼分身 (Digital Avatar):用電腦技術整出嚟嘅虛擬人像,外表同把聲都可以模仿到同真人一模一樣。
確定性模型 (Deterministic Model):好似一部跟足說明書嘅機器,你問佢特定問題,佢只會根據預先學好嘅資料回答,唔會亂噏。
API 平台:好似一個插座咁,等其他公司嘅軟件可以接駁埋一齊,用呢間公司嘅 AI 技術嚟開發新功能。
我創造了自己的互動式數碼分身——你現在可以跟「她」對話了
當影片生成初創公司 Synthesia 的企業事務主管 Alexandru Voica 在今年夏天向我發送一個連結,介紹他們公關團隊的新成員時,我感到非常驚訝。那是一個他的互動式虛擬分身,經過訓練後可以回答有關 Synthesia 的常見媒體問題,例如公司的業務內容和運作方式。就在前一天,我還在一個研討會上,當時公關人員問我是否介意使用 AI 生成文本的投稿。但 Alexandru 的分身超越了這一點——對我來說,這似乎是公關領域使用 AI 的「終極大佬」。
9 月,Synthesia 邀請我參觀其位於紐約的新辦公室。Synthesia 最初總部位於英國,是與 D-ID、HeyGen 和 Colossyan 並列的熱門數碼分身初創公司。該公司在今年早些時候的估值達到 40 億美元,並表示去年其年度經常性收入(ARR)已突破 1 億美元。
Synthesia 讓企業能夠利用 AI 分身製作互動式培訓影片,最近還推出了一款名為 Roleplay Sessions 的產品,讓員工可以與互動式 AI 分身練習銷售演講等內容,AI 分身會做出回應並為他們的表現評分。
當我前往新辦公室開幕禮,他們問我是否想要擁有自己的 AI 分身時,我毫不猶豫地答應了。我當然想要自己的數碼孿生。那天我的打扮很可愛,髮型也整齊到位。
在遇到我的數碼孿生之前,我對分身一直持冷淡態度,但我感覺它們不可避免地會成為日常網絡生活的一部分。我聽說 Instagram 上有人以自己的形象創建分身,以幫助他們製作社交內容。我覺得這一切都非常有趣,這也許就是為什麼我現在可以毫無顧慮地向你們展示我的數碼孿生。這是 Synthesia 第一次為記者(或者除了 Voica 之外的任何人)製作數碼分身。它是根據我關於「為什麼有風險投資支持的初創公司比沒有風投支持的初創公司更容易發生欺詐」的報導進行訓練的,並且只會回答有關該報導的問題。
在下方,只需按下「在新視窗中開始」即可開始。
你可以問它以下問題:
我為什麼決定寫這個故事?
這篇研究論文是關於什麼的?
研究人員發現了什麼?
為了製作這個分身,我進入了位於 Synthesia 辦公室內的一個小型電影攝影棚,在那裡他們為我拍了許多照片,並錄製了兩分鐘的聲音。我必須同意製作這些分身,於是,「數碼 Dom」誕生了。他們為我製作了一個個人分身(只會朗讀我給它的任何劇本)——有戴眼鏡和沒戴眼鏡的版本;他們還為我製作了兩個互動式分身(可以回話並聽我說話),同樣有戴眼鏡和沒戴眼鏡的版本。
我們選擇了一篇文章來訓練互動式分身,然後其中一個團隊構建了我的互動式分身,它由語音轉文字、影片、語言和文字轉語音模型的組合驅動。我分身的技術棧包括 Synthesia 自家的影片和語音模型,儘管該公司也允許客戶選擇來自其他實驗室(如 Cartesia、ElevenLabs、Google 或 OpenAI)的替代方案。企業也可以選擇將他們的分身託管在任何他們想要的雲端平台上,或者付費給 Synthesia 進行託管。
語音轉文字模型將人們說的話轉化為文字,代理語言模型理解文字並根據其採取行動,文字轉語音模型將回應轉化為音訊,最後由影片模型(由 Synthesia 構建)在分身說話時製作動畫。
總體而言,Synthesia 構建了三類產品——一個帶有經典分身的影片創作和分發平台,用戶輸入劇本,分身就會重複;一個名為 Sessions 的代理平台,人們可以在調查或角色扮演中與分身互動;以及一個 API 平台,人們可以獲取 Synthesia 的影片和語音模型,並將其與其他技術服務結合,以構建互動式分身或其他類型的產品。
Synthesia 團隊花了幾天時間製作我的分身。我先試用了個人分身,輸入了一段相當普通的劇本,看看我的 AI 聲音聽起來如何。我讓它談論紐約秋天的到來,那是我一年中最喜歡的時光。聲音相當準確,我很慶幸它沒有錄下我錄製音訊樣本時的沙啞聲。
我把它展示給一些非科技界的朋友看,他們覺得既有趣又令人毛骨悚然。
然後我向他們展示了我的互動式分身,它是確定性的(deterministic),這意味著它只會說經過訓練後需要回應的內容。在這種情況下,就是我那篇關於風投欺詐的故事。我問它一些問題,例如我在加入 TechCrunch 之前在哪裡工作,以及我住在紐約的哪個區域,但每次它都會引導我回到故事本身。
我的朋友不覺得聲音很像我,認為外貌擬真度不如個人分身,但儘管如此,它已經足夠接近,讓人感到有些毛骨悚然。我媽媽稱之為「太神奇了」,這對她來說是相當高的評價。她和我父親一直試圖問它「只有他們才知道」的關於我的問題——但模型沒有回答,每次都將他們重新引導至風投欺詐的故事。
「我不記得生過兩個你,」她在測試模型後開玩笑說。
這次經歷讓我思考新聞業的未來會是怎樣。人們會接受打開新聞看到是由分身呈現的嗎?一位投資者立即告訴我「不」。當然,今天對於滲透進社交媒體和其他新聞分享平台的「AI 垃圾內容」(AI slop)有很多抵制。但我問過的其他人的態度則沒那麼確定。分身能否增強——甚至取代——記者?CEO 們會想與記者的 AI 分身交談,而不是與真人交談嗎?
我喜歡我的職業生涯的原因在於與人建立聯繫、撰寫故事和研究新課題。但新聞業最重要的部分是信任。這似乎永遠無法外判給 AI。
在新聞業之外,我確信複製自己的想法可能很有吸引力。假期或度假後不再需要趕工作,因為一個版本的你始終在場,回答問題。
我們將拭目以待分身在美國企業界的使用演變。但現在既然我有了自己的分身,我的心情很矛盾。在度過了最初的新奇感後,我在分身停止說話後仔細觀察它並等待——等待什麼,我不確定。也許我在等它眨眼。或者說些新東西,或者微笑,或者只是讓我知道它知道。
因為我的數碼孿生是確定性的,它們永遠不會那樣做。但我可以看到,如果有人使用非確定性的分身(即由可以自由發表議論的聊天機器人驅動的分身),是多麼容易陷入一絲「AI 精神錯亂」(AI psychosis)中。
我告訴一位投資者,無論數碼孿生的未來如何,我預測我這一代(Z 世代)可能不會習慣它們。它們感覺像科幻小說:我們在電影中看過的一切現在都實現了。但我會說,我覺得數碼分身比人形機器人沒那麼讓人不安。至少對於分身,如果事情變得奇怪,我隨時可以登出。
不過在此之前,這是我的個人分身,為你概述本週我們網站上的所有熱門故事!
資料來源
本文由 AI 自動翻譯整理,內容以原文為準。
