
俄羅斯數學家研發 AI「心靈感應」:無需文字即可跨模型溝通
俄羅斯科學家發明咗一種方法,等唔同嘅 AI 模型唔使講嘢(輸出文字),直接用數學「心靈感應」嚟交流,令細模型都可以有大模型咁叻。
點解重要
呢項技術就好似將名廚嘅腦袋直接「橋接」落去普通廚師度,令平價嘅手機 AI 都可以有超級電腦咁強嘅能力,做生意嘅成本會平好多,速度亦快好多。
新手貼士
如果你想試下呢啲「開源模型」,可以去一個叫 Hugging Face 嘅網站睇下,嗰度就好似 AI 業界嘅「公眾圖書館」,有好多免費模型可以下載。
術語小字典
權重 (Weights):好似食譜入面每種材料嘅份量比例,決定咗 AI 點樣處理資訊。
參數 (Parameters):代表 AI 腦袋嘅複雜程度,通常數字愈大,AI 就愈聰明,但亦愈貴。
開源權重模型 (Open-weight models):即係將 AI 嘅「腦袋結構」公開畀大家免費使用,好似共享軟件咁。
俄羅斯數學家研發 AI「心靈感應」:無需文字即可跨模型溝通
我最近會見了一些才華橫溢的俄羅斯數學家,他們向我展示了一種讓人工智能模型透過類似於「機器心靈感應」的方式進行溝通的方法。
這些數學家效力於一家名為 Mostik 的初創公司——這個詞在俄語中意為「橋樑」。這正呼應了該團隊的方法:允許不同的模型利用其「權重」(weights)中的數學數值進行互動,而權重正是決定提示語(prompt)如何轉化為輸出的關鍵因素。在實際應用中,這意味著大型模型的能力可以傳輸給小型模型,從而更有效地提升後者的智能水平。
這家初創公司利用這種方法構建了一個模型,該模型在 ARC-AGI 3(一個對 AI 模型而言極具挑戰性的著名競賽)中迅速攀升至榜首。(由於他們希望贏得比賽,因此不願透露更多細節。)然而,為了演示這一概念,他們還在兩個中國的開源權重模型之間搭建了橋樑:分別是擁有 7,530 億參數的 GLM-5.2 最大版本,以及可以在流動裝置上運行的 40 億參數版本 Qwen-3.5。最終產生的混合系統成本僅為完整 GLM 模型的二十分之一,而其性能表現則恰好處於兩者之間。
Mostik 的行政總裁 Sasha Malysheva 在喝咖啡時告訴我:「在機器學習領域,眾所周知模型集群的表現比單一模型更好。」
開發出這種方法的 Malysheva 分享了公司內部的一個笑話:AI 的未來類似於猜測豬的重量。在數學界,眾所周知,如果將一群隨機人士的猜測結合並取平均值,他們往往能比專家更準確地估計豬的重量。
就像集體目測豬的重量一樣,結合多個 AI 模型的輸出通常會獲得更好的結果。通常情況下,這涉及將一個模型的輸出輸入到另一個模型中,這需要耗費大量的時間和金錢。然而,Mostik 團隊找到了一種方法,讓 AI 模型在不產生文字輸出的情況下互相交談。如果這種方法流行起來,它可能會增加開源權重模型的價值,讓它們能更好地與 Anthropic 和 OpenAI 等前沿實驗室提供的封閉式專有模型競爭。
Malysheva 表示,結合許多不同的模型可能是推進 AI 發展的更好方法。她在談到擴大模型規模並餵入更多數據的策略時告訴我:「我個人認為,未來我們不會擁有單一的龐大模型,模型的性能也不會僅僅來自於規模擴張。」
AI 軟件公司 Lovable 的技術主管 Vladimir Arustamian 認識 Mostik 團隊,他表示:「如果 Mostik 能夠將前沿模型與特定領域的模型(例如生物學、物理學等)配對,那麼將會有更多專業化模型得到訓練。這個團隊才努力了幾個月,就已經讓一些我原以為要幾年後才能實現的東西運行起來了。」
曾在 Google DeepMind 工作、熟悉該公司技術的電腦科學家 Karl Tuyls 表示,Mostik 的技術意味著「你可以在不需要大型模型處理整個流程的情況下,達到接近大型模型的質量,只需讓一個小型模型在旁運行即可獲得實質性的改進」。Tuyls 說,對於任何負責盡可能高效運行模型的人來說,這種方法都是不二之選。
日內瓦大學教授、2010 年菲爾茲獎(Fields Medal)得主 Stanislav Smirnov 是 Mostik 的首席科學家。他表示,要在兩個 AI 模型之間找到共同點出乎意料地困難。「目前似乎還沒有合適的數學語言,」他說。在此期間,Mostik 的方法正是一種從字面上「彌合差距」的方式。
資料來源
Wired
These Russian Mathematicians Taught AI Models How to Talk to Each Other Without Using Words - WIRED
本文由 AI 自動翻譯整理,內容以原文為準。
