
Perplexity 聯手 Nvidia 推出 Portable Computer:全本地運行 AI 代理人,零 Token 成本
Perplexity 同 Nvidia 合作推出新功能,等你可以喺自己部電腦直接行 AI,唔使再畀錢買 Token,仲更加保密添!
點解重要
以前用 AI 就好似去茶餐廳飲凍飲要加兩蚊咁,每問一條問題都要計錢(Token)。而家你可以喺自己部電腦行 AI,就好似自己喺屋企沖奶茶咁,飲幾多杯都唔使額外畀錢,最重要係啲私人文件(好似稅單、銀行結單)唔使上傳去人哋個雲端,安全好多。
新手貼士
如果你想喺本地行 AI,電腦張顯示卡(GPU)好重要。今次呢個功能要求至少有 24GB 記憶體(VRAM),買電腦嗰陣記得問清楚張卡夠唔夠力。
術語小字典
Token:AI 計算文字嘅單位,就好似跳錶的士咁,用得愈多文字,跳錶就跳得愈快,收費愈貴。
本地運行 (Local):指所有運算都喺你面前部電腦入面搞掂,唔使經互聯網傳去人哋公司嘅伺服器。
AI 代理人 (AI Agent):唔單止係陪你傾偈,仲識得幫你做嘢(例如睇完幾十份文件後幫你寫報告)嘅智能助手。
Perplexity 聯手 Nvidia 推出 Portable Computer:全本地運行 AI 代理人,零 Token 成本
Perplexity 今日正式推出 Portable Computer,這是其代理型「電腦」(Computer)平台的全新版本,完全在用戶現有的硬件上運行——首階段支援 Nvidia 的 DGX Spark 桌面超級電腦以及配備 Nvidia RTX GPU 的 Linux 機器。
這次發佈是與 Nvidia 緊密合作開發的成果,是迄今為止將嚴肅的 AI 代理人工作負載從雲端轉移到本地設備的最激進嘗試之一。模型、用戶文件以及工作過程本身都可以保留在機器內。在本地完成的工作不會消耗任何計費額度,該公司表示,預設情況下每項任務都會在設備上啟動——系統在將任何個別步驟發送到雲端更強大的前沿模型(Frontier Model)之前,會先徵求用戶許可。
「我們基本上將完全相同的用戶界面帶到了全本地應用程式中,」Perplexity 基礎設施與企業工程副總裁 Nate 在週一的新聞發佈會上表示。「這整合了整個代理人框架、推理引擎以及本地工作所需的一切。」
對於在過去兩年一直向世界推銷萬億美元 AI 數據中心的 Nvidia 來說,這次公告傳遞了一個更微妙但具戰略意義的訊號:這家晶片製造商相信本地 AI 已經跨越了從愛好者好奇心到實用工具的門檻——並且它希望銷售能運行這些工具的硬件。
「本地 AI 已經達到了一個轉折點,」Nvidia 開發者技術總監 Nader 表示,他專注於開發者工具和開源領域。「在很長一段時間內,這只是愛好者和發燒友的玩意,他們運行的是那些為了變得極小而經過量化的模型……雖然那很酷,但並不實用。但隨著許多極具用途的新開源模型出現,這一切都改變了。」
Portable Computer 如何將完整的本地 AI 技術棧封裝到單一應用程式中
Perplexity Computer 是該公司的知識工作代理平台,負責協調 AI 模型、文件、工具和網絡訪問,以完成多步驟任務——例如審查文件夾、分析數據、製作報告並將結果推送到業務系統。Portable Computer 在本地複製了這種體驗:本地模型、代理人框架、推理引擎、工具、應用程式連接器和安全沙箱全部封裝在一個系統中。這種捆綁正是重點所在。對於目前大多數本地 AI 技術棧,用戶必須分別組裝和操作這些組件——下載模型權重、架設推理伺服器、連接工具並調整性能。
「歷史上,啟動本地 AI 技術棧一直非常痛苦,」Nate 說。「通過 Portable Computer,我們真正專注於讓這成為一種非常直觀的體驗,讓你可以非常快速地投入運行。」
在週一的一個演示中,系統扮演了散戶投資者的角色,審查一個包含 1099 表格和投資文件的文件夾——這類敏感的財務資料是許多用戶猶豫是否要上傳到雲端服務的。在 DGX Spark 上以全 GPU 利用率運行一個 270 億參數的 Qwen 模型,代理人審查了每份文件,並標記出該虛擬投資者支付不必要費用的情況。Nate 指出,通常顯示雲端額度累計的界面元素「就停留在零,因為這一切都發生在設備上」。
第二個演示展示了產品的混合模式。Nate 扮演初創公司創辦人,要求代理人在本地分析用戶漏斗數據的 CSV 文件,然後使用 Perplexity 的連接器生態系統將完成的分析推送到 Slack 頻道——證明「本地優先」並不代表「斷網」。
系統還連接到 Google Drive、Gmail 和 GitHub,並在本地模型達到極限時可以升級到雲端前沿模型。發佈初期,用戶可以設置 Qwen 3.8 27B 或 PPLX 27B(Perplexity 在其自身框架上進行後期訓練的版本),Nvidia 的 Nemotron 3.5 Lightning 也即將推出。
Portable Computer 今日起供 Linux 上的 Pro、Max、Enterprise Pro 和 Enterprise Max 訂閱者使用,Windows 支援將於 9 月推出。任何擁有至少 24GB VRAM 的 RTX GPU(大約是 GeForce RTX 3090 或更新型號)都符合門檻,Nate 稱這個門檻是「我們真正希望確保能提供出色體驗,同時兼顧廣泛可用性的底線」。
為什麼共同設計模型與代理人框架優於通用框架
隨同發佈,Perplexity 發表了一篇研究論文,認為有效的本地代理人需要模型與代理人框架(模型周圍的提示詞、工具和協調邏輯支架)進行共同設計。核心見解是:通用框架假設前沿模型可以吸收巨大的上下文、導航龐大的工具界面並進行長遠規劃。小型本地模型在這些需求下會崩潰。
Perplexity 通過實驗發現,雖然像 Qwen 3.8 27B 這樣的模型宣稱擁有 260,000 個 Token 的上下文窗口,但在超過 100,000 個 Token 後就會開始感到吃力。因此,該公司構建了一個刻意極簡的框架:簡潔的系統提示詞、一組核心工具,以及像按需「技能」一樣加載和卸載的功能,而不是永久留在上下文中。它將 Gmail 和 GitHub 等熱門連接器從耗費 Token 的 MCP 伺服器轉換為精簡的命令行工具,添加了監控任務健康狀況的自我驗證掛鉤,並強制執行始終開啟的作業系統級沙箱。如果沙箱不可用,框架會自行停用,而不是在無保護的情況下運行工具——這與預設情況下以用戶完整權限運行命令的開源框架形成對比。
Perplexity 報告的基準測試結果非常顯著,儘管這些結果來自公司自身的評估。在其內部的「本地知識工作基準測試」(Local Knowledge Work Bench)中——包含 53 項涵蓋深度研究、財務分析和文件創作的任務,Perplexity 表示計劃將其開源——在 DGX Spark 上運行的 Qwen 3.8 27B 得分為 82.6%,而開源的 Pi 框架得分為 77.6%,運行相同模型的 Hermes 得分為 74.0%。Perplexity 經過後期訓練的 PPLX 27B 將得分推高至 85.4%。在更困難的任務上,差距顯著擴大:在網頁研究基準測試 BrowseComp 中,Computer 的準確率達到 66.7%,而 Pi 為 50.2%,Hermes 為 43.9%,同時比 Pi 減少了 51% 的實際耗時和 70% 的 Token 使用量。在多模態文件理解方面,Computer 得分為 65.1%,而 Hermes 為 34.6%,Pi 為 13.9%。
Token 經濟學推動 AI 代理人從雲端走向本地硬件
當你考慮 AI 工作負載的變化時,這次發佈背後的戰略邏輯就變得很清晰。聊天是爆發性的——一個問題,一個答案,結束。代理人則不同。
「對於代理人,如果可以的話,你希望這些代理人始終開啟。你希望代理人盡可能多地消耗 Token,」Nader 說。「我們看到的是對 Token 永無止境的需求,這正是本地 AI 如此出色的原因。正如你在所有這些演示中看到的,你不會被 Token 計費。你不需要為 Token 付費。所以這對代理人來說簡直是殺手鐧。」
這重新定義了本地硬件的價值主張。一個運行數小時來審查文件、驗證自身工作並迭代分析的代理人,在雲端會產生巨額的 API 帳單。在用戶已擁有的設備上,這些 Token 的邊際成本接近於零。Perplexity 的論文明確提出了這一點的企業版論點:隨著代理人在個人工作流和整個組織中擴展,Token 支出和數據移動「變得越來越難以管理」。本地優先執行同時解決了這兩個問題——支出,因為推理是免費的;隱私,因為敏感的 Token 永遠不會離開設備邊界。
或許最具商業趣味的結果涉及混合中間地帶。在挑戰性極高的編碼基準測試 Terminal Bench 2.1 中,完全本地的 Qwen 模型在邊際成本基本為零的情況下得分為 59.6%。允許它升級到雲端的 Claude Opus 5「顧問」後,得分提高到 73.0%,每項任務估計成本為 0.415 美元。單獨運行前沿模型的得分為 82.4%,每項任務成本為 0.65 美元。換句話說,升級機制以約三分之二的成本彌補了與前沿性能差距的約五分之三——而用戶可以決定這種權衡何時值得。在任何顧問調用之前,框架會對傳出的上下文運行 PII(個人身份資訊)分類器,並向用戶準確顯示哪些內容將離開設備。遠程模型僅返回文本指導;它永遠不會接觸本地文件或工具。
Portable Computer 與 Ollama 及 DIY 本地 AI 技術棧的關係
The Deep View 的 Jason Hiner 追問兩家公司 Portable Computer 與 Ollama 等現有本地推理工具的關係。Nate 的回答劃清了界線:這些工具解決的是問題的不同層面。
「這裡的大部分精力都花在了代理人框架層面,」他說,並指出系統底層使用 vLLM 來託管模型推理,並為想要插入自己推理端點的用戶提供進階模式。「我們對正在合作的 Qwen 和 Nemotron 模型都進行了大量的後期訓練,以獲得最佳結果……我們的重點一直是真正磨合整個技術棧,從上到下,將模型推理和框架結合在一起。」
Nader 的說法更生動。「僅僅讓推理在 Spark 上快速運行——有一條平坦的路。你可以使用 Ollama。你可以完成設置。但隨後,當你開始做更複雜、更具代理性的事情時,突然間你需要更多性能。你開始尋找不同的模型。你開始尋找不同的框架,這有點像海洋。你走得越深,它就變得越深。」
這種「家電化」的推銷似乎打動了至少一位與會者。Ben 描述自己雖然是工程師,但在設置自己的 DGX Spark 時感到很吃力——「這種體驗很糟糕,我們必須修復它」——他說這款產品感覺像是「讓人們真正感受和理解代理人含義所需的解鎖,而你需要正確的用戶體驗(UX)來實現它」。Nvidia 還強調硬件是可以擴展的:通過共享記憶體連接兩個 Spark 可以運行 DeepSeek 最新款的前沿級開源模型,四個可以運行 GLM 5.2 或 Nemotron Ultra。「我甚至見過八個 Spark 被連接在一起,」Nader 說。
Nvidia 與 Perplexity 聯盟深化對兩家公司的意義
這次發佈延續了已經建立一年多的合作夥伴關係。2025 年 6 月,Nvidia 和 Perplexity 宣佈合作為歐洲出版商和電信商帶來主權 AI 模型,這是執行長 Jensen Huang 奔走各國說服各國政府行動的一部分,正如美聯社在巴黎 VivaTech 報導的那樣,「每個國家都需要國家智能基礎設施」。主權 AI 的論點——用 Huang 的話說,數據「屬於你們的人民、你們的國家、你們的文化」——在哲學上與 Portable Computer 在單張辦公桌規模上提出的論點相同:你控制的智能,在你擁有的硬件上運行。
這對兩家公司都有其自利的邏輯。Perplexity 在估值穩步攀升的同時籌集資金,但也面臨出版商對其內容做法的法律壓力——包括 The New York Times 在 2025 年 12 月提起的訴訟以及早前與 Forbes 的公開爭議——它獲得了一款經濟效益不依賴於對每個 Token 計費的產品,以及進入法律、醫療和金融等隱私敏感企業的差異化切入點。Nvidia 則為 DGX Spark 獲得了一款殺手級應用程式,根據週一簡報會與會者的說法,這款設備一直以來買比用容易。當一名記者詢問 Spark 是否會預裝 Portable Computer 和 Nemotron 模型出貨時,Nader 委婉地表示不排除這種可能性:「那會很酷……目標只是確保每個用戶都有超流暢的體驗。」
疑問依然存在。Perplexity 最令人印象深刻的數據來自其內部基準測試,該公司承認小型模型在困難的推理任務上仍明顯落後於前沿模型——顧問升級「縮小但未能完全消除差距」。目前該產品僅限 Linux,24GB VRAM 的底線排除了絕大多數消費級電腦,而 Apple Silicon——一些最熱衷於本地 AI 的修補者的家園——在路線圖中明顯缺席。「我們現在非常專注於 Nvidia 硬件,」Nate 在被問及時表示。
但發展方向是明確的。Perplexity 的研究人員將這次發佈描述為「一種更廣泛轉變的一部分,在這種轉變中,能力日益增強的代理人從遠程基礎設施轉移到個人和本地設備」,兩家公司都押注晶片和開源模型的進步將不斷擴展桌面上那個盒子所能做的事情。在週一的演示中,最能說明問題的細節不是基準測試分數——而是屏幕角落那個計費計數器,當代理人處理一疊稅務文件時,它靜靜地停留在零。兩年來,AI 行業一直以吉瓦(Gigawatts)和每美元 Token 數來衡量其雄心。Portable Computer 提出了一種不同的計量方式,一種永遠不會跳動的計量方式。
資料來源
本文由 AI 自動翻譯整理,內容以原文為準。
