Easy Circle Logo
返回新聞列表
Android Bench 2.0 發佈:聚焦長週期任務與 AI 代理評估

Android Bench 2.0 發佈:聚焦長週期任務與 AI 代理評估

2026年9月19日·9to5google.com·0 次閱讀
小圈
小圈解讀

Google 幫 AI 考模擬試,睇下佢哋幫手寫 Android App 嘅能力有幾勁,結果發現 AI 寫新嘢好叻,但改舊嘢就仲差少少。

點解重要

呢單新聞話畀我哋聽,AI 已經唔止係幫手寫封電郵咁簡單,佢哋慢慢學緊做一啲要幾日時間先做完嘅複雜工作。如果你係做生意或者想寫 App,未來可能只要講出要求,AI 就可以幫你起個底。

新手貼士

如果你想用 AI 幫你寫嘢或者做嘢,記得「由零開始」叫佢寫通常會準過叫佢改你份舊稿,因為 AI 處理全新嘅嘢會比較順手。

術語小字典

Android Bench:好似一個專門畀 AI 考嘅 Android 開發試卷,用嚟測試邊個 AI 寫 App 最叻。

重構 (Refactoring):即係喺唔改變功能嘅情況下,將入面啲代碼重新整理,好似裝修舊屋但唔拆牆咁。

AI 代理 (AI Agent):唔單止係問答機,而係可以好似個小助手咁,自動幫你執行一連串複雜任務嘅 AI 程式。

Android Bench 2.0 聚焦長週期任務與 AI 代理評估

Google 對 Android Bench 的開發工作於今日持續推進,發佈了 2.0 版本,這反映了人工智能(AI)如何處理更複雜的開發任務。

第一個版本「側重於對現有代碼庫進行增量更改」,例如修復錯誤或較小的功能需求。Android Bench 2.0 則針對「複雜度極高、工程師需要數天甚至一週才能完成的任務」,例如添加新功能、從零開始構建應用程式,以及將跨平台應用程式轉換為 Android 版本。

這種新的焦點需要「更細緻的評估和評分」,超越了單純的通過或失敗等級。Google 正在從二元評分轉向持續評分:

「我們通過功能性、視覺保真度以及避免回歸等多種因素的組合來計算這種完成率。我們還會針對偏離評估指令或結構約束的情況施加客觀的評分處罰。」

Google 已對 Gemini 3.7/3.8 Flash、OpenAI GPT-6、Anthropic Fable 5.1、Kimi K3 以及 Qwen 3.8 Max 進行了評級。GPT-6 Astra 以 28% 的通過率位居基準測試榜首(相比之下,使用先前方法的分數在 90% 範圍內)。

Google 分享了一些見解,例如「將跨平台應用程式移植到 Android 仍然是一個公開的挑戰——沒有模型能達到 100% 的通過率,而尖端模型的最高完成率僅為 80%」。

「……AI 在編寫新代碼方面比重構現有代碼表現更好。重構和遷移變得更加棘手,因為成功取決於架構的複雜性,而非代碼量。」

「模型在成熟的、確定性的轉換上展現出強大的能力,例如將 Java 轉換為 Kotlin、將 Retrofit 更換為 Ktor,或者引入 ViewModel 層。」

「……當任務需要運行時驗證(例如缺失依賴注入圖)、涉及破壞性的框架更改,或者遇到未發佈庫的知識空白時,模型會感到吃力。」

在代理評估方面,Android Bench 運行了「來自相應模型供應商的代理」,例如在 Google Antigravity 上運行的 Gemini 3.8 Flash,以及配合 Codex 運行的 GPT-5.6 Sol。Google 表示「架構設計對開發者的成果有積極影響」,Android Bench 計劃在未來納入不同的模型和代理組合。

資料來源

本文由 AI 自動翻譯整理,內容以原文為準。

GoogleAndroid人工智能AI代理軟件開發