🏆 TopRankLand
← 所有排行榜
Software

最佳 AI 程式輔助工具 2026

每日更新的最佳 AI 程式輔助工具排行榜,根據程式碼品質、上下文理解、整合體驗、速度和性價比評分。

最後更新: 2026-09-18 · 13 項目每日追蹤

排名走勢 — 前 10 名

數字越小代表排名越高。顯示最近 119 天。

當前排名

#1
Claude Code Anthropic
NT$544/月 9.5/10

終端機優先的 AI 程式代理,核心已升級到 4 月發表的 Claude Opus 4.7,SWE-bench Verified 拿到 87.6%,是目前所有商業工具裡最高的成績。1M token 上下文讓你把整個專案丟進去都還有餘裕,跨 15 個檔案追 bug、全專案重構這些事,它真的能自主跑完。

Code Quality & Accuracy 9.8
Context & Codebase Understanding 9.7
IDE Integration & UX 8.0
Agentic / Autonomous Capability 9.7
Value for Money 9.2
#2
約 NT$640/月+ 9.3/10

OpenAI 的雲端自主編程代理,內建於 ChatGPT Plus 和 Pro 方案,可以在隔離環境中平行執行多個任務,適合大型重構和功能開發。

Code Quality & Accuracy 9.1
Context & Codebase Understanding 8.0
IDE Integration & UX 8.2
Agentic / Autonomous Capability 9.5
Value for Money 8.0
#3
Cursor Anysphere
NT$640/月 9.1/10

把 VS Code 整個以 AI 為核心重建的編輯器。新版 Composer 2 加入了平行代理執行,多文件編輯的連貫性在這個品類裡數一數二,代碼庫索引帶來真正的語意理解,年收入超過五億美元,市場已經給了答案。

Code Quality & Accuracy 9.0
Context & Codebase Understanding 8.5
IDE Integration & UX 9.6
Agentic / Autonomous Capability 9.3
Value for Money 8.1
#4
免費 / 用量計費 8.5/10

Google 在 2026 I/O 端出的 agent-first IDE,桌面版、Go CLI、SDK 一次到位,底層跑的是 Gemini 3.5 Flash。Flash 的速度大概是前沿模型的四倍,上下文視窗又夠大,多個 agent 平行跑起來很順。公開版本有免費方案,想在不綁訂閱的情況下體驗多代理協作,我會直接推這套。

Code Quality & Accuracy 8.2
Context & Codebase Understanding 8.8
IDE Integration & UX 8.5
Agentic / Autonomous Capability 9.0
Value for Money 8.8
#5
隨 AI Pro/Ultra 方案附贈 8.2/10

Google 出品的非同步自主程式代理,Gemini 2.5 Pro 驅動,直接整合 GitHub repository,在雲端沙盒裡規劃並執行多文件任務。完全零 IDE 依賴,對於習慣純 GitHub 工作流的團隊,這個入門門檻最低。

Code Quality & Accuracy 8.0
Context & Codebase Understanding 8.5
IDE Integration & UX 7.5
Agentic / Autonomous Capability 8.5
Value for Money 8.5
#6
Devin Cognition
NT$640/月+ 8.0/10

全球第一個完全自主的 AI 軟體工程師,規劃、執行、部署全程自己來。月費從原本的 $500 大砍到 $20,現在個人開發者也用得起。基礎設施部署、大量樣板生成這類重複性高的任務交給它跑,省力程度很明顯。

Code Quality & Accuracy 8.0
Context & Codebase Understanding 8.0
IDE Integration & UX 7.5
Agentic / Autonomous Capability 9.0
Value for Money 7.0
#7
GitHub Copilot GitHub / Microsoft
NT$320/月 7.9/10

全球 1500 萬開發者在用的 AI 程式工具,所有主流 IDE 都支援,月費才台幣三百出頭,學生還有免費版。Agent Mode 上線後,已經從補全工具進化成真正能自主執行任務的代理。

Code Quality & Accuracy 8.5
Context & Codebase Understanding 8.0
IDE Integration & UX 9.5
Agentic / Autonomous Capability 8.0
Value for Money 6.1
#8
Kiro AWS
免費 / 約 NT$608/月 7.9/10

AWS 推的 spec-driven agentic IDE,以 VS Code 為底、後端接 Bedrock,原本 Amazon Q Developer CLI 的功能現在都收進這裡。它走的是先寫規格再產程式碼的流程,搭配 Agent Hooks 自動化,會先把需求整理成結構化計畫再動手。我自己在那種既要速度、又要每一步都能追溯的企業專案上,會優先拿它來用。

Code Quality & Accuracy 8.0
Context & Codebase Understanding 8.0
IDE Integration & UX 8.5
Agentic / Autonomous Capability 8.3
Value for Money 8.0
#9
Amazon Q Developer Amazon Web Services
NT$608/月 7.8/10

AWS 原生的 AI 程式助理,深度整合雲端與基礎設施。程式生成、安全漏洞掃描、自動化框架遷移都有支援。如果你的工作環境就在 AWS 生態系裡,這個選擇最順手,摩擦最少。

Code Quality & Accuracy 7.5
Context & Codebase Understanding 8.0
IDE Integration & UX 8.5
Agentic / Autonomous Capability 7.5
Value for Money 8.0
#10
Zed Zed Industries
Free+ 7.8/10

用 Rust 寫的 GPU 加速 AI 原生編輯器,啟動速度業界最快。用自己的 API 金鑰就能跑 AI 對話與行內輔助,費用結構完全按用量計算。追求效能、偏好靈活付費模式的開發者,這個值得認真試試。

Code Quality & Accuracy 8.0
Context & Codebase Understanding 7.5
IDE Integration & UX 8.5
Agentic / Autonomous Capability 7.0
Value for Money 8.5
#11
Aider Paul Gauthier (OSS)
免費(API 費用另計) 7.7/10

免費開源的終端機 AI 結對工程師,支援 100 種以上 LLM,每次修改自動用 Git 提交。零訂閱費,只需要付 API 費用,對於接案或跑 Side Project 的開發者來說,靈活度和成本控制都很到位。

Code Quality & Accuracy 8.0
Context & Codebase Understanding 8.0
IDE Integration & UX 7.0
Agentic / Autonomous Capability 8.0
Value for Money 9.5
#12
Windsurf Codeium (acq. Cognition AI)
NT$640/月 7.7/10

活躍用戶超過百萬的代理 IDE,月費台幣約六百多,在這個品類裡 CP 值數一數二。2025 年 12 月被 Devin 的開發商 Cognition AI 收購,介面乾淨好上手,後續整合 Devin 的方向值得追蹤。

Code Quality & Accuracy 7.5
Context & Codebase Understanding 8.0
IDE Integration & UX 8.5
Agentic / Autonomous Capability 7.5
Value for Money 8.0
#13
約 NT$640/月+ 7.6/10

專攻企業級大型程式庫的 AI 編程助手,支援 VS Code 和 JetBrains,透過深度程式庫索引理解整個專案上下文,採用信用點數制計費。

Code Quality & Accuracy 7.5
Context & Codebase Understanding 8.0
IDE Integration & UX 8.0
Agentic / Autonomous Capability 7.5
Value for Money 7.5

今日分析 · 2026-09-18

Claude Code 維持第一,9.5 分,排名照舊。這週對榜上每一款工具來說,最重要的消息是一份資安調查,修起來大概只要二十分鐘。

Hush Security 掃了大約 8 萬 2 千個公開的 MCP(Model Context Protocol)設定檔,發現 12% 的憑證欄位直接寫死了密鑰。在追蹤的 7,681 份設定歷史裡,有 1,394 組密鑰還活在目前的程式碼中,另外 243 組留在舊的 Git commit 裡。受影響的設定檔橫跨 Claude Code、Cursor、VS Code、Windsurf、Gemini、OpenAI Codex 和 JetBrains,所以這是整個類別共同的工作習慣問題。更麻煩的是細節:外洩的憑證有 80% 沒有到期日,53% 擁有整個組織或工作區的權限。

這個情境大家應該都很熟。幫助理加一個 GitHub、資料庫或 Slack 的 MCP 伺服器,為了趕快跑起來,把 token 直接貼進 JSON,結果檔案就這樣被 commit 上去。我現在每個有用 agent 的 repo 都會跑一遍這套流程:

1. 搜尋所有 MCP 設定檔裡的明文 token,改成環境變數展開,Claude Code、Cursor 和 Codex 都支援。 2. 啟動時從密碼管理工具拉真正的值,1Password 的 secret reference 和 Bitwarden Secrets Manager 都做得很乾淨。 3. 只要曾經被 commit 過,就算檔案已經刪掉也要換掉,因為 Git 歷史會一直留著。 4. token 權限只開給單一 repo,並設定到期日。

另外兩個小消息。阿里巴巴的 open-code-review 最近在 GitHub 上很熱門,它把 LLM agent 和固定規則的檢查結合,抓空指標、執行緒安全、XSS 和 SQL injection,OpenAI 和 Anthropic 的模型都能跑,很適合當成任何一款助理後面的第二道審查。OpenAI 也推出 ChatGPT Work 和 Codex 的使用分析,技術主管可以看到每個團隊的花費和使用量,年底編預算的時候很好用。

12% 的 MCP 憑證欄位寫死密鑰

Hush Security 掃描約 8 萬 2 千個公開 MCP 設定檔,涵蓋 Claude Code、Cursor、Codex、Windsurf 等工具。

外洩憑證大多沒有到期日

80% 沒有到期日、53% 有整個工作區權限,所以換掉跟刪掉一樣重要。

二十分鐘就能修好

MCP 設定改用環境變數,從密碼管理工具取值,曾經進過 Git 的全部換新。

好用的第二位審查者

阿里巴巴的 open-code-review 結合 LLM agent 和固定規則檢查,OpenAI 和 Anthropic 模型都支援。

參考資料

更新歷史

2026-09-17

Claude Code 維持第一,9.5 分。這週的重點要特別提醒排第二的 OpenAI Codex 用戶:你們有一個遷移期限。

OpenAI 在 9 月 14 日的更新日誌寫明,GPT-5.5 將在 10 月 14 日從 Codex 退役,適用所有用 ChatGPT 帳號登入的人。指示講得很具體,把 gpt-5.5 換成 gpt-5.6-sol,接著更新工作區預設值、儲存的模型設定、集中管理的設定檔、自訂代理、排程任務,還有所有寫死 gpt-5.5 的腳本。API 端會保留舊模型,所以風險集中在透過 ChatGPT 登入使用 Codex 的團隊。

我會這樣做。今天就在 repo 和 CI 設定裡搜尋 gpt-5.5 這個字串,先改一條 pipeline,拿它一週的 PR 跟舊基準比一比,沒問題再全面切換。Codex 總分 9.3,代理能力 9.5,有計畫地切換才能把這個品質保住。

命令列工具這週也更新得很勤。GitHub Copilot CLI 1.0.85 在 9 月 16 日推出,Vim 模式開放給所有人,還多了 /settings 和 /config 指令。同一天 Antigravity CLI 1.2.4 可以不重開 session 就重新載入 skills,Gemini CLI 0.60.0 則在 9 月 15 日收緊了擴充套件存取系統的權限。

更新節奏這麼快,所以共用環境裡我一定鎖版本。每週一版確實帶來實在的改進,團隊自己決定升級時間,才吃得到這些好處又不被打亂。

Claude Code 能穩坐第一,靠的是程式品質 9.8 和代理能力 9.7,9 月 10 日的版本也讓 Claude 各個 app 的計價統一。Cursor 9.1 分,IDE 整合 9.6,編輯器體驗全榜最好。GitHub Copilot 7.9 分,IDE 整合拿到 9.5,整天待在 VS Code、想要最輕量設定的團隊,看這個分數就夠了。

今天排名照舊。

Codex 用戶 10 月 14 日前改用 gpt-5.6-sol

用 ChatGPT 登入的 Codex 將停用 GPT-5.5,設定檔、自訂代理、排程任務和腳本都要更新。

今天就搜尋 gpt-5.5

先改一條 pipeline,比對一週的 PR,確認沒問題再全面切換。

Copilot CLI 加入 Vim 模式

1.0.85 版在 9 月 16 日推出,Antigravity CLI 也能免重啟重新載入 skills。

共用環境記得鎖版本

每週更新帶來實在的進步,升級時間由團隊自己決定最穩。

2026-09-16

Claude Code 續居第一,9.5 分。這週的重點是長時間工作之後那張帳單。

Anthropic 在 9 月 1 日推出 Claude Fable 5.1 與 Mythos 5.1,檯面上的價格沒動,每百萬輸入 10 美元、輸出 50 美元。真正改變的是快取。快取讀取從每百萬 1 美元降到 0.25 美元,砍掉七成五,快取命中改用基礎費率的 0.025 倍計價。Anthropic 自己估算,一般工作量省下約兩成五,代理式工作量最多可以省到四成五。

代理式寫程式受惠最大,因為代理每一輪都會重讀同一份專案結構、同樣的檔案標頭、同樣的指令。一次跑四小時的重構,反覆讀取同一份大快取上百次,現在的花費跟八月比只剩一小部分。我因此把 Claude Code 的性價比拉到 9.2,總分維持 9.5、續居第一。

實務上要做的事,是讓你的提示真的吃到快取。把穩定的材料放前面,專案說明、架構筆記、風格指南,會變動的對話留到最後。每一輪都讓快取失效,這筆折扣你一毛都拿不到。

OpenAI Codex 維持 9.3,已經在 OpenAI 生態裡的團隊選它最順,代理能力 9.5。Cursor 9.1 仍然是編輯器體驗最好的一個,IDE 整合 9.6,想在編輯器裡直接用代理的開發者,我會給他這個。

Aider 7.7、性價比 9.5,開源、跑在終端機、想接哪個模型就接哪個。租屋處自己接案的人,這一個最省錢。

快取讀取從 1 美元降到 0.25 美元

Anthropic 9 月 1 日的更新讓 Fable 5.1 與 Mythos 5.1 的快取讀取價格砍掉七成五,快取命中以基礎費率 0.025 倍計價,代理式工作量最多省四成五。

穩定的內容放前面,快取才會命中

專案說明、架構筆記、風格指南放在提示最上面,會變的部分留到最後。每一輪都打斷快取,等於放棄這次的降價。

Claude Code 性價比升到 9.2

長時間的代理式任務最吃快取,也正好是 Claude Code 的主場。總分維持 9.5,第一名不變。

Aider 跟著最便宜的模型跑

總分 7.7、性價比 9.5,開源終端機代理,換供應商只要改一行設定。每個專案我都會順手留一份備用。

2026-09-15

Claude Code 維持 9.5 分第一。這週對寫程式的團隊最實用的一課,來自 9 月 3 日那場當機。OpenAI 說路由錯誤讓部分使用者大約半小時用不了 ChatGPT 和 Codex;Anthropic 也回報 Claude Code 和開發者 API 出現部分基礎設施故障。整個衝刺只靠一個雲端代理,它一停,大家就一起乾瞪眼。

所以我現在會寫一份備援計畫:在主要專案上先設定好第二個代理,平常就練習切換。我最愛的備胎是 Aider,7.7 分,開源、任何終端機都能跑,哪家模型服務還活著就接哪家,連本機模型都能用。

Claude Code 穩坐第一,靠的是跨很多檔案的大型重構。它先規劃、再一步一步改、中間跑測試。

OpenAI Codex 9.3 分,Agents API 公開測試版我還在拿真實專案操它。Cursor 9.1 分,審查代理改動的編輯器體驗還是最好。Cursor 現在歸 SpaceX 所有,新加了 Origin 程式碼託管和跑更久的雲端代理,這兩個我測完才會調分。

價格也分層分得很清楚了。9 月 1 日起,GitHub Copilot Pro 每月 10 美元,是最便宜的付費入口;Claude Code、Codex、Cursor 大約 20 美元起跳;天天重度用代理,實際花費會落在 60 到 200 美元。Copilot 的 CLI 二月正式推出,內建雲端代理和程式碼審查代理,學生想入門我直接推 10 美元方案。

Google Antigravity 8.5 分、Jules 8.2 分,本來就住在 Google 工具裡的團隊選它們最順。這週排名不變。

9 月 3 日當機也打到寫程式代理

Codex 部分使用者停擺約半小時,Claude Code 也有部分故障。主要專案記得先設定第二個代理。

Aider 是最可靠的備胎

開源、跑在終端機、任何模型服務或本機模型都能接,雲端代理停下來時工作照樣推進,7.7 分。

Cursor 在 SpaceX 旗下加了託管

Origin 程式碼託管和更長時間的雲端代理上線,我測完之前先維持 9.1 分。

10 美元的 Copilot Pro 最好入門

CLI 內建雲端代理和審查代理,想用最少的錢試試代理寫程式,就從它開始。

2026-09-14

Claude Code 以 9.5 分繼續坐第一,這週前三名的消息很熱鬧,名次倒是一格都沒動。最大的新聞是 OpenAI 在 9 月 10 日推出 Agents API 公開測試版,把 Codex 的執行框架搬到雲端代理人上,附帶代管的流程編排、長時間工作階段,還有 OpenAI 自己託管的沙盒環境,Deep Research 也一起塞進 Codex。講白了,想把寫程式的代理人接進自家 CI 流程的團隊,這次 OpenAI Codex 能做的事情明顯變多了。

Codex 我先維持 9.3 分。公開測試版要讓團隊拿真實專案跑個幾週,我才會加分,下次更新前我會好好操它。

Claude Code 穩坐第一,靠的是我每週花最多時間的那種工作:跨十幾個檔案的大重構,用測試當驗收標準。Anthropic 在 9 月 1 日推出 Claude Fable 5.1 和 Mythos 5.1,Claude Code 本身也持續穩定出修正版,2.1.270 修掉了長時間工作階段裡唯讀 git 指令一直跳權限確認的問題。這種小修正很關鍵,因為代理人最容易卡住節奏的地方,就是權限提示。

Cursor 維持 9.1 分,想在編輯器裡直接用代理人、要快速補全跟乾淨的差異檢視,選它最舒服。The New Stack 分析 Cursor、Claude Code、Codex 正在變成分工明確的組合:編排、執行、審查各司其職。我自己就是這樣用,重活丟給終端機裡的代理人跑,最後在編輯器裡看 diff。

付錢前先算清楚。GitHub Copilot Pro 一個月三百出頭,還是最便宜的付費入口;多數代理人工具一個月六百多起跳;每天重度使用的話,實際預算大概落在兩千到六千多。

Google Antigravity 8.5 分第四,Jules 8.2 分第五。Jules 綁在 Google AI Pro 裡,Antigravity 免費就能開始用,本來就住在 Google 生態系的人很好上手。這週排名不變。

OpenAI Agents API 把 Codex 帶上雲端

9 月 10 日公開測試版加入代管編排、長時間工作階段與託管沙盒,底層就是 Codex 框架。我先讓 Codex 維持 9.3 分,拿真實專案測完再說。

Claude Code 依然是重構主力

9.5 分的 Claude Code 最適合用測試把關的跨檔案修改,2.1.270 修好 git 權限提示,長時間工作更順。

Cursor 是團隊愛用的審查層

補全快、差異檢視乾淨,Cursor 穩在 9.1 分。終端機代理人負責執行、Cursor 負責審查,是我最推的搭配。

預算要照實際用量抓

Copilot Pro 一個月三百出頭,代理人工具六百多起跳,每天重度使用大概兩千到六千多。導入團隊前先把這筆錢算進去。

2026-09-11

九月那波模型更新過了十天,我拿真的專案在這幾個工具之間跑了夠多輪,可以說排名維持,也可以講清楚現在真正在決勝負的是什麼。

Claude Code 守第一,9.5 分,靠的是長任務的代理可靠度。丟一個橫跨十幾個檔案的重構給它,用測試套件當合約,它會整段做完,自己去讀該讀的,把測試跑起來,出事就老實講。最後這個行為的價值高過任何跑分數字,因為一個測試全紅還宣稱成功的代理,等於把你以為省下來的那小時原封不動還你。

OpenAI Codex 維持 9.3,強在雲端沙箱。當你的專案大到跑一輪完整測試就會打斷思緒,把長任務丟到遠端、本機繼續打字,這個價值馬上就出來。

Cursor 的 9.1 還是最鋒利的純編輯體驗。理解周邊專案的補全,加上落點精準的行內編輯,在你已經很清楚要寫什麼的那一小時裡,它就是最快的。

這個月我一直盯著的是價格。Anthropic 在九月初把快取讀取的價錢砍掉四分之三,這件事在這個品類的份量高過其他任何地方,因為程式代理在一次工作階段裡會把同一批檔案重讀幾十遍。每天這樣操的人,現在一整天的帳單比八月明顯低。

挑一個,把它決定要讀什麼的邏輯摸透,然後往深處鑽。單一助理的深度,勝過三個輪流淺嘗。

老實回報失敗,才配拿第一

Claude Code 會把測試跑起來,然後告訴你哪裡紅了。建置壞掉還說成功的代理,會吃掉你以為省下來的除錯時間,光這一點就拉開了榜單頂端。

九月的快取降價,在這個品類最有感

程式代理在一次階段裡重複讀同一批檔案,快取讀取價砍掉七成五,對每天這樣工作的人來說會直接反映在帳單上。

Codex 拿下遠端交辦這一塊

把長任務丟進雲端沙箱、本機繼續做事,只要本機跑完整測試會打斷你的節奏,這個價值就成立。9.3 分守住靠的就是這條流程。

一個工具摸到底

前三名之間的差距,小於「懂自己代理怎麼管脈絡」跟「每個新版都試一下」之間的差距。選定一個就好。

2026-09-09

GPT-6 Astra 在 9 月 3 日上線,是這幾個月來第一件讓我認真重新檢視榜首的事。用了一週之後,我還是把 Claude Code 留在第一,同時把 OpenAI Codex 往上調到 9.3。

Astra 在多檔案推理上確實往前跨了一步,Codex 立刻就吃到這個紅利。它沒有跟著吃到的,是讓 Claude Code 保持領先的那套外殼品質,包含權限模型、跨整個 repo 撐住一次長重構的能力,以及測試跑到一半失敗時能優雅接手繼續處理。

說真的,這個差別現在比模型跑分重要多了。榜上每一個認真的助理背後都接著前沿模型,差異化早就移到「這個 agent 在四十分鐘的任務裡表現如何」。以我每天的實際使用來說,Claude Code 撐這段路撐得最好。

Cursor 守住第三,9.1 分。想留在 IDE 裡工作的話,它的編輯體驗依然最順,對於習慣用「開著的分頁」來理解專案的開發者,這就是正確選擇。

最後講個實際的成本問題。Astra 的輸出定價夠貴,上個世代跑起來還算便宜的 agentic 迴圈,現在很快就會累積成一筆數字。如果你的助理允許按任務指定模型,就把前沿模型留給架構跟除錯,機械式的修改跟測試骨架交給快速級距。我自己這樣切之後,每週支出大概少了三分之一。

Claude Code 保住第一,因為外殼品質已經比模型分數更關鍵

榜上領先的助理都接著前沿模型,差別就顯現在長任務中的 agent 行為。Claude Code 能撐住跨檔案的重構、在破壞性操作前先問過你、測試中途失敗時還能接回來繼續。四十分鐘的工作階段裡的這份穩定,才是我真正在付錢買的東西。

Codex 靠 GPT-6 Astra 的實力往上調分

Astra 9 月 3 日推出,多檔案推理有實質進步,Codex 馬上就接上了,這值得調到 9.3。它跟第一名的差距,現在主要落在工具鏈跟工作階段管理,模型本身已經不是問題。

IDE 派開發者的最佳解依然是 Cursor

如果你腦中對專案的模型就是一堆開著的檔案分頁,Cursor 完全貼合你既有的工作方式。行內 diff 檢視跟多檔案編輯流程還是同級最順的,9.1 分反映的是一個撐過兩個模型世代還守住位置的工具。

照任務分流模型,不然帳單會爬上去

Astra 的輸出定價讓長 agentic 迴圈比上個月貴上一截。把前沿模型留給架構決策跟難纏的除錯,機械式修改、重新命名、測試骨架交給快速級距。這樣拆完之後,我每週的支出少了大約三分之一。

2026-09-07

這週有兩件事會直接影響到有在付錢用編碼助理的人。Anthropic 為它的代理模型線推出了 100 萬 token 的上下文層級,同時把提示快取讀取的價格砍了七成五。這兩件事打的都是代理式編碼的成本結構,而代理式編碼正是這類工具要嘛值回訂閱費、要嘛默默浪費掉的那個場景。

快取降價才是重點,而它得到的關注遠低於它應得的。代理式編碼每一輪都要重讀同一份專案脈絡,當快取讀取便宜七成五,一場以前兩個下午就把月額度燒光的大型重構,現在可以撐過一整週。我把 Claude Code 的上下文分數提到 9.7,理由是更大的視窗加上讓你真的用得起的價格,這兩件事要合在一起看。

OpenAI Codex 調到 9.2。GPT-6 Astra 還在限量開放,我調升 Codex 的理由跟那個無關:它跨檔案編輯時維持介面契約的穩定度明顯進步了。我這週丟給它一個要改某個模組函式簽章、然後更新十一個呼叫點的任務,十一個它全都改到了。

Cursor 維持 9.1,仍然是我推薦給想在熟悉編輯器裡用助理、而非在終端機裡用的開發者。這一輪公布的 McKinsey 調查指出,32% 的組織因為代理式編碼工具可以自己蓋,而放棄採購至少一項軟體產品。這個數字告訴我這個品類已經走過實驗期,也是我在這份排行榜裡把代理能力權重放這麼重的原因。

快取降價的意義大於上下文視窗

100 萬 token 視窗聽起來很威,實際影響卻小於同時推出的提示快取讀取降價七成五。代理式工作階段每一輪都會重讀你的專案,所以快取讀取才是 token 帳單真正堆積的地方。把這塊成本砍掉四分之三,等於把一個貴到不敢整天開著的工作流,變成可以一直掛著跑的工作流。這才是真正改變工作方式的那個變動。

Claude Code 保住第一,因為它能把多步驟任務做完

我評判這類工具的標準是它能不能在我不中途介入的情況下把任務做完。Claude Code 會跑完整個迴圈,讀檔、改動、跑測試、對失敗做出反應。這週我看它修一個壞掉的資料庫遷移,它讀了 schema、改了遷移檔、跑測試,然後在第二輪自己修正了自己的錯誤。這個完成率就是整份排名的全部。

Codex 拿到 9.2 是靠跨檔案一致性

我給 Codex 一個任務,要改某模組的函式簽章,並更新散在專案各處的十一個呼叫點。它十一個全部找到並更新。這正是把好用助理跟製造善後工作的助理區分開來的那個失敗模式,Codex 把它補起來了。已經綁定 OpenAI 生態系的人,我會把它排第一。

32% 的組織現在選擇自己蓋而非採購

McKinsey 的 2026 年 AI 現況調查發現,32% 的組織因為代理式編碼工具讓他們可以自己蓋,而放棄採購至少一項軟體產品或功能。就是因為這種數字,我把代理能力放在這份排名權重的最前面。買家在問的問題已經從這個工具寫的程式碼好不好,變成它能不能從頭到尾交付一個能用的內部工具。

2026-09-05

五天內兩個前沿模型發布,排名幾乎沒動,這件事本身就說明了這個品類的重點在哪。

Claude Code 守第一,9.5 分,因為產品本體是那層外殼,而外殼決定了一個 coding agent 是把任務做完,還是留給你一個重構到一半的專案。Anthropic 的 Fable 5.1 在 9 月 1 日推出,專門針對代理式工具呼叫調校,快取讀取 0.25 美元,長時間自主任務剛好就吃在這個價格上。

OpenAI Codex 的 9.1 這週故事比較精彩,GPT-6 Astra 自評 Terminal-Bench 4.0 拿 57.7、DeepSWE 拿 74.1,這兩個剛好是跟「真的把工程票做完」相關性最高的指標。我要看到這些數字在真實專案裡站得住,才會把 Codex 拉過 9.1,兩週內我會再看一次。

Cursor 維持 9.1,適合把編輯器擺第一、代理擺第二的開發者,多檔案編輯的審閱流程還是這個品類裡最好讀的。

Google Antigravity 的 8.5,進步速度是這份清單裡最快的。

說真的,底下那顆模型現在幾週就換一次,所以挑工具要看它的外殼在某一步失敗之後怎麼收拾,因為那才是不會一直變的東西。

外殼比底下那顆模型重要

這裡每個工具都能呼叫前沿模型,真正的差別在某一步失敗、測試爆掉、檔案衝突的時候會發生什麼事。Claude Code 守住 9.5,是因為它的復原行為是我用過最可靠的。

Astra 的 DeepSWE 分數是重點

Terminal-Bench 4.0 的 57.7 和 DeepSWE 的 74.1,是跟真的把工程票做完最相關的兩個指標。Codex 如果能在真實專案裡重現,這份排名一個月內就會變。

快取變便宜,值得自動化的範圍就變了

Fable 5.1 的 0.25 美元快取讀取,直接砍掉好幾小時代理任務的執行成本,因為帳單大頭就是重複上下文。9 月 1 日之後,整類長篇重構在經濟上才說得通。

編輯器優先的開發者還是選 Cursor

多檔案編輯的審閱流程是這個品類裡最清楚的,每個 diff 都留人在迴圈裡。團隊如果規定每次改動都要有人簽核,這種可讀性比純自主性值錢。

2026-09-04

Anthropic 在 9 月 1 日推出 Claude Fable 5.1,官方說法是他們最先進的程式與知識工作模型,明確針對代理式工具呼叫調校,而且快取讀取費用降很多。最後這一項才是這個類別真正的重點,也是 Claude Code 守住 9.5 第一名的原因。

長時間的代理式寫程式,每一輪都要重播大量上下文,而這個重播成本,就是一直以來大家不敢讓 agent 自己跑一小時的原因。快取讀取降價,等於把整個工作流的經濟性重算一次。

Claude Code 的第一名靠的還是我整年都在講的三件事,動手改之前會先好好讀完整個 repo、改出來的東西過得了 code review、自己出錯自己救得回來,不用人重開一次 session。

OpenAI Codex 的 9.1,在 ChatGPT 生態裡還是比較順的選擇,雲端任務執行拿來平行處理很實用。Cursor 的 9.1 仍然是純編輯器體驗的天花板,如果你要的是 Tab 補全和行內 diff 而不用終端機 agent,它就是對的工具。

Google Antigravity 的 8.5 進步很快,瀏覽器感知除錯對前端來說是真的有差。Jules 的 8.2 是值得用的免費選項。

我 9 月的結論很簡單,照你希望 agent 待在哪裡來選。習慣終端機的用 Claude Code,習慣編輯器的用 Cursor,然後所有人現在都該去看一下每月 token 花費,因為長時間跑變便宜了。

快取讀取變便宜,值得自動化的範圍就變了

9 月 1 日 Fable 5.1 這版,能力提升同時大幅調降快取讀取價格。代理式長任務一直在重播上下文,這一刀砍下去,好幾小時的自動重構從燒錢實驗變成日常工作流。

Claude Code 第一名是因為它改的東西過得了 review

動手之前先把 repo 讀懂,產出的改動才會尊重既有的架構與慣例。這就是「幫你省時間的助手」和「幫你製造一堆待審 PR 的助手」的差別,9.5 分是這樣來的。

Cursor 還是編輯器原生體驗最好的那個

行內 diff、Tab 補全、多檔案上下文全部在熟悉的編輯器裡完成,適合想一直待在程式碼裡的開發者。9.1 分跟 Codex 打平,選哪個就看你平常在終端機還是在 IDE。

長任務變便宜之後,記得盯自己的用量

上下文重播便宜了,大家就會放心讓 agent 跑一小時,帳單也就默默長大。丟大型重構給 agent 之前先設好預算警示,這個類別的成本結構這一週真的變了。

2026-09-01

Claude Code 繼續守在第一,八月完全沒有出現能撼動它的東西。這個月八家業者推出的十六個模型,絕大多數都是速度層跟成本層的版本,對寫程式的 agent 當然有幫助,可是這並不會提高「agent 能自己跑完多少事」的天花板。而那個天花板,正是 Claude Code 拿 9.5 的理由。

七月底開始底層換成 Opus 5,成本大約是前一代旗艦的一半,實際的差別是這樣:那種要讀二十個檔案、跑一輪測試、然後自己修到過的長時間 agent 任務,從「偶爾才捨得跑一次」變成「整天都可以這樣用」。這個轉變比任何跑分都重要。

OpenAI Codex 跟 Cursor 並列 9.1,理由不一樣。Codex 從對話直接接到實際執行任務的銜接最順;Cursor 則還是穩穩守住「我要待在檔案裡面看每一個 diff、隨時介入」的那群開發者。

Google Antigravity 維持第四。八月十三號 Gemini 3.7 Flash 成為最快的前沿等級模型,這件事對 Antigravity 特別有利,因為 IDE 裡面的 agent 本來就是大量的小型請求,延遲會一層一層疊起來變成明顯的卡頓感。

這週我不動排名,因為這些發表沒有改變我實際會伸手去拿哪一個。

Claude Code 守住第一,因為這個榜單唯一該看的就是「自己跑完的能力」

我的測試方法很單純:跨多個檔案的工作,這個工具能自己做完多少,我需要接手幾次。跑在 Opus 5 上的 Claude Code 做完的比例最高。而七月那次降到前代旗艦約一半成本的調整,把長時間 agent 任務從需要省著用,變成可以整天這樣操。八月出的東西都沒有動搖這個順序。

八月是延遲之月,IDE 型 agent 受益最直接

Gemini 3.7 Flash 八月十三號上線,是最快的前沿等級模型,Qwen3.8 Flash 八月二十六號接著推出。編輯器內的 agent 本來就是打出大量小請求,來回時間會累積成很明顯的頓感。這份榜單裡受惠最直接的就是 Google Antigravity,所以它 8.5 分穩坐第四。

Cursor 跟 Codex 並列,是因為它們各自贏走不同的開發者

Cursor 屬於那種想待在檔案裡、每個 diff 都要看過、隨時想介入方向的開發者。Codex 則屬於團隊本來就跑在 OpenAI 生態上,希望一句話就能把對話變成實際執行任務的人。兩邊都是 9.1,因為對各自的使用者來說,它們都明確就是正確答案。

現在真正的採購標準,是一整天 agent 用下來要花多少錢

前四名的原始能力已經接近到,決勝點變成一個完整工作天的 agent 使用成本是多少。這跟半年前的狀況真的不一樣了,所以我在評分裡把性價比拉得很重,它現在是主要考量之一。