🏆 TopRankLand
← 所有排行榜
Software

2026 最佳 AI 聊天機器人排行榜:ChatGPT、Claude、Gemini 實測推薦

2026 年 5 月實測十大 AI 聊天機器人,從寫程式、文章創作、推理到即時搜尋,告訴你哪一個最值得訂閱。

最後更新: 2026-09-18 · 10 項目每日追蹤

排名走勢 — 前 10 名

數字越小代表排名越高。顯示最近 89 天。

當前排名

#1
ChatGPT OpenAI
免費 / 約 NT$640 Plus / 約 NT$3,200 Pro 9.7/10

搭載 GPT-5.5、Sora 影片、Agent Mode 的市佔王者,App 與外掛生態系最完整。

Reasoning & Problem Solving 9.8
Coding Capability 9.2
Writing & Creativity 9.4
Real-Time Information 9.0
Value & Pricing 9.4
Ecosystem Integration 9.7
#2
Claude Anthropic
免費 / 約 NT$640 Pro / 約 NT$3,200 Max 9.5/10

Sonnet 5 在 6/30 升為預設模型,散文語感依然是全場最像人的一個,7/1 回歸的 Fable 5 又把寫程式王座拿回來,SWE-Bench Pro 拿到 80.3% 全場最高。

Reasoning & Problem Solving 9.6
Coding Capability 9.7
Writing & Creativity 9.7
Real-Time Information 7.6
Value & Pricing 9.4
Ecosystem Integration 9.5
#3
Gemini Google
免費 / 約 NT$620 AI Pro / 約 NT$7,800 Ultra 9.4/10

Gemini 3.1 Pro 推理 GPQA Diamond 拿 94.3%,直接內建在 Gmail、Docs、試算表裡用。

Reasoning & Problem Solving 9.7
Coding Capability 9.3
Writing & Creativity 8.9
Real-Time Information 9.5
Value & Pricing 9.5
Ecosystem Integration 9.7
#4
Grok xAI
免費 / 約 NT$320 Lite / 約 NT$960 / 約 NT$9,600 Heavy 9.0/10

Grok 4 直連 X 全平台資料,是市面上唯一能即時抓社群與新聞的模型。

Reasoning & Problem Solving 9.1
Coding Capability 9.1
Writing & Creativity 8.4
Real-Time Information 9.8
Value & Pricing 7.0
Ecosystem Integration 7.5
#5
Perplexity Perplexity AI
免費 / 約 NT$640 Pro / 約 NT$6,400 Max 8.6/10

以搜尋為核心的答案引擎,每段回答附引用來源,Comet 瀏覽器現在四大平台都免費。

Reasoning & Problem Solving 8.7
Coding Capability 7.6
Writing & Creativity 8.0
Real-Time Information 9.5
Value & Pricing 8.7
Ecosystem Integration 8.5
#6
免費 / 約 NT$640 Pro / 約 NT$960 M365 8.4/10

把 GPT-5.5 直接包進 Word、Excel、PowerPoint、Outlook 的版本,給整天泡 M365 的人用。

Reasoning & Problem Solving 8.5
Coding Capability 8.7
Writing & Creativity 8.4
Real-Time Information 8.0
Value & Pricing 8.0
Ecosystem Integration 9.6
#7
DeepSeek DeepSeek
免費 8.2/10

V4-Pro 一百萬 token 上下文,完全免費無限使用,模型權重以 MIT 授權開源。

Reasoning & Problem Solving 8.8
Coding Capability 8.5
Writing & Creativity 7.8
Real-Time Information 7.0
Value & Pricing 10.0
Ecosystem Integration 7.0
#8
免費 7.6/10

Llama 4 內建在 WhatsApp、Instagram、Messenger,免註冊、完全免費就能用。

Reasoning & Problem Solving 7.4
Coding Capability 7.0
Writing & Creativity 7.5
Real-Time Information 8.0
Value & Pricing 10.0
Ecosystem Integration 8.5
#9
Qwen Chat Alibaba
免費 7.6/10

阿里巴巴開源的 Qwen3 模型,內建圖像生成,個人使用完全免費。

Reasoning & Problem Solving 7.5
Coding Capability 7.6
Writing & Creativity 7.0
Real-Time Information 6.8
Value & Pricing 9.0
Ecosystem Integration 6.5
#10
Le Chat Mistral
免費 / 約 NT$480 Pro 7.4/10

歐洲團隊做的助理,主打資料留在歐盟、隱私嚴格,搭配 Magistral 推理模型。

Reasoning & Problem Solving 7.5
Coding Capability 7.3
Writing & Creativity 7.6
Real-Time Information 7.0
Value & Pricing 8.0
Ecosystem Integration 7.0

今日分析 · 2026-09-18

ChatGPT 維持第一,9.7 分,排名原封不動。這週我想聊家裡年紀最小的使用者,因為歐盟執委會把聊天機器人跟社群媒體放進同一張管制清單了。

歐盟提出的 Kids Act 草案,涵蓋社群媒體、影音平台、線上遊戲、App 商店、聊天機器人和 AI 陪伴服務。依草案,3 到 12 歲只能用兒童向服務,帳號由家長完全控管。13、14 歲可以由家長開一個入門帳號,限制聯絡人、嚴格限制使用時間。15 歲才能自己註冊。罰款最高可達年營收的 6%,執委會還說自家的年齡驗證 App 已經準備好,希望各會員國年底前上線。

老實說,這還只是草案。歐盟各國和歐洲議會都要點頭,年齡門檻和驗證方式都可能再改。不過方向很明確,家裡有小孩的讀者可以先做準備。

我給家長的實際建議很簡單:全家固定用一個助理,然後好好設定。ChatGPT 從 2025 年底就有親子連結帳號,可以管內容、設定安靜時段,這也是它在家庭情境穩坐第一的理由。Gemini 可以接 Google Family Link,家裡本來就用 Android 手機和 Chromebook 的,直接選它最順。Claude 的消費者版本設定給成年人使用,我推薦給家裡的大人用。

產品面也有新東西。The Verge 在 9 月 16 日報導,Anthropic 替 Claude 加入原生的文件和簡報工具,並把對話和 Cowork 工作環境合併成同一個介面。我這幾天開始在上面寫週報,從一段對話直接產出可以編輯的簡報,真的省下不少時間,所以 Claude 穩穩守住第二,9.5 分。

歐盟 Kids Act 把聊天機器人納入

草案涵蓋 15 歲以下使用聊天機器人和 AI 陪伴服務,13、14 歲需家長控管帳號,罰款最高年營收 6%。

目前仍是草案

還需要歐盟各國和歐洲議會同意,年齡門檻和驗證方式都可能調整。

現在最好管的家庭設定

ChatGPT 的親子連結帳號和 Gemini 的 Family Link 支援,是目前家長最容易管理的兩個選擇。

Claude 新增文件與簡報

Anthropic 推出原生文件和簡報工具,並和 Cowork 合併成同一介面,工作情境更完整,維持 9.5 分。

參考資料

更新歷史

2026-09-17

ChatGPT 維持第一,9.7 分。這週對付費用戶最實用的消息,老實說藏在 OpenAI 自己的更新日誌裡。

9 月 14 日 OpenAI 公告,GPT-5.5 將在 10 月 14 日從 ChatGPT、ChatGPT Work 與 Codex 退役,從個人方案一路到企業版和教育版全部適用,API 則繼續保留。App 裡接手的模型是 GPT-5.6 Sol。

對大多數人來說這件事無感,預設模型會自動換掉。真正要花工夫的,是那些你當初手動指定模型名稱的地方。OpenAI 的公告列得很清楚:工作區預設值、儲存的模型設定、自訂代理、排程任務,還有腳本。如果你暑假設了一個每天早上幫你整理新聞的排程,或是做了一個自訂代理,現在就打開來自己切換模型。九月就測過的任務,到了 10 月 15 日才會照常跑。

我讓 ChatGPT 繼續坐穩 9.7,原因就在這裡。提前一個月通知、講明接班模型、附上檢查清單,這就是成熟平台該有的做法,它生態系 9.7 分反映的也正是這種成熟度。

Claude 9.5 分,還是我寫長文和處理文件的首選,寫作 9.7、程式 9.7,兩項都是全榜最高。Gemini 9.4 分,推理 9.7、即時資訊 9.5,早上通勤在捷運上想查今天剛發生的事,我會直接開它。

最後給一個對所有聊天助理都適用的建議。開一份簡單的文件,列出你用 AI 做的每個自動化、它用哪個模型、上次測試是哪天。花十分鐘整理,模型退役那天就只是兩分鐘的小事。

Perplexity 8.6 分、DeepSeek 8.2 分維持原位,今天整份排名照舊。

GPT-5.5 在 10 月 14 日退場

OpenAI 更新日誌指定 GPT-5.6 Sol 接手 ChatGPT、ChatGPT Work 與 Codex,API 保留 GPT-5.5。

有指定模型的設定要自己改

工作區預設值、自訂代理、排程任務和腳本,只要寫死 GPT-5.5,都得在期限前手動切換。

退役流程乾淨,撐得起 9.7

提前一個月通知、講明接班模型、附檢查清單,成熟平台就該這樣處理。

整理一份自動化清單

記下每個自動化、使用的模型和最後測試日期,退役那天就能快速搞定。

2026-09-16

ChatGPT 續居第一,9.7 分。這週我想把兩件常被混在一起的事分開講:你每個月付錢訂閱的助理,跟你按住 iPhone 側邊鍵時跳出來的那一個,可以是兩個不同的東西。

iOS 27 在 9 月 14 日推送,Siri 被重寫成獨立的 App,背後用 Google Gemini 模型訓練,最深的功能要 A17 Pro 以上的晶片才開得起來。我用了兩天,感想是新 Siri 適合當一道門,處理裝置控制、螢幕上的內容、快速查詢都很順,真正要想很久的問題,還是交給你自己挑的那個助理。老實說,這次更新完全沒有動搖你原本的訂閱選擇。

9 月的模型更新讓那筆訂閱更划算。GPT-6 Astra 在 9 月 3 日登場,推理項目 9.8 仍然是全榜最高,想用一套工具同時處理工作、報告跟生活問題的人,我還是推它。Gemini 維持 9.4,9 月 2 日的 3.8 Flash 讓免費版快到可以當第二意見,我現在每個查資料的任務都會順手丟一份給它對照。Claude 9.5,兩百頁的合約我只放心交給它,寫作 9.7 也是這份榜單最高分。

DeepSeek 在 9 月 10 日的 V4.1-Flash 之後,推理拉到 8.8,總分 8.2,價值分滿分。說真的,月費是門檻的人,我都直接推這一個。

給 iPhone 使用者一個很實際的建議:把你付費的那個助理裝成 App,開啟它自己的語音模式,放在主畫面 Siri 旁邊。兩道門,各有各的拿手項目,我自己就是這樣用。

Siri 是門,訂閱才是房間

iOS 27 在 9 月 14 日推送,Siri 變成獨立 App,用 Google Gemini 模型訓練。裝置控制跟螢幕內容它處理得很好,真正要想的問題還是交給你付費的那個助理。

GPT-6 Astra 讓 ChatGPT 推理維持 9.8

9 月 3 日的更新守住了決定難題成敗的那個項目。一份訂閱要同時撐住工作、學習跟日常,我還是推 ChatGPT。

Gemini 3.8 Flash 讓免費版變成可用的第二意見

9 月 2 日的版本快到幾秒就能對照一次答案。Gemini 即時資訊 9.5、價值 9.5,通勤路上用手機問兩句也很順。

DeepSeek V4.1-Flash 把推理推到 8.8

9 月 10 日的更新讓 DeepSeek 推理再上一階,價值分維持滿分 10。想要堪用輸出又完全不想付月費的人,這一個最合適。

2026-09-15

ChatGPT 維持 9.7 分第一。這週我把時間花在大家最常問我的問題:主力 AI 突然掛掉,你手邊還有什麼能用?

9 月 3 日那次大當機,原因現在比較清楚了。The Register 報導 ChatGPT、Claude、Grok 在同一個時段一起倒。OpenAI 說是路由錯誤,太平洋時間早上 7 點 43 分開始,8 點 17 分左右修好;Anthropic 表示 Claude.ai、Claude Code 和開發者 API 都有部分基礎設施故障;SpaceX 說 Grok 是孟菲斯機房出狀況。Google 的狀態頁面則沒有記錄 Gemini 的正式事故。

三個不同原因剛好撞在一起,講白了,這種事只能靠自己準備:手機裡隨時登入兩個 AI。所以這週分數我一個都沒動。

ChatGPT 穩坐第一靠的是廣度。GPT-6 Astra 負責深度推理,GPT-Live-1 撐起新版語音,記憶、檔案庫、代理功能全塞在同一個 20 美元方案裡,一個月六百多塊,一份訂閱能包辦的事情最多。

Claude 9.5 分,寫作和長文件我第一個打開它。

Gemini 9.4 分,老實說它就是我心中最好的備胎:免費版跑 Gemini 3.8 Flash,反應快,又直接接 Gmail 和 Drive,當機時切過去零成本。

Grok 9.0 分,想看 X 上大家正在吵什麼它最快;Perplexity 8.6 分,每句話都要附來源時我就開它。

我的建議很簡單:付費買最適合你主要工作的那一個,免費的 Gemini 留在手機當備用,通勤捷運上也能查。這週排名不變。

9 月 3 日當機的三個原因

OpenAI 是路由錯誤,約 34 分鐘修好;Anthropic 是部分基礎設施故障;Grok 則是孟菲斯機房出狀況。

20 美元 ChatGPT 包辦最多事

GPT-6 Astra、GPT-Live-1 語音、記憶、檔案庫、代理功能同一份訂閱,穩穩守住 9.7 分。

免費 Gemini 是最好的備胎

Gemini 3.8 Flash 快又免費,還直接接 Gmail 和 Drive,手機裡留一個登入狀態就對了。

長文件還是交給 Claude

Fable 5.1 整理摘要時會保留原文的細節和保留語氣,寫作重度使用者選它,9.5 分。

2026-09-14

老實說,這十天 OpenAI 的動作多到我追得有點喘。GPT-6 Astra 在九月初登場,9 月 10 日又把 GPT-Live-1 開放到 API,ChatGPT Voice 也跟著升級,遇到要查資料或推理的語音問題,會自動叫 GPT-5.6 或 GPT-6 Astra 出來處理。語音、記憶、檔案庫、代理人全部塞在一個月六百多塊的 Plus 裡,ChatGPT 以 9.7 分坐穩第一,我完全沒有猶豫。

Claude 維持 9.5 分第二名。Anthropic 在 9 月 1 日推出 Claude Fable 5.1 和 Claude Mythos 5.1,長文件跟寫作這兩件事,我還是第一個打開它。把一份租屋合約丟進去,問它哪些條款把責任推給房客,它會把段落直接引出來,模糊的措辭也會清楚標出來。

Gemini 以 9.4 分守住第三。Gemini 3.8 Flash 在 9 月 2 日正式開放,回應快、跟 Gmail 和雲端硬碟綁得緊,免費版對學生來說已經很夠用。

說真的,這週最值得提醒大家的是 9 月 3 日那場當機。Azure 美東區域出問題,ChatGPT、Claude、Grok 一起掛了大約 90 分鐘,Gemini 照常運作。我沒有因為一次當機就扣分,倒是自己多了一個習慣:手機裡隨時登入第二個 AI 助理。Gemini 免費版拿來當備援剛剛好,半夜趕報告遇到當機,至少還有地方可以問。

Grok 以 9.0 分排第四,強項是從 X 抓來的即時資訊。Perplexity 8.6 分第五,每句話都附來源,查資料很安心。DeepSeek 8.2 分,想零預算用推理模型的人,裝它就對了。

這週排名全部不動。發表的東西很多,每一項剛好都補強了原本就在該領域最強的那個產品。

GPT-6 Astra 加上 GPT-Live-1,ChatGPT 更全面

OpenAI 在 GPT-6 Astra 之後,9 月 10 日再推出 GPT-Live-1,ChatGPT Voice 遇到難題會交給推理模型處理。一個月六百多塊買到最完整的助理,9.7 分實至名歸。

Claude Fable 5.1 讓 Claude 穩坐寫作首選

Anthropic 在 9 月 1 日推出 Fable 5.1 與 Mythos 5.1。合約、報告、長篇文件,交給 9.5 分的 Claude 我最放心。

Gemini 3.8 Flash 讓免費版更強

9 月 2 日正式開放後,Gemini 免費就能拿到又快又準的回答,加上 Gmail、雲端硬碟整合,學生跟小公司天天都用得到。

手機裡多登入一個備援助理

9 月 3 日 Azure 故障讓三大聊天機器人停擺約 90 分鐘,Gemini 照常運作。多開一個免費帳號零成本,關鍵時刻能救你的截止日。

2026-09-11

蘋果把本機助理放在九月發表會的正中央,兩天後我回頭看這份榜單,想確認有沒有東西該動。結論是沒有,理由值得講清楚。

ChatGPT 守第一,9.7 分,因為它覆蓋一般工作日的形狀最多。跨對話延續的記憶、走出門繞一圈還能接著用的語音、改長文件的畫布,加上直接接上多數人本來就在放檔案的雲端硬碟。

Claude 第二,9.5 分,我最在意的那類工作還是交給它,就是長文件跟需要禁得起別人檢查的推理。Gemini 的 9.4 把整個 Google Workspace 吃下來,如果你的團隊整天泡在 Docs 跟試算表裡,光這一件事的份量就壓過任何排行榜名次。

老實說,蘋果這次動的是這個品類底下的那個問題。助理直接在手機上回答完,它接走的是以前得開 App 才做得完的快速查詢跟短句聽寫。

我預期榜上每一個聊天機器人都會在使用量上感受到,同時排序會維持原樣,因為這些助理真正賺到錢的工作,都比一句話長得多。

所以今天的建議跟上週同一個形狀,細節更清楚。選那個生態系裡已經放著你文件的助理,然後拿超過三十秒的任務去評斷它。短提示接下來會流向手機上內建的那一個,這樣挺好,等於把付費助理釋放出來,去賺那些真的值得訂閱費的活。

三十秒以內的問題,手機收回去了

蘋果的本機助理現在直接處理以前要開 App 的查詢跟聽寫。榜上每個聊天機器人都會在使用量上感受到,而四十頁的合約要交給誰,一點都沒改變。

ChatGPT 守第一靠的是覆蓋面

跨對話記憶、免手操作的語音、文件編輯、雲端硬碟連接器,加總起來就是一個能塞進最多種工作型態的助理。9.7 分守得住,靠的就是這個廣度。

檔案放在哪,比模型好壞更能決定結果

Gemini 長在 Workspace 裡、ChatGPT 接上雲端硬碟,都省掉那個每天默默吃掉你幾分鐘的匯出步驟。頂端能力已經收斂到,存取權才是勝負手。

拿長任務去評估候選人

訂閱費是在長文件、細緻推理、多步驟工作上賺回來的。就拿這些去測,快問快答留給手機。

2026-09-09

這週大概是今年聊天機器人市場最熱鬧的七天,也順便回答了我從春天被問到現在的問題。GPT-6 Astra 在 9 月 3 日正式推出,這是貨真價實的世代更新,所以 ChatGPT 穩住第一,分數往上調到 9.7。

Astra 的 API 定價是每百萬輸入 token 10 美元、輸出 50 美元,是 GPT-5.6 Sol 促銷價的 2.5 倍。這個定價本身就是重點,OpenAI 對自己的推理領先有信心到敢重新用高階廠商的姿態收費。

Claude 守住第二,理由很具體。Anthropic 9 月 1 日推出 Fable 5.1,同一次更新把 cache read 價格砍了 75%。老實說,如果你的助理是在固定文件集上跑長上下文,這一刀對每月帳單的影響,比這週任何跑分進步都大,所以我把 Claude 的價值分往上調。

Gemini 維持第三,9.4 分。9 月 2 日的 3.8 Flash 沿用前一代的入門價,讓 Google 在高流量級距繼續是最便宜的可靠選項,延遲表現也還是同級最好的。

接下來一個月我的建議是,別因為新品發表就急著搬家。Astra 是現在最強的推理模型,但每百萬輸出 token 比 Flash 級距貴五倍,而日常問題 Flash 答得完全夠好。照工作類型分流,同時保留兩家供應商的接口。

GPT-6 Astra 讓 ChatGPT 的第一名站得住腳

Astra 是完整的世代跳躍,而非 GPT-5 系列裡的又一次小改版,9 月 3 日上線時的定價策略也很有話講。每百萬 token 輸入 10 美元、輸出 50 美元,是 GPT-5.6 Sol 促銷價的 2.5 倍。廠商敢這樣訂價,代表他們相信這個能力差距守得住。

砍 75% 的 cache read 價格是本週最有份量的價格動作

Anthropic 在 9 月 1 日推出 Fable 5.1,同時把 cache read 價格降了 75%。如果你的應用是在穩定的文件庫上跑,快取輸入本來就是帳單主體,這一刀對實際月支出的衝擊比任何跑分數字都直接,也是 Claude 第二名坐得穩的原因。

高流量場景 Gemini 3.8 Flash 還是最合理的預設值

Google 9 月 2 日推出 3.8 Flash,價格跟 3.7 Flash 的入門價一樣。能力更新卻不漲價,等於讓 Gemini 在每天要跑掉幾百萬 token 的場景繼續當最便宜的可靠選項,延遲也依然是這個級距最好的。

同時養兩家,照任務分流

頂級模型跟快速模型之間,每百萬輸出 token 的價差現在大約是五倍。把所有問題都丟給最貴的模型,等於在 Flash 就能正確回答的任務上白白燒錢。留著兩家的接口,硬推理丟給 Astra 或 Claude,其餘的交給快速級距吸收。

2026-09-07

OpenAI 開始把 GPT-6 Astra 推送給部分客戶了,這件事我想先講清楚它對今天要不要付錢的影響。分階段推送給審核過的帳號,代表的是天花板往上抬,而付二十美元月費的一般使用者現在還坐不下來用它。

所以 ChatGPT 我維持第一,理由在於它的日常介面仍然是市面上最完整的一包,語音、記憶、檔案處理、圖片生成加上在每台裝置行為都一致的手機 App。Astra 這次推送讓我把推理分數往上加了 0.1,因為 OpenAI 同時公布的安全防護作業告訴我這條模型線是穩著走的。

Claude 穩坐第二,靠的是長文件處理。我每週大部分時間都在餵它四五十頁的 PDF,它能把細節從頭抓到尾,你叫它回頭引用某一段的時候差別馬上看得出來。Gemini 則是給已經住在 Google Workspace 裡的人用的,它的價值來自跟 Gmail、雲端硬碟、日曆的串接。

Grok 這週往上調 0.1。xAI 推出了企業版代理產品,帶有實際可用的權限控管、網路限制與稽核紀錄,這改變了誰真的能把它部署下去。老實說,稽核軌跡就是那個能讓工具通過資安審查的功能,Grok 現在有了。

這個月我的建議是訂閱先別動。三家領先者同時在做模型世代交替,聰明的做法是等正式全面開放之後再決定要不要把工作流搬過去。

ChatGPT 守住第一,靠的是產品深度而非模型代號

GPT-6 Astra 還在限量推送,所以它不是我讓 ChatGPT 維持第一的理由。理由是語音模式、長期記憶、檔案分析、圖片生成與 Canvas 編輯器全都在同一個 App 裡,桌機、網頁、手機三邊行為一致。我把它交給完全沒用過 AI 工具的人,五分鐘內就能產生價值。這種一致性在日常使用上的價值,高過只維持六週的跑分領先。

輸入很長的時候我一定開 Claude

這週我把同一份 48 頁合約丟給前三名,要它們把所有牽涉終止權的條款抓出來。Claude 全部找到,而且引用了我可以回頭核對的頁碼。長輸入下的這種穩定度就是它保住第二的原因,也是我會推薦給律師、研究人員,以及所有真正的工作是以大型文件而非短提示進來的人的具體理由。

Grok 這次加分來自稽核紀錄,跟跑分沒關係

xAI 這週推出企業版代理層級,帶有細緻的權限控管、網路限制與稽核紀錄。我就是為了這一點把 Grok 調到 9.0。我看過的每一家想部署 AI 助理的公司,都卡在資安審查那一關,而那關問的問題就是誰在什麼時候存取了什麼。Grok 現在答得出來,這讓它從一個有趣的模型變成一個可以部署的工具。

等正式開放再考慮換訂閱

三家領先者現在都在世代交替中間。OpenAI 在限量開放 Astra,Anthropic 推出了 100 萬 token 的上下文層級,Google 在 Workspace 裡輪替 Gemini 的模型後端。任何建立在這週限量預覽上的排名,一個月後看都會是錯的。我給讀者的建議是九月先維持現有付費,等新旗艦正式開放並且價格公布之後再重新評估。

2026-09-05

這週平手局破了。OpenAI 推出 GPT-6 Astra,分階段開放正式使用,每百萬 token 輸入 10 美元、輸出 50 美元,脈絡長度 1.05M,而且這是該公司第一次公開標示某個模型觸及關鍵網路安全防護門檻。官方自評 Terminal-Bench 4.0 拿 57.7、DeepSWE 74.1、GPQA 96.0。

這是真的能力躍進,所以我把 ChatGPT 拉到 9.6 分並且排第一。

Claude 退到第二,9.5 分,這是名次調整,不代表它變差了。Anthropic 的 Fable 5.1 在 9 月 1 日推出,快取讀取降到 0.25 美元,對跑長時間代理任務的人來說,這仍然是這週影響最大的發布。長文件推理和要通過 code review 的程式碼,我還是推 Claude。

Gemini 維持 9.4,3.8 Flash 在 9 月 2 日進入穩定正式版,便宜那一層現在真的能上線,接地能力也夠實際應用用。

Grok 的 8.9 守住即時社群資料這塊。Perplexity 的 8.6,想要有出處的答案時我還是開它。

九月我的實際判讀是這樣,Astra 那個安全門檻標記才是值得追的事。前沿實驗室公開用網路攻擊能力去卡一個模型的釋出,企業採購問卷的內容就會跟著改,而且每一家競爭者現在都得回答同一個問題。訂一個旗艦就好,其他家用免費版做交叉驗證。

GPT-6 Astra 以 9.6 分拿下第一

分階段正式開放,每百萬 token 收 10 美元進、50 美元出,脈絡 1.05M,官方自評 Terminal-Bench 4.0 拿 57.7、GPQA 拿 96.0。脈絡、價格、實測能力三者兜在一起,才動得了排名。

真正的新聞是那個網路安全防護門檻

Astra 是 OpenAI 第一個公開認定觸及該門檻的模型。前沿實驗室開始用網路攻擊能力當釋出的閘門,企業採購問卷就會改寫,而所有競爭者現在都得回答同一題。

Fable 5.1 用經濟性替 Claude 守住 9.5

快取讀取降到 0.25 美元,直接改變哪些長時間代理流程跑得起。帳單就是在重複上下文那邊長出來的,好幾小時的工具鏈任務我還是推 Claude。

Gemini 3.8 Flash 讓便宜那層可以上線了

9 月 2 日轉穩定正式版,比多幾分跑分重要得多。又快又便宜、正式可用、接地也不錯的模型,才是多數實際部署真正在跑的東西。

2026-09-04

這週榜單前段真的有動,我把原因講清楚。Anthropic 在 9 月 1 日推出 Claude Fable 5.1,定位是它最強的程式與知識工作模型,專門針對代理式工具呼叫調校,而且快取讀取便宜很多。Google 隔天 9 月 2 日跟上,Gemini 3.8 Flash 進入穩定的正式版。

Claude 和 ChatGPT 並列 9.5,這個平手我守得住,因為它們現在贏的軸線不一樣,多數讀者應該照自己每天在做什麼來選。

Claude 拿下長文件推理、要通過 code review 的程式碼,還有需要把整個專案塞進工作記憶的任務。5.1 這版快取讀取變便宜,對跑長時間代理任務的人影響超大,因為 API 帳單就是在重複上下文這裡默默膨脹的。

ChatGPT 的 9.5 贏在廣度,工具生態最完整、消費端 App 打磨最細、語音模式也是三家裡最自然的。

Gemini 的 9.4 靠即時性和 Workspace 整合,Flash 3.8 轉正式版之後,便宜的那一層終於能拿來跑正式任務。Grok 的 8.9 守在即時社群資料。Perplexity 的 8.6,還是我想要一個附上出處的答案時會開的那個。

我 9 月的實用建議,訂一個旗艦就好,其他家用免費版交叉驗證。以現在的能力差距,訂兩個純粹是浪費錢。

Fable 5.1 讓長時間代理任務變得付得起

Anthropic 在 9 月 1 日這版同時大幅調降快取讀取費用。跑過好幾小時工具鏈的人都知道,帳單就是在重複上下文那邊長起來的,這個成本一砍,值得自動化的工作範圍就跟著變了。

Claude 和 ChatGPT 的平手是真的,差別在任務類型

Claude 吃長脈絡推理和要過 review 的程式碼,ChatGPT 吃生態廣度、App 完成度和語音。兩邊都 9.5 分,選哪個完全看你每天碰的是哪一種。

Gemini 3.8 Flash 讓便宜那層可以上線了

9 月 2 日轉成穩定正式版,這件事比多幾分跑分重要。又快又便宜、正式可用、接地能力也不錯的模型,才是多數實際應用真正會部署的東西。

現在同時訂兩家旗艦是浪費錢

前三名的能力差距已經小到第二個訂閱買不到什麼。挑一個貼合你日常工作的訂下去,想要第二意見的時候用其他家的免費版就夠了。

2026-09-01

八月一口氣有八家業者推出十六個新模型,光看這個數字的組成,就能知道聊天機器人這場競賽現在到底在比什麼。老實說,前段班已經不太在拚純智力了,改成拚速度跟價格。Gemini 3.7 Flash 八月十三號上線,是目前最快的前沿等級模型;Grok 4.6 早一天推出;阿里巴巴則在八月二十六號用 Qwen3.8 Flash 收尾。這三個全部都是延遲跟成本導向的產品。

我還是把 Claude 跟 ChatGPT 並列第一,理由很直接。我平常真的會丟給聊天機器人做的事情,長串推理、需要斟酌的文案、跑得起來的程式碼,這些拉開差距的還是品質。每秒吐幾個字這件事,在這裡影響很小。Claude Opus 5 從七月底就守住這個位置,價格大概只有前一代旗艦的一半,這個降價對每天在用的人來說,比多一個跑分數字有感太多了。

Gemini 穩穩排第三,靠的是即時網路查證的能力,加上 Flash 這一層真的快到會改變你的使用習慣。這個月比較有意思的變化在後段。Qwen Chat 因為 Qwen3.8 Flash 上場,免費版的預設模型明顯比 Le Chat 快,所以我把它往前挪到第九。

如果你今天要選,就照你最常做的事情挑:需要長時間推理跟寫作選 Claude,需要工具生態夠廣選 ChatGPT,需要抓即時網路資料選 Gemini。

前沿競賽的主戰場,已經從智力換成延遲

八月十三號的 Gemini 3.7 Flash 跟八月二十六號的 Qwen3.8 Flash 都是速度取向的版本,Grok 4.6 也就早一天上線。這個月最受矚目的三個發表,比的都是回應時間跟成本。推理天花板這一項,這個月幾乎沒人動。這代表各家實驗室自己也認為,頂端的品質差距已經小到,讓一個夠好的模型「感覺瞬間就回」才是勝負關鍵。

Claude Opus 5 用一半價格提供旗艦智力,是這一季最實在的價值變化

Anthropic 七月二十四號推出 Opus 5,同等智力下的成本大約是前一代旗艦的一半。對於按 token 計費的使用者來說,光是這一件事,實際好用程度的提升就超過八月任何一個跑分變動。這也是我讓 Claude 拿到 9.5 跟 ChatGPT 並列的原因,成本這一項現在算它的加分。

Qwen Chat 排到第九,靠的是免費版真的變快了

Qwen3.8 Flash 八月二十六號上線,直接成為阿里巴巴消費端聊天服務的預設模型。免費使用者在那邊得到的回應速度,現在明顯比 Le Chat 快,這就是我這個月把 Qwen Chat 往前挪的全部理由。講白了,排在後段的服務,免費版反應速度才是使用者真正會感覺到的東西。

照工作型態選,前三名其實分得很乾淨

長時間推理跟長文寫作,Claude 贏。要廣度,圖片、語音、資料分析加上最完整的第三方工具生態,ChatGPT 贏。需要根據當下網路資料回答,Gemini 贏。這是三種不同的工作,9.5、9.5、9.4 這個接近的分數分布,反映的就是只要你把工具配對到任務上,它們的差距其實很小。