2026-07-21
這週榜單前段沒動,靠的是氣勢。GPT-5.6 在 7 月 9 日完成大規模推送,成為 ChatGPT 的預設模型,日常對話和知識工作又更利,加上它本來就吃下全球最大幾家聊天機器人約五成四的流量,第一名沒懸念。Claude 靠程式碼守第二,Fable 5 在 SWE-Bench Pro 拿 80.3 分,我在專案 repo 實測跨檔案修改重試最少,coding 分數維持全表最高。Gemini 穩第三,是準度掛的選擇,3.1 Pro 推理硬,3.5 Flash 性價比最好。這次我唯一動的是 Grok,xAI 在 7 月 8 日推出 Grok 4.5,程式碼取向明確、推理到 Opus 等級,我把它的 coding 分數加一格,名次守第四,因為價格和生態圈還差前面一截。Perplexity、Copilot、DeepSeek 撐住中段,各有即時搜尋、微軟整合、價格的強項。老話一句,看你手邊要做什麼來挑,前四名差的是偏好。
GPT-5.6 成為預設
7 月 9 日起多數 ChatGPT 用戶預設拿到的就是 GPT-5.6,日常對話和知識工作更順手,加上最廣的生態圈,第一名穩穩的。
Claude 程式碼最強
Fable 5 在 SWE-Bench Pro 拿 80.3 分,實際跑 repo 跨檔案修改重試最少,coding 分數維持全表最高,總排第二。
Grok 4.5 小加分
xAI 7 月 8 日新版主打程式碼,推理到 Opus 等級又有 X 即時資料,我把 Grok 的 coding 分數加一格,名次維持第四。
看任務挑,不看聲量
要準度找 Gemini,要即時搜尋找 Perplexity,微軟工作流找 Copilot,要便宜找 DeepSeek。前四名差的是偏好。