Claude Fable 5.1 適合長時間呼叫工具的工作,但不是所有場景的通用升級。多檔案編碼、帶驗證迴圈的研究與知識工作可以先試;短編輯、嚴格配額或低延遲聊天則應先比較更小、更快的模型。
本評測以 Anthropic 發布頁作為版本和價格錨點,並在 2026 年 9 月 20 日重新開啟核對。最值得記住的是:快取讀取降價 75% 至每百萬 token 0.25 美元,但完整任務不會因此自動便宜 75%。目前 API ID 是 claude-fable-5-1,實際能力仍取決於接入路線、effort 和安全策略。
結論先說
最適合:多檔案編碼、工具呼叫、技術研究和有驗收條件的知識工作。
三個優點:官方 Agent 基準強;官方合作案例包含根因分析和無人值守任務;快取讀取價格確實提供成本槓桿。
三個缺點:首 token 和配額風險;安全介入會改變結果;公開證據使用不同 harness 且覆蓋不完整。
Tabbit 邊界:公開 Tabbit 頁面沒有登入後的 Fable 5.1 選擇器或可執行任務,因此本文不聲稱 Tabbit 已支援它。
可先看 Claude Fable 5.1 模型資源 (简体中文),再查看其 提示詞庫 (简体中文) 和 評測庫 (简体中文)。
快速規格
| 項目 | 已發布快照 | 不能證明什麼 |
|---|---|---|
| API ID 與版本 | claude-fable-5-1;2026 年 9 月發布頁 | 你的方案或瀏覽器一定暴露該模型 |
| 輸入/輸出價格 | 每百萬 token 10/50 美元 | 思考、重試和工具後的完整任務成本 |
| 快取讀取 | 每百萬 token 0.25 美元,比 Fable 5 低 75% | 每個任務都固定節省 75% |
| 上下文 | 發布材料描述 1M 上下文路線 | 每個 Provider 都開放完整上限 |
| 預設 effort | Claude Code 為 High,Claude Cowork 和 Claude.ai 為 Medium | 所有客戶端都有相同設定 |
| 可用路線 | Anthropic API、AWS、Google Cloud、Microsoft Azure | 你的帳戶、地區、配額和工具權限 |
| 獨立快照 | BenchLM:84.7/100、230 個模型中第 1、68 tok/s、首 token 262.88 秒 | 通用延遲承諾或生產複測 |
基準與口徑
Anthropic 發布頁列出:Terminal-Bench-Science 0.1 為 52.6%,Terminal-Bench 4.0 為 55.8%,GDPval-AA v2 為 1,853,OSWorld 2.0 partial 為 77.9%,strict 為 41.7%,Humanity's Last Exam 無工具為 60.9%、有工具為 65.0%,AutomationBench 為 31.4%,CursorBench 3.2.0 為 73.4%。對應 Fable 5 的可比值分別為 24.7%、42.0%、1,723、72.9%、36.1%、57.8%、63.8%、17.1% 和 70.5%。
這些數字不能拼成一個總榜。Anthropic 說明 Terminal-Bench-Science 的標準誤差約為正負 3.5–4.5 分,且發布表使用特定 harness;生產安全策略介入時,OSWorld 和 AutomationBench 任務可能記為零。BenchLM 的 9 月 18 日頁面是聚合快照,顯示 26 條基準、分類覆蓋不完整;Medium 獨立文章正文需要會員,本文只使用它公開可見的「兩個榜單領先但速度最慢、某項任務成本最高」概括。沒有任何一項是你的儲存庫複跑。
三個具體優點
1. 長鏈路工具使用是核心場景
52.6% 的 Terminal-Bench-Science 和 55.8% 的 Terminal-Bench 4.0 都指向需要保持上下文、呼叫工具並檢查中間結果的任務。Anthropic 的合作案例還提到 Millennium 追蹤罕見崩潰,以及 Ramp 的無人值守實驗發現標籤偽影和生產告警。這些是廠商選擇的案例,不是穩定性保證,卻比單輪聊天分數更接近 Agent 工作。
可參考 Agent 推理與深度研究 和 什麼是 Agent 瀏覽器。
2. 知識工作和診斷有具體線索
GDPval-AA v2 為 1,853;MongoDB 描述了跨服務研究後進行無人值守驗證的原型,Red Hat 稱 Claude Code 在測試集合中找到每個壞建置的根因。實際試用時應給它日誌、文件和測試命令,再設定明確驗收條件。合作案例不能取代你的事故資料。
3. 快取價格可能改善長會話經濟性
重複使用同一上下文時,每百萬 token 0.25 美元的快取讀取是實在的成本槓桿。Anthropic 估計典型成本低約 25%,高度 Agent 化成本最多低約 45%。但輸出、思考 effort、重試、工具和訂閱配額仍會決定完整任務帳單。真正應測的是每個驗收結果的成本。
三個需要預算的缺點
1. 延遲和配額都是產品體驗
BenchLM 在 9 月 18 日顯示首 token 262.88 秒、速度 68 tok/s。這只是 Provider 快照,不是 SLA,卻足以說明需要本地試用。Reddit 使用者 momkeeeeeeee 一邊稱它是自己用過最好的模型,一邊說一天消耗了約 30% 的配額;Every 影片評論中也有人說十到二十分鐘就耗盡五小時視窗。方案、提示詞和路線未知,因此只能得出「長任務可能昂貴或緩慢」的結論。
2. 安全策略會改變能力和分數
Anthropic 稱生產安全策略可減少 60% 的網路安全誤報,同時明確 Fable 可發現漏洞但不能開發 exploit。發布頁還說明安全介入的 OSWorld 和 AutomationBench 任務會記零。安全工作應限定為授權防禦分析,並保留人工審核。
3. 覆蓋廣但仍不完整
BenchLM 頁面沒有測數學、多語、多模態和指令遵循。官方表格混合 GUI、終端、編碼與知識任務,系統卡 PDF 在研究瀏覽器中無法開啟,獨立 Medium 正文也有存取限制。未知項應留在決策裡,不能把發布表寫成普遍排名。
社群訊號:讚賞和挫敗同時存在
r/ClaudeCode 的 connurp 是全端 Django 開發者,稱 Medium effort 下程式碼更好、更快,並估算相對 Fable 5 加 Opus 5 的組合每次請求低約 37%。這是個人路由計算,不是基準。r/ClaudeAI 的 momkeeeeeeee 稱它擅長整理記憶和綜合三份血檢結果,卻在測試程式碼庫時一天用掉約 30% 配額。
Every 的週測影片評論也出現同樣分歧:有人喜歡寫作,有人說不到 20 分鐘就用完五小時視窗,或編碼 token 很快耗盡。評論沒有受控樣本,但說明配額壓力明顯依賴任務。
按工作負載判斷
| 工作負載 | 結論 | 試用方式 |
|---|---|---|
| 多檔案編碼和測試 | 值得優先試 | 固定模型 ID,保留測試命令,記錄重試和總成本 |
| 帶來源的技術研究 | 可以試 | 要求引用、矛盾檢查和人工驗收 |
| 短改寫、快速聊天 | 通常過重 | 先比較更快、更便宜的模型 |
| 授權防禦安全工作 | 有條件 | 可做發現和修復分析,保留 exploit 邊界與人工簽核 |
| 嚴格訂閱配額 | 不宜預設 | 把機械子任務路由給其他模型,先測完整會話 |
| 瀏覽器研究 | Tabbit 中未驗證 | 檢查即時選擇器,不能從公開首頁推斷支援 |
瀏覽器自動化、2026 年最佳 AI 瀏覽器 和 AI 瀏覽器比較 只能提供客戶端背景,不能證明 Fable 5.1 在 Tabbit 可用。
Tabbit 邊界與下一步
本次研究核對了 Tabbit Browser 公開頁面。頁面有產品和下載資訊,但沒有登入後的模型選擇器、Fable 5.1 輸出或 model ID 校驗;因此本文不聲稱完成了 Tabbit 實測。Tabbit 介紹、Agent 瀏覽器指南 和 Tabbit 使用習慣 解釋了瀏覽器層工作流。
如果帳戶顯示 Fable 5.1,先選一個可撤銷任務:帶現有測試的多檔案修改,或要求引用的小型研究包。記錄模型 ID、effort、快取讀取、輸出 token、工具呼叫、耗時、重試、配額和人工驗收結果,再和 Fable 5 及目前模型比較每個合格結果的成本。
最終判斷
當任務夠長、工具呼叫能帶來回報、預算能承受波動時,Claude Fable 5.1 值得受控試用。官方 Agent 結果、合作案例和更低快取讀取價格都是優點,但不能抵消首 token、配額、安全介入和獨立覆蓋不足。
從能通過驗收的最低 effort 開始;短任務交給小模型,機械子任務有意路由。完成真實 Tabbit 任務並補齊社群截圖前,本文保持草稿。
來源
常見問題
Claude Fable 5.1 值得用嗎?
若任務需要長時間工具呼叫、程式設計與知識工作,可以先做受控試用。短對話、嚴格配額與低延遲場景不應直接預設使用。
Fable 5.1 比 Fable 5 便宜嗎?
Anthropic 稱快取讀取降價 75% 至每百萬 token 0.25 美元,典型成本約低 25%,高度 Agent 化任務最多約低 45%。這不是每個完整任務都會得到的固定折扣。
Claude Fable 5.1 適合程式設計嗎?
官方發布頁給出 Terminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8% 與 CursorBench 3.2.0 73.4%。這些是方向性證據,仍需在自己的儲存庫與測試命令中複核。
為什麼 Fable 5.1 會快速消耗配額?
高 effort、長上下文、輸出、重試、工具呼叫與子 Agent 都可能疊加消耗。社群報告缺少方案和 harness 資訊,應作為測量理由,而不是統一限制。
Tabbit 能用 Claude Fable 5.1 嗎?
本評測沒有驗證這點。2026 年 9 月 20 日檢查公開 Tabbit 頁面時,沒有登入後的模型選擇器或可執行的 Fable 5.1 工作區。
應如何理解基準分數?
必須連同任務、harness、日期、effort 與安全規則閱讀。Anthropic 給出的 Terminal-Bench-Science 標準誤差約為正負 3.5–4.5 分,BenchLM 則是聚合快照,不是生產環境複跑。