Claude Fable 5.1は、ツールを長く使う仕事に向いた候補です。しかし、すべての仕事での万能な更新ではありません。複数ファイルの実装、検証付きの調査、知識作業なら試す価値があります。短い編集、厳しい利用枠、低遅延の会話では小さく速いモデルを先に比較してください。
このレビューは、2026年9月20日に確認したAnthropicの発表ページをバージョンと料金の基準にしています。中心となる事実は、キャッシュ読み取りが75%下がり1百万トークン0.25ドルになった一方、完成した仕事が一律75%安くなるわけではないことです。API IDはclaude-fable-5-1です。
結論
向く仕事:複数ファイルのコード、ツール利用、技術調査、受け入れ条件のある知識作業。
強み三つ:公式のエージェント評価、根本原因と無人実行の具体例、キャッシュ費用の削減余地。
弱み三つ:初回トークンと利用枠、保護機能による評価差、異なるharnessと不完全な範囲。
Tabbitの境界:公開ページでログイン後のモデル選択や実行環境を確認できなかったため、対応を主張しません。
モデル資料 (English)、プロンプト集 (English)、評価集 (English)も参照してください。
数値の読み方
AnthropicはTerminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8%、GDPval-AA v2 1,853、OSWorld partial 77.9%、strict 41.7%、Humanity's Last Exam 60.9%と65.0%、AutomationBench 31.4%、CursorBench 3.2.0 73.4%を掲載しています。BenchLMの9月18日スナップショットは84.7/100、230モデル中1位、68 tok/s、初回トークン262.88秒と表示します。
数値は同じ物差しではありません。AnthropicはTerminal-Bench-Scienceの標準誤差を約±3.5–4.5点とし、安全介入がOSWorldとAutomationBenchでゼロになる場合を説明しています。BenchLMは26行を表示する集計サイトで、数学、多言語、マルチモーダルなどは未測定です。Mediumの独立記事は会員限定のため、公開された「二つの順位表で首位だが最も遅く、一項目で最も高価」という導入だけを使います。
具体的な強み
長いツール作業。 端末評価と、Millenniumのクラッシュ追跡、Rampの無人実験は、文脈を保ち検証する仕事に近い示唆です。ベンダー選定の事例なので保証ではありません。
診断と知識作業。 GDPval-AA v2は1,853です。MongoDBとRed Hatの例は、ログ、文書、テストを与えるパイロット設計に役立ちます。
長いセッションのキャッシュ。 0.25ドル/Mは有効なレバーですが、出力、effort、再試行、ツール、サブエージェントを含む費用を測る必要があります。
具体的な弱み
遅延と利用枠。 BenchLMの初回応答はプロバイダーのスナップショットです。RedditとEveryのコメントは利用枠を早く使う経験を報告しますが、プラン、プロンプト、ルートは不明です。
安全境界。 Anthropicはサイバー誤検知60%減を述べますが、脆弱性発見とexploit作成を区別し、安全介入をゼロとして扱う評価もあります。
不完全な範囲。 公開表はGUI、端末、コード、知識を混ぜています。system card PDFは今回のブラウザで開けず、独立記事本文も確認できませんでした。
コミュニティの対照
r/ClaudeCodeのconnurpは、Medium effortでコードが良く速くなり、Fable 5とOpus 5の組み合わせより1リクエスト約37%安いと個人的に計算しています。r/ClaudeAIのmomkeeeeeeeeは記憶整理と血液検査の統合を評価する一方、コードベースの試用で一日約30%の枠を使ったと述べます。Everyのコメントにも、5時間枠を10分または20分で使い切ったという声があります。いずれも統制実験ではありません。
用途別の判断
| 用途 | 判断 |
|---|---|
| テスト付き複数ファイル開発 | 有力候補。ID、テスト、総費用を記録する。 |
| 出典付き技術調査 | 試す価値あり。引用と矛盾確認を必須にする。 |
| 短い書き換え | 過剰になりやすい。速いモデルを比較する。 |
| 許可済みの防御セキュリティ | 条件付き。人間の承認を残す。 |
| 厳しい利用枠 | 初期値にしない。単純な作業を分ける。 |
| ブラウザ調査 | Tabbitでは未検証。 |
ブラウザ自動化、2026年のAIブラウザ、比較記事はクライアントの背景であり、FableのTabbit対応証拠ではありません。
Tabbitでの境界と次の一手
調査ではTabbit Browserの公開ページを確認しましたが、ログイン後の選択画面、Fable 5.1の出力、モデルID確認はありませんでした。そのため、この記事はTabbitでの実測を主張しません。Tabbitの説明、エージェントブラウザガイド、利用の実践を背景として参照してください。
アカウントにモデルが表示されたら、既存テスト付きの変更など、戻せる仕事を一つ実行します。ID、effort、キャッシュ、出力、ツール、時間、再試行、枠、人的承認を記録します。
最終評価
長いツール作業に投資でき、予算に変動を含められるなら、Fable 5.1は管理されたパイロットに値します。公式のエージェント評価、具体的な事例、安いキャッシュは強みです。しかし遅延、枠、安全介入、不完全な独立評価は残ります。実際のTabbit実行と必要なコミュニティ記録が揃うまで、この記事は草稿です。
出典
よくある質問
Claude Fable 5.1は価値がありますか?
長いツール利用、コーディング、知識作業には小さな実験を勧めます。短い会話や厳しい上限、低遅延が必要な仕事では自動的な第一選択ではありません。
Fable 5.1はFable 5より安いですか?
Anthropicはキャッシュ読み取りを75%下げて1百万トークン0.25ドル、通常の費用を約25%低下と説明しています。最終費用は出力、思考、再試行、ツールで変わります。
コーディングに向いていますか?
公式値はTerminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8%、CursorBench 3.2.0 73.4%です。自分のリポジトリで再現テストが必要です。
なぜ利用枠を早く消費しますか?
長いコンテキスト、思考、出力、再試行、ツール、サブエージェントが積み重なります。コミュニティ投稿にはプランとharnessがないため、測定の理由として扱います。
Tabbitで使えますか?
検証できませんでした。2026年9月20日の公開Tabbitページには、ログイン後の選択画面も実行可能なFable 5.1環境もありませんでした。
ベンチマークをどう読みますか?
タスク、harness、日付、effort、安全条件と一緒に読みます。AnthropicはTerminal-Bench-Scienceの標準誤差を約±3.5–4.5点と示し、BenchLMは集計スナップショットです。