Claude Fable 5.1은 도구를 오래 사용하는 작업에 적합한 후보지만 만능 업그레이드는 아닙니다. 여러 파일을 고치고 테스트하는 코딩, 검증이 필요한 조사, 지식 업무에는 시도할 만합니다. 짧은 수정, 엄격한 한도, 낮은 지연이 중요하면 더 작고 빠른 모델부터 비교하세요.
이 리뷰는 2026년 9월 20일 확인한 Anthropic 발표를 버전과 가격의 기준으로 삼습니다. 핵심은 캐시 읽기가 75% 내려 백만 토큰당 0.25달러가 됐지만 모든 완료 작업이 75% 싸지는 않는다는 점입니다. API ID는 claude-fable-5-1이고 경로, effort, 안전 정책이 결과를 좌우합니다.
빠른 결론
적합: 다중 파일 코딩, 도구 호출, 기술 조사, 명확한 검수 조건이 있는 지식 업무.
장점 세 가지: 공식 에이전트 점수, 진단과 무인 실행 사례, 캐시 비용 절감.
단점 세 가지: 첫 토큰과 사용량 위험, 안전 개입에 따른 점수 변화, 서로 다른 harness와 불완전한 범위.
Tabbit 경계: 공개 페이지에서 로그인 선택기와 실행 가능한 작업을 확인하지 못했으므로 지원을 주장하지 않습니다.
모델 자료 (English), 프롬프트 라이브러리 (English), 평가 라이브러리 (English)를 함께 보세요.
수치와 방법
Anthropic은 Terminal-Bench-Science 52.6%, Terminal-Bench 4.0 55.8%, GDPval-AA v2 1,853, OSWorld partial 77.9%, strict 41.7%, Humanity's Last Exam 60.9%와 65.0%, AutomationBench 31.4%, CursorBench 3.2.0 73.4%를 공개합니다. BenchLM의 9월 18일 스냅샷은 84.7/100, 230개 중 1위, 68 tok/s, 첫 토큰 262.88초를 표시합니다.
이 수치들은 같은 시험이 아닙니다. Anthropic은 Terminal-Bench-Science 오차를 약 ±3.5–4.5점으로 설명하고 안전 개입이 OSWorld와 AutomationBench에서 0점이 될 수 있다고 말합니다. BenchLM은 26개 행을 보여주는 집계 사이트이며 수학, 다국어, 멀티모달 등은 측정하지 않았습니다. Medium 독립 분석은 유료라서 공개된 도입부의 두 리더보드 선두와 느린 응답이라는 요지만 사용합니다.
강점
긴 에이전트 작업: 터미널 점수와 Millennium의 크래시 추적, Ramp의 무인 실험은 문맥 유지와 검증이 필요한 업무에 맞습니다. 공급자가 고른 사례라는 한계는 있습니다.
진단과 지식 업무: GDPval-AA v2 1,853과 MongoDB, Red Hat 사례는 로그·문서·테스트를 주는 파일럿 설계에 유용합니다.
긴 세션 비용: 캐시 0.25달러/M는 효과적인 수단입니다. 출력, effort, 재시도와 하위 에이전트를 포함한 완료 비용을 측정해야 합니다.
약점
지연과 한도: BenchLM 수치는 제공자 스냅샷입니다. Reddit와 Every 댓글은 빠른 한도 소진을 말하지만 요금제, 프롬프트, 경로는 모릅니다.
안전 경계: 사이버 오탐 60% 감소 주장과 함께 취약점 발견과 exploit 작성을 구분합니다. 승인된 방어 업무에도 사람의 확인이 필요합니다.
불완전한 범위: 공개 표는 GUI, 터미널, 코드, 지식을 섞고, BenchLM의 여러 범주는 비어 있습니다. system card PDF도 열지 못했습니다.
커뮤니티의 신호
r/ClaudeCode의 connurp는 Medium effort에서 코드가 더 좋아지고 빨라졌으며 Fable 5와 Opus 5 조합보다 요청당 약 37% 낮다고 계산했습니다. r/ClaudeAI의 momkeeeeeeee는 기억 정리와 혈액 검사 종합을 칭찬했지만 코드베이스 실험에서 하루 사용량 30%를 썼다고 했습니다. Every 댓글도 5시간 창을 10~20분 만에 소진했다는 경험을 전합니다. 모두 통제 실험은 아닙니다.
업무별 판단
| 업무 | 판단 |
|---|---|
| 테스트가 있는 다중 파일 코딩 | 유력 후보. ID, 테스트와 총비용을 기록하세요. |
| 출처가 필요한 기술 조사 | 시도할 가치가 있습니다. 인용과 모순 검사를 요구하세요. |
| 짧은 대화와 수정 | 과할 수 있습니다. 빠른 모델과 비교하세요. |
| 승인된 방어 보안 | 조건부. exploit 경계를 지키고 사람이 승인하세요. |
| 엄격한 사용량 한도 | 기본 모델로 두지 말고 단순 업무를 분리하세요. |
| 브라우저 조사 | Tabbit에서는 미검증입니다. |
브라우저 자동화, 2026 AI 브라우저, 브라우저 비교는 클라이언트 배경이지 Fable 지원의 증거가 아닙니다.
Tabbit 경계와 다음 단계
조사 과정에서 Tabbit Browser 공개 페이지를 확인했지만 로그인 선택기, Fable 출력, 모델 ID 확인은 없었습니다. 따라서 이 글은 Tabbit에서 실제 테스트를 수행했다고 주장하지 않습니다. Tabbit 소개, 에이전트 브라우저 안내, 사용 습관을 참고하세요.
계정에서 모델이 보이면 되돌릴 수 있는 작업 하나를 실행하고 ID, effort, 캐시, 출력, 도구, 시간, 재시도, 한도와 사람의 승인을 기록하세요.
최종 판단
예산이 변동을 감당하고 긴 도구 작업이 이득을 줄 때 Fable 5.1은 파일럿 가치가 있습니다. 에이전트 수치와 캐시 절감은 장점이지만 지연, 한도, 안전 개입과 불완전한 검증은 남습니다. 실제 Tabbit 실행과 커뮤니티 캡처를 확보할 때까지 이 글은 초안입니다.
출처
자주 묻는 질문
Claude Fable 5.1은 쓸 가치가 있나요?
도구를 오래 사용해야 하는 코딩과 지식 작업에는 제한된 파일럿을 권합니다. 짧은 대화, 엄격한 한도와 저지연 업무의 기본 선택은 아닙니다.
Fable 5.1이 Fable 5보다 저렴한가요?
Anthropic은 캐시 읽기를 75% 낮춰 백만 토큰당 0.25달러로 제시합니다. 실제 작업 비용은 출력, 사고, 재시도와 도구에 따라 달라집니다.
코딩에 좋은가요?
공식 수치는 Terminal-Bench-Science 52.6%, Terminal-Bench 4.0 55.8%, CursorBench 3.2.0 73.4%입니다. 자신의 저장소에서 다시 테스트해야 합니다.
왜 사용량을 빨리 소진하나요?
긴 문맥, 사고, 출력, 재시도, 도구와 하위 에이전트가 누적됩니다. 커뮤니티 글에는 요금제와 harness가 없어 측정의 근거로만 사용해야 합니다.
Tabbit에서 쓸 수 있나요?
확인하지 못했습니다. 2026년 9월 20일 공개 Tabbit 페이지에는 로그인 모델 선택기와 실행 가능한 Fable 5.1 작업 공간이 없었습니다.
벤치마크를 어떻게 읽어야 하나요?
각 수치를 작업, harness, 날짜, effort와 안전 조건과 함께 읽으세요. Anthropic은 Terminal-Bench-Science 오차를 약 ±3.5–4.5점으로 제시하고, BenchLM은 집계 스냅샷입니다.