Claude Fable 5.1 종합 분석: 벤치마크, 개선 사항, 가격 및 속도

Claude Fable 5.1의 7개 주요 벤치마크 전체 성적을 Fable 5, Opus 5, GPT-5.6 Sol과 항목별로 비교하고, 5.1의 장기 작업, 도구 호출, 캐시 비용, 속도, 요금제 제한 및 마이그레이션 변경 사항을 설명합니다.

PandaNpc최초 게시일
Claude Fable 5.1 종합 분석: 벤치마크, 개선 사항, 가격 및 속도

Claude Fable 5.1은 2026년 9월 1일 공식 출시되었습니다. 먼저 결론부터 말하자면, 이는 일반적인 질의응답을 겨냥한 일상적인 모델 업그레이드가 아니라 장시간 프로그래밍, 복잡한 연구, 앱 간 도구 호출 및 무인 Agent를 위해 준비된 고비용 플래그십 모델입니다. Anthropic이 공개한 7개 주요 벤치마크에서 Fable 5.1은 모두 Fable 5를 능가했습니다. 하지만 API 단가는 여전히 Opus 5의 두 배이며, 공식 상대 지연 시간도 "느림"으로 표시되어 있습니다.

작업이 단순히 파일 하나를 수정하거나, 짧은 글을 쓰거나, 일반적인 질문에 답하는 것이라면 Anthropic은 여전히 Opus 5부터 시작할 것을 권장합니다. Fable 5.1은 일반 모델이 높은 effort에서도 안정적으로 완료하지 못하는 긴 체인(long-chain) 작업에 더 적합합니다. 이 글은 공식 발표 데이터, 각 벤치마크의 의미, 5.1의 구체적인 개선 사항, 가격, 속도 및 마이그레이션 제한을 한데 모아, "누가 이겼는지"만 보여주는 벤치마크 차트 하나만 보지 않도록 돕습니다.

한 표로 이해하는 Fable 5.1 사양

항목 Claude Fable 5.1 Claude Opus 5 Claude Sonnet 5
컨텍스트 창 1M token 1M token 1M token
최대 출력 128K token 128K token 128K token
입력 가격 $10 / MTok $5 / MTok $2 / MTok
출력 가격 $50 / MTok $25 / MTok $10 / MTok
상대 지연 시간 느림 보통 빠름
Thinking Adaptive, 항상 활성화 Adaptive Adaptive
기본 effort High High High
신뢰 가능한 지식 기준일 2026년 6월 2026년 5월 2026년 1월

여기서 말하는 "느림"은 Anthropic 모델 카탈로그에 따른 상대적 지연 등급일 뿐, 고정된 초당 token 수를 의미하지 않습니다. 실제 작업 완료 시간은 effort, 도구 호출 라운드 수, 캐시 적중률, 컨텍스트 길이, 실패 재시도 횟수에 따라 달라집니다.

Fable 5.1의 계획부터 검증까지의 장시간 Agent 워크플로우
Fable 5.1은 일회성 응답이 아니라 지속적인 계획, 실행, 복구, 검증 및 보고를 필요로 하는 장기 작업을 대상으로 합니다.

Fable 5.1 주요 벤치마크 전체 표

아래 표는 Anthropic의 2026년 9월 1일 발표 페이지에 있는 메인 표를 그대로 사용합니다. 오독을 방지하기 위해 백분율, GDPval-AA 원점수, OSWorld의 partial/strict, HLE의 도구 사용 유무 결과를 각각 분리해 나열했습니다. 각 벤치마크는 영어 공식 명칭을 유지하며, 그다음 줄에 한국어 번역 명칭을 제공합니다. 다른 언어 버전에서도 영어 이름 아래에 해당 언어의 번역 이름을 표시합니다.

능력 벤치마크 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol Fable 5 대비 5.1
에이전트 과학 연구 Terminal-Bench-Science 0.1
에이전트 과학 연구 터미널 벤치마크
52.6% 24.7% 29.0% 22.4% +27.9퍼센트 포인트
에이전트 터미널 프로그래밍 Terminal-Bench 4.0
에이전트 터미널 프로그래밍 벤치마크
55.8% 42.0% 52.3% 37.3% +13.8퍼센트 포인트
전문 지식 작업 GDPval-AA v2
실제 경제적 가치 전문 작업 벤치마크
1853 1723 1824 1711 +130점
컴퓨터 조작 OSWorld 2.0 — Partial
실제 컴퓨터 조작 벤치마크: 부분 완료 점수
77.9% 72.9% 75.4% — +5.0퍼센트 포인트
컴퓨터 조작 OSWorld 2.0 — Strict
실제 컴퓨터 조작 벤치마크: 엄격 완료율
41.7% 36.1% 39.6% — +5.6퍼센트 포인트
다학문 추론 Humanity's Last Exam — No tools
인류의 마지막 시험: 도구 미사용
60.9% 57.8% 56.6% — +3.1퍼센트 포인트
다학문 추론 Humanity's Last Exam — With tools
인류의 마지막 시험: 도구 사용
65.0% 63.8% 63.6% — +1.2퍼센트 포인트
비즈니스 워크플로우 AutomationBench
앱 간 비즈니스 자동화 워크플로우 벤치마크
31.4% 17.1% 26.9% 19.6% +14.3퍼센트 포인트
에이전트 프로그래밍 CursorBench 3.2.0
실제 다중 파일 프로그래밍 작업 벤치마크
73.4% 70.5% 70.0% 67.2% +2.9퍼센트 포인트

—은 Anthropic의 이 메인 표에서 해당 점수가 제공되지 않았음을 의미하며, 해당 모델이 작업을 수행할 수 없다는 뜻은 아닙니다. Terminal-Bench 4.0에서 제한이 더 적고 신뢰할 수 있는 프로그램에만 공개된 Mythos 5.1은 60.9%를 기록했습니다. 이 글은 일반 사용자가 사용할 수 있는 Fable 5.1에 초점을 맞추며 Mythos의 점수를 Fable 열에 혼합하지 않습니다.

Terminal-Bench-Science 0.1은 무엇을 측정하나?

Terminal-Bench-Science 0.1은 생명과학, 물리과학, 지구과학, 수학 및 공학의 5개 주요 분야에서 70개의 실제 연구 워크플로우를 포함합니다. 작업은 객관식이 아니라 Agent가 터미널에서 데이터 분석, 통계적 추론, 시뮬레이션, 최적화, 정리 증명, 이미지 재구성 또는 과학적 머신러닝을 완료하고, 재현 가능한 테스트로 결과물을 검사하도록 요구합니다.

Fable 5.1의 52.6%는 공식 재현 실험에서 Fable 5의 24.7%보다 27.9퍼센트 포인트 높은 수치로, 전체 표에서 가장 두드러진 도약입니다. 그러나 공식은 각 모델에 약 ±3.5~4.5퍼센트 포인트의 표준 오차가 있다고 명시하므로, 소수점 첫째 자리를 절대적으로 정확한 순위로 간주해서는 안 됩니다.

Terminal-Bench 4.0과 CursorBench 3.2.0은 무엇을 측정하나?

Terminal-Bench는 Agent가 실제 터미널 환경에서 복잡한 작업을 처리하게 하며, 환경을 이해하고, 도구를 호출하고, 파일을 수정하고, 최종적으로 검증을 통과할 수 있는지에 중점을 둡니다. Fable 5.1은 55.8%를 기록해 Fable 5보다 13.8퍼센트 포인트 높았고, Opus 5의 52.3%도 넘어섰습니다.

CursorBench 3.2는 실제 Cursor 세션에서 비롯된 모호한 다중 파일 작업을 다루며, 3.2 버전에서는 지침 준수 및 고급 도구 사용 문제가 추가되었습니다. Fable 5.1 Max는 73.4%를 기록해 Terminal-Bench-Science만큼 큰 격차는 아니지만, 작업당 평균 72,060 token, $9.64의 비용을 사용했습니다. Fable 5 Max는 103,525 token, $17.32였습니다. 여기서 더 주목할 점은 동일한 유형의 작업을 완료할 때의 token과 비용 절감이지, 2.9퍼센트 포인트 자체가 아닙니다.

GDPval-AA v2는 무엇을 측정하나?

GDPval-AA v2는 업계 전문가가 설계한 220개의 작업을 사용해 44개 직업과 9개 산업을 포괄하며, 모델이 실제적이고 경제적 가치가 있는 지식 작업을 처리하는 능력을 평가합니다. 1853은 백분율이 아닌 종합 점수입니다. 이 결과는 Fable 5.1이 전문 문서, 분석 및 산출물에서 Fable 5를 능가하고 Opus 5도 소폭 앞선다는 것을 보여줍니다.

OSWorld 2.0에는 왜 점수가 두 개인가?

OSWorld 2.0은 108개의 장기 컴퓨터 조작 워크플로우를 포함하며, 각 작업의 인간 완료 시간 중앙값은 약 1.6시간입니다. Partial은 여러 체크포인트를 기준으로 부분 완료 점수를 부여하고, Strict는 목표를 완전히 달성해야만 성공으로 간주합니다.

따라서 Fable 5.1의 77.9% partial과 41.7% strict는 모순되지 않습니다. 대부분의 단계를 자주 완료하지만, 일부 작업은 끝까지 완료하지 못한다는 뜻입니다. 이는 컴퓨터 Agent가 "계속 작동하는 것처럼 보이는 것"이 작업 성공을 의미하지 않는다는 점을 상기시켜 줍니다.

Humanity's Last Exam은 무엇을 측정하나?

Humanity's Last Exam은 Center for AI Safety와 Scale AI가 공동으로 만들었으며, 단순 검색으로 답하기 어려운 학제 간 전문가 수준 문제 2,500개로 구성됩니다. Fable 5.1은 도구 미사용 조건에서 Fable 5보다 3.1퍼센트 포인트 높았지만, 도구를 허용하면 1.2퍼센트 포인트만 높습니다. 확실히 더 강력하지만, 모든 벤치마크에서 두 배 성장이 나타나는 것은 아닙니다.

AutomationBench는 무엇을 측정하나?

AutomationBench는 Agent가 CRM, 이메일, 캘린더, 메시징 및 프로젝트 관리 등의 시뮬레이션된 SaaS 도구를 넘나들며 영업, 마케팅, 운영, 고객 서비스, 재무 및 인사 워크플로우를 완료할 수 있는지 확인합니다. Fable 5.1은 17.1%에서 31.4%로 약 84%의 상대적 향상을 보였으며, 이는 5.1이 다중 앱 상태 관리와 긴 단계 실행에서 실질적인 진전을 이루었음을 보여줍니다. 그러나 31.4%라는 수치는 이런 무인 비즈니스 자동화가 여전히 완전히 해결되지 않았음을 의미합니다.

Fable 5.1의 7개 주요 벤치마크 역량 커버리지 매트릭스
7개 벤치마크는 각각 과학 연구, 터미널 프로그래밍, 전문 지식 작업, 컴퓨터 조작, 다학문 추론, 비즈니스 프로세스 및 다중 파일 프로그래밍을 다룹니다.

Fable 5.1이 Fable 5와 비교해 개선된 점

1. 장시간 작업에서 지름길을 덜 선택함

Anthropic은 Fable 5.1을 장시간 Agent 모델로 포지셔닝합니다. 먼저 계획하고, 도구를 사용하고, 실패 후 복구하고, 결과를 검증하며, 진행 상황을 능동적으로 보고합니다. 단일 테스트를 빠르게 통과시키기 위해 부분적으로 우회하기보다는 근본 원인을 수정하는 것을 강조합니다. 공식적으로 제시된 대상 시나리오에는 코드베이스 간 기능 구현, 코드 리뷰, 성능 최적화, 여러 날에 걸친 자율 세션, 연구, 문서, 스프레드시트 및 프레젠테이션이 포함됩니다.

2. 낮은 effort로도 이전 세대의 고비용 결과에 근접

Fable 5.1은 메시지별로 effort를 조정하는 기능을 새로 추가했습니다. 공식 비용 곡선에 따르면, Low 또는 Medium effort는 일부 작업에서 Fable 5에 도달하거나 이를 능가하면서도 token과 비용을 줄입니다. Claude Code는 기본적으로 High effort를 사용하고, Claude.ai와 Cowork는 기본적으로 Medium을 사용하므로, 모델을 비교할 때는 반드시 effort를 먼저 확인해야 합니다. 서로 다른 등급의 결과를 직접 비교해서는 안 됩니다.

3. 도구 호출 사이에 읽을 수 있는 진행 상황 표시

API에 display: "updates" 테스트 기능이 새로 추가되어, 모델이 도구 호출 사이에 사용자 대상 진행 상황 업데이트를 제공할 수 있습니다. 몇 시간씩 걸리는 작업의 경우, 도구 카드가 계속 표시되는 것만 보는 것보다 모델이 지금 무엇을 하고 있는지, 목표에서 벗어나지 않았는지 판단하기가 훨씬 쉽습니다.

4. 작성, 시각적 검증 및 자체 테스트가 더 완전해짐

공식 발표에 따르면 5.1은 자신의 수정 사항을 검증하기 위한 테스트를 능동적으로 작성하고, 시각적 능력을 활용해 출력을 설계 목표와 대조 확인합니다. 파트너 평가에서도 더 간결한 진행 보고, 다중 파트 질문에 대한 더 완전한 답변, 여러 서비스에 걸친 호출 체인 추적, 장시간 실행 후에도 가독성 유지 등이 강조되었습니다. 이러한 평가는 정성적 피드백이므로, 통일된 벤치마크 결론으로 가장해서는 안 됩니다.

5. 보안 차단이 더 정밀해졌지만 사라지지는 않음

Fable 5.1의 사이버 보안 방어 오탐률은 Fable 5 출시 당시보다 약 60% 감소했고, 기초 생물학 및 의학 질문이 등급 강등을 유발하는 빈도는 약 85% 감소했습니다. 이제 소프트웨어 취약점 발견에는 사용할 수 있지만, 침투 테스트, 익스플로잇 코드 생성, 바이너리 취약점 스캔 같은 이중 용도 작업은 여전히 Opus로 라우팅될 수 있습니다. 라우팅된 후에는 Fable 가격으로 청구되지 않습니다.

6. 콘텐츠 출처 표시 추가

Fable 5.1은 content provenance를 도입합니다. 생성된 텍스트에는 통계적 워터마크가 포함될 수 있으며, Anthropic의 콘텐츠 검사 도구를 통해 검증할 수 있습니다. 본문에 눈에 보이는 표시를 추가하지는 않지만, 콘텐츠 플랫폼, 교육 및 기업 감사 측면에서는 미리 알아두어야 할 새로운 동작입니다.

Fable 5.1의 이전 세대 대비 6가지 핵심 개선 사항
5.1의 변화는 장기 작업, 낮은 effort 효율성, 진행 보고, 자체 검증, 오탐 감소 및 콘텐츠 출처 표시에 집중되어 있습니다.

Fable 5.1 비용 계산 방법

청구 항목 Fable 5.1 가격 Fable 5와 비교
입력 $10 / 100만 token 동일
출력 $50 / 100만 token 동일
5분 캐시 쓰기 $12.50 / 100만 token 동일한 등급
1시간 캐시 쓰기 $20 / 100만 token 동일한 등급
캐시 읽기 $0.25 / 100만 token 75% 인하
Batch API 입력·출력 가격의 50% Batch 규칙 적용

장기 작업 한 번이 누적 1,000만 개의 캐시 token을 읽고, 20만 개의 새 입력 token과 5만 개의 출력 token을 생성한다고 가정합니다. 캐시 쓰기는 고려하지 않습니다:

text
缓存读取:10 × $0.25 = $2.50
新输入:0.2 × $10 = $2.00
输出:0.05 × $50 = $2.50
合计:$7.00

동일한 1,000만 캐시 읽기는 Fable 5에서 약 $10이므로, 이 항목만으로도 $7.50 차이가 납니다. Anthropic은 이를 근거로 일반적인 token 과금 작업의 실제 비용이 약 25% 절감될 수 있고, Agent 활용도가 높고 긴 컨텍스트를 자주 재사용하는 작업은 최대 약 45% 절감될 수 있다고 추정합니다. 이는 API 표시 가격 전체가 내린 것이 아니라 캐시 적중이 많을수록 절감 효과가 더 커지는 구조입니다.

구독 사용자가 API 캐시 인하를 직접 누릴 수 있는 것은 아님

Max와 Team/Enterprise의 premium seat은 주간 할당량의 최대 50%를 Fable 모델에 사용할 수 있습니다. Pro 및 표준 seat은 처음부터 usage credits를 사용합니다. 구체적인 소모량은 계정의 Usage 페이지에 표시된 내용을 기준으로 합니다. 캐시 읽기 인하는 주로 token 과금 시나리오에서의 변화이므로, API의 75% 캐시 인하를 "Max 요금제를 4배 더 쓸 수 있다"로 직접 환산해서는 안 됩니다.

Fable 5.1의 입력, 출력 및 캐시 비용 구조
Fable 5.1의 입력·출력 단가는 변하지 않았으며, 주요 인하는 캐시 읽기에서 비롯됩니다. 긴 컨텍스트를 많이 재사용할수록 더 유리합니다.

Fable 5.1은 실제로 빠른가?

답은 다음과 같습니다: 단일 응답은 다소 느리지만, 복잡한 작업의 총 완료 시간은 더 짧을 수 있습니다.

  • Anthropic의 모델 카탈로그는 Fable 5.1을 Slower, Opus 5를 Moderate, Sonnet 5를 Fast로 표시합니다.
  • Claude Code는 기본적으로 High effort를 사용하므로 Low나 Medium보다 자연스럽게 더 많은 추론 시간을 사용합니다.
  • Every는 자체 워크로드에서 Fable 5.1이 Opus 5보다 약 2배 빠르고 token도 절반이라고 밝혔습니다. 이는 파트너의 특정 테스트 결과이지 일반적인 속도 보장은 아닙니다.
  • CursorBench에서 Fable 5.1 Max는 평균 70단계, 72,060 token을 사용했고, Fable 5 Max도 72단계였지만 103,525 token을 사용했습니다. 5.1의 장점은 "우회를 덜 하고 token을 덜 소모하는 것"에 가깝지, 첫 토큰이 더 빨리 나오는 것으로 나타나는 것은 아닙니다.

따라서 채팅, 짧은 코드 및 빈번한 상호작용에는 Sonnet 5 또는 Opus 5를 우선 선택하고, 코드베이스 간 디버깅, 장기 연구 및 자체 검증이 필요한 무인 작업에는 Fable 5.1을 고려하세요.

Fable 5.1로 업그레이드하기 전에 처리해야 하는 호환성 변경 사항

Claude Code를 최소 2.1.250으로 업그레이드

Anthropic의 요금제 및 가용성 설명은 Claude Code 2.1.250 이상을 요구합니다. Fable 5.1이 보이지 않으면 먼저 다음을 확인하세요:

bash
claude --version

그런 다음 Claude Code 공식 업그레이드 방법에 따라 업데이트하고 세션을 다시 시작하세요. Fable 5.1의 API 모델 ID는 다음과 같습니다:

text
claude-fable-5-1

Forced tool use가 오류를 반환할 수 있음

모델이 특정 도구를 강제로 호출하도록 요청하면 Fable 5.1이 오류를 반환할 수 있습니다. 마이그레이션 전에 tool_choice와 자체 구축 Agent의 강제 도구 호출 흐름을 확인하고, Fable 5의 동작이 완전히 호환된다고 가정하지 마세요.

Thinking blocks를 모델 간에 임의로 재사용할 수 없음

이전 모델은 Fable 5.1의 thinking blocks를 읽을 수 없습니다. 모델을 전환할 때는 이러한 블록을 다른 모델에 있는 그대로 전달하지 말고, SDK가 공식 규칙에 따라 처리하도록 해야 합니다.

이전 기록 수정 시 400 오류가 발생할 수 있음

2026년 8월 31일 이후에 생성된 새 API 계정에서는 thinking blocks가 생성된 원래 대화 컨텍스트에서만 유효합니다. system, tools 또는 이전 메시지를 수정한 후 thinking blocks를 다시 재생하면 400 오류가 반환될 수 있습니다. 공식 문서는 기록을 append-only로 유지할 것을 권장합니다. 압축이 필요하면 이전 기록 전체를 새 요약 하나로 교체하고, 이전 턴을 수정하면서 원래 thinking blocks를 유지하지 마세요. 자세한 패턴은 Fable 5.1 프롬프트 및 마이그레이션 가이드를 참조하세요.

Fable 5.1을 선택해야 하는 경우

적합한 경우:

  • 여러 저장소, 서비스 또는 앱에 걸친 장기 작업
  • 몇 시간 동안 실행되며 실패를 스스로 복구해야 하는 Agent
  • 과학 연구, 복잡한 데이터 분석 및 다단계 전문 산출물
  • 재현하기 어려운 시스템 문제, 성능 최적화 및 근본 원인 조사
  • 긴 컨텍스트를 대량으로 재사용하고 캐시 읽기 비중이 높은 API 워크로드

부적합한 경우:

  • 단순 채팅, 짧은 글 또는 단일 파일의 사소한 수정
  • 첫 토큰 지연에 민감한 실시간 상호작용
  • 예산이 고정되어 있지만 캐시 재사용이 없는 높은 출력 작업
  • 기본 30일 보안 모니터링 데이터 보존을 수용할 수 없고 기업 예외 조건에도 해당하지 않는 시나리오
  • 모든 사이버 보안 또는 생명과학 요청이 등급 강등을 유발하지 않기를 원하는 워크플로우

장기 작업을 원격으로 확인하는 방법

Fable 5.1의 가치는 수시간 또는 며칠이 걸리는 작업에서 드러나는 경우가 많지만, 그렇다고 개발 머신 앞에 계속 대기해야 한다는 뜻은 아닙니다. 먼저 로컬 Claude Code 2.1.250+에서 Fable 5.1을 사용할 수 있는지 확인한 다음, PandaNpc Agent를 통해 브라우저, 데스크톱 또는 휴대폰에서 동일한 개발 머신의 Claude Code 세션을 확인하고, 상호작용을 처리하며 추가 지시를 내릴 수 있습니다.

여기서 변경되는 것은 제어 진입점뿐이며, 코드, 도구 및 빌드는 여전히 사용자의 개발 머신에서 실행됩니다. 먼저 Claude Code 원격 액세스 가이드와 휴대폰에서 Claude Code 연결 튜토리얼을 읽고 원격 연결을 확인한 다음, Fable 5.1에 장기 작업을 맡기세요.

자주 묻는 질문 (FAQ)

Fable 5.1은 Fable 5보다 얼마나 강한가?

작업에 따라 차이가 매우 큽니다. Terminal-Bench-Science는 27.9퍼센트 포인트, AutomationBench는 14.3퍼센트 포인트 향상된 반면, HLE는 도구 사용 시 1.2퍼센트 포인트만 향상되었습니다. 단일 최대 증가폭으로 모든 작업을 대표할 수 없습니다.

Fable 5.1이 Opus 5보다 빠른가?

공식 상대 지연 시간 표에서 Fable 5.1은 "느림", Opus 5는 "보통"입니다. 일부 파트너는 전체 작업에서 Fable 5.1이 더 적은 token과 더 적은 재작업을 사용하기 때문에 더 빠르다고 관찰했습니다. 이 두 결론은 서로 다른 대상을 측정한 것입니다.

Fable 5.1이 GPT-5.6 Sol보다 프로그래밍에 더 적합한가?

Anthropic 발표 표에서 Fable 5.1은 Terminal-Bench-Science, Terminal-Bench, AutomationBench 및 CursorBench에서 더 높은 점수를 기록했습니다. 그러나 모델마다 서로 다른 Agent harness, effort, 도구 및 가격을 사용하므로, 모든 실제 저장소에서 Fable이 승리한다고 단정할 수는 없습니다. GPT-5.6 Sol 1M 컨텍스트 구성 튜토리얼을 참조한 다음, 자신의 대표 작업으로 A/B 테스트를 진행해 보세요.

Fable 5.1이 갑자기 Opus로 전환되는 이유는?

일부 사이버 보안 및 생명과학 요청은 safeguards에 의해 Opus로 라우팅됩니다. 모델 전환이 반드시 오류는 아닙니다. Anthropic은 이러한 라우팅된 요청이 Fable 가격으로 청구되지 않는다고 밝혔습니다.

Fable 5.1에는 워터마크가 있나?

통계적 content provenance 메커니즘이 있지만, 텍스트 표면에 눈에 보이는 레이블이 추가되지는 않습니다. 이는 이미지 모서리의 가시적 워터마크와는 다른 개념입니다.

요약

Claude Fable 5.1의 가장 두드러진 발전은 과학 연구, 터미널 작업 및 앱 간 비즈니스 워크플로우에 집중되어 있습니다. 지속적인 실행, 실패 복구, 결과 검증 능력이 향상되었고, 더 저렴한 캐시 읽기를 통해 장기 작업 비용도 절감했습니다. 그러나 여전히 가격이 높고 단일 응답 지연이 다소 느리며, thinking blocks, 강제 도구 호출 및 기록 편집과 관련된 호환성 변경 사항도 따릅니다.

Fable 5.1을 선택할 때 던져야 할 올바른 질문은 "벤치마크 1위인가?"가 아니라, 작업이 충분히 길고 복잡한지, 실패와 재작업 비용이 Fable 5.1을 사용할 만큼 높은지입니다. 그렇지 않다면 일반적으로 Opus 5 또는 Sonnet 5부터 시작하는 것이 더 적합합니다.