방금 Claude 5.1 출시! 세계 최강 모델 등장

chaincatcherchaincatcher

원문 팔로우 AI의 머신 하트


방금 앤트로픽이 차세대 모델 Claude Fable 5.1과 Claude Mythos 5.1을 출시했습니다.

앤트로픽은 Claude Fable 5.1이 복잡한 추론, 장시간 작업, 에이전트 워크플로를 위해 설계된 가장 강력한 공개 모델 중 하나라고 주장합니다. Claude Mythos 5.1은 더 높은 성능 한계에 대한 탐구를 나타냅니다.

두 모델은 동일한 기반 모델 성능을 공유하지만, 사용 시나리오에 따라 서로 다른 안전 조치가 적용되었다는 점이 중요합니다.

Fable 5.1은 일반 사용자, 개발자, 기업에 공개되며, Mythos 5.1은 검증된 고위험 분야 파트너를 대상으로 더 엄격한 접근 제어를 유지합니다.

즉, 하나는 실제 작업에 투입되고, 다른 하나는 더 엄격하게 통제된 환경에 보관됩니다. 이는 앤트로픽이 AI 제품의 미래 형태를 탐구하는 방식일 수 있습니다. 가장 강력한 모델이 모든 사람에게 동일한 형태로 제공되지 않을 수도 있다는 것입니다.

공식 성명에 따르면 이 두 모델은 Claude 시리즈의 성능에서 중요한 진전을 나타내며, 모델 성능을 향상시키면서 안전한 배포를 계속 발전시키는 방법을 보여줍니다.

"표면상 최강" 모델인 Fable 5.1은 여전히 인상적인 성능을 보여줍니다. 공식 데이터에 따르면 Fable 5.1은 여러 벤치마크 테스트에서 이전 플래그십인 Fable 5를 능가합니다.

하지만 성능이 향상되었음에도 가격은 인하되었습니다. 앤트로픽은 Fable 5.1이 동일한 기본 가격을 유지하면서 캐시 읽기 비용이 Fable 5 대비 75% 감소했다고 밝혔습니다. 실제 사용 시 일반적인 워크로드의 전체 비용이 약 25% 절감되며, 고도로 에이전트화된 워크로드의 경우 최대 45%까지 비용이 절감됩니다.

가장 강력한 모델조차도 가성비에 집중하고 있는 것으로 보입니다.

자세히 살펴보겠습니다.

 

하위 티어가 이전 세대를 따라잡다, Fable 5.1은 "가성비"에 집중

앤트로픽은 단순히 리더보드를 갱신하는 것보다 이번에 Fable 5.1이 더 낮은 추론 비용으로 이전에 Fable 5의 상위 티어가 필요했던 작업을 완료할 수 있다는 점을 강조하고자 합니다.

공식 테스트에 따르면 Fable 5.1은 낮은 추론 강도에서 중간 추론 강도까지 Fable 5에 근접하거나 능가하는 성능을 달성했습니다. Claude Code는 기본적으로 높은 추론 강도를 사용하고, Claude Cowork와 Claude .ai는 중간 강도를 기본으로 하여 사용자가 작업 복잡도에 따라 속도, 비용, 효과를 조정할 수 있습니다.

구체적으로 Fable 5.1은 과학 연구 에이전트 벤치마크 Terminal - Bench - Science 0.1에서 52.6%의 점수를 기록하여 Fable 5의 24.7%보다 두 배 이상 향상되었습니다. Terminal - Bench 4.0에서는 Fable 5.1이 55.8%를 달성했고, 더 강력한 Mythos 5.1은 60.9%를 기록했습니다.

지식 작업, 컴퓨터 작업, 비즈니스 프로세스 테스트에서도 새로운 모델은 개선을 보였습니다. AutomationBench 점수는 Fable 5의 17.1%에서 31.4%로 상승했고, CursorBench 3.2.0은 70.5%에서 73.4%로 향상되었습니다.

여러 벤치마크 테스트에서 Fable 5.1의 점수는 Fable 5를 초과했으며, 과학 연구 에이전트와 비즈니스 워크플로 능력에서 가장 큰 개선이 나타났습니다.

Terminal - Bench 4.0 테스트에서 Fable 5.1과 Mythos 5.1은 서로 다른 추론 강도에서 이전 세대 Mythos 5를 능가했습니다.

Terminal - Bench - Science 0.1 테스트에서 Fable 5.1은 최대 52.6%의 점수를 기록하여 Fable 5의 두 배 이상을 달성했습니다.

앤트로픽은 Fable 5.1의 중요한 변화가 문제의 근본 원인을 추적하려는 의지가 더 강해져 몇 시간 또는 수십 시간 동안 지속되는 복잡한 작업을 실행하는 데 더 적합하다고 믿습니다.

투자 회사 Millennium은 테스트에서 내부 코드가 약 백만 번 실행될 때마다 한 번씩 충돌한다는 것을 발견했습니다. 이 문제는 엔지니어링 팀을 4~5년 동안 괴롭혔으며 다른 모델들은 원인을 찾지 못했습니다. Fable 5.1은 외부 공급업체의 라이브러리를 디스어셈블하고 코어 덤프 파일을 비교하여 문제가 타사 프로그램 라이브러리의 버그에 있음을 정확히 찾아냈습니다.

Ramp는 Fable 5.1을 38시간 연속 실행했습니다. 원래 머신러닝 결과가 라벨링 오류의 영향을 받았다는 것을 발견한 후, 모델은 자율적으로 문제를 수정하고 동시에 6세트의 실험을 시작하여 최종적으로 새로운 결과와 후속 권장 사항을 정리했습니다.

 

코드 작성에서 과학 연구 수행까지

이번 출시에서 앤트로픽은 Fable 5.1과 Mythos 5.1의 과학 연구 성능에 대해 상당 부분을 할애했습니다.

단백질 설계 실험에서 연구자들은 Mythos 5.1이 오픈소스 단백질 설계 및 폴딩 도구를 호출하도록 한 후 생성된 설계를 두 외부 기관에 보내 실험적 검증을 받았습니다.

세 가지 표적 단백질에 대해 Mythos 5.1이 설계한 리간드의 결합 친화도는 Adaptyv Bio 관련 단백질 설계 대회의 최고 솔루션보다 10배 높았습니다. 열두 가지 표적 단백질에 대해서는 모델의 효과적인 리간드 적중률이 50%에 근접했으며, 앤트로픽이 제공한 업계 일반 수준은 10%에서 15%입니다.

Fable 5.1은 또한 NASA의 Magellan 우주선이 30년 이상 전에 수집한 레이더 이미지를 활용하여 금성 표면의 약 1/3에 대한 새로운 고해상도 고도 지도를 생성했습니다.

NASA의 Magellan 우주선이 촬영한 금성의 레이더 이미지, 중앙에 직경 약 15km의 소형 순상 화산이 있습니다.

원래 지도는 10~20km 규모의 세부 사항만 표현할 수 있었지만, 새로운 지도는 해상도를 2~3km로 향상시켰고 높이 측정 정확도는 최대 25% 개선되었습니다. 앤트로픽은 이 지도를 지식 공유 라이선스로 공개하여 NASA의 VERITAS 및 유럽 우주국의 EnVision과 같은 향후 임무에 활용할 계획입니다.

계산 생물학 분야에서 Mythos 5.1은 맞춤형 GPU 커널을 작성하고 중간 결과를 캐싱하여 7개의 오픈소스 단백질 및 게놈 딥러닝 모델의 실행 속도를 최대 2.5배 향상시키면서 출력 결과의 일관성을 유지했습니다. 일부 전체 게놈 분석 작업에서는 GPU 비용을 30%에서 60%까지 절감할 것으로 예상됩니다.

7개의 오픈소스 단백질 및 게놈 모델을 최적화한 후 Mythos 5.1의 추론 속도가 1.4배에서 2.5배 증가했습니다.

앤트로픽은 이러한 사례를 통해 모델이 정보 정리와 코드 작성에서 솔루션 제안, 도구 실행, 실험적으로 검증 가능한 연구 결과 제공으로 진화하고 있음을 보여주고자 합니다.

캐시 가격 75% 인하, 에이전트 작업 최대 45% 저렴해져

성능 외에도 가격은 Fable 5.1에서 가장 직접적인 변화입니다.

Fable 5.1의 입력 및 출력 가격은 조정되지 않아 각각 백만 토큰당 $10와 $50를 유지하지만, 캐시 읽기 가격은 75% 인하되어 백만 토큰당 $0.25로 낮아졌습니다.

캐시 읽기는 모델이 이미 처리된 컨텍스트를 재사용하는 것을 의미합니다. 일반 Q&A에서는 그 비중이 제한적일 수 있지만, 코드베이스, 과거 대화, 도구 결과를 반복적으로 읽어야 하는 에이전트 작업에서는 캐싱이 주요 비용을 차지하는 경우가 많습니다.

앤트로픽이 2026년 8월의 실제 사용 데이터를 기반으로 계산한 바에 따르면, Fable 5.1로 일반적인 작업을 실행하는 전체 비용은 Fable 5보다 약 25% 낮습니다. 더 긴 컨텍스트와 빈번한 도구 호출이 있는 복잡한 에이전트 작업의 경우 비용 절감은 최대 약 45%에 달할 수 있습니다.

캐시 읽기 가격 인하 후 Fable 5.1의 일반적인 작업 비용은 약 25% 절감되고, 고도로 에이전트화된 작업 비용은 최대 약 45% 절감됩니다.

Fable 5.1은 현재 Claude .ai, Claude Code, Claude API에서 사용할 수 있으며 AWS, Google Cloud, Microsoft Azure를 통해서도 제공됩니다. 개발자는 claude - fable -5-1을 통해 새 모델을 호출할 수 있습니다.

 

강화된 증류 방지 메커니즘

Fable 5.1과 Mythos 5.1은 실제로 동일한 기반 모델을 사용하며, 주요 차이점은 안전 제한 사항입니다.

Fable 5.1은 일반 사용자와 기업에 완전히 공개되며, Mythos 5.1은 사이버 보안 및 생명 과학 제한이 더 완화되어 현재 검증된 개인 및 기관만 사용할 수 있습니다.

사이버 보안 분야에서 Fable 5.1은 이미 사용자가 소프트웨어 취약점을 발견하는 데 도움을 줄 수 있지만 여전히 익스플로잇 프로그램을 직접 생성할 수는 없습니다. 침투 테스트, 익스플로잇 생성, 바이너리 파일 기반 취약점 스캔과 같은 이중 용도 작업은 더 엄격한 제한이 있는 모델로 의뢰될 수 있습니다.

조정 후 새로운 버전의 사이버 보안 보호 메커니즘은 Fable 5 대비 오탐률이 약 60% 감소했습니다. 기본 생물학 및 의료 문제에 대한 생물 안전 메커니즘의 오탐률도 85% 감소했으며, 생명 과학 연구와 관련된 고급 기능은 주로 Mythos 5.1 검토 프로그램을 통해 제공됩니다.

앤트로픽은 Enterprise Frontier Safeguards도 출시했습니다. 기업은 자체 통제 클라우드 인프라에 데이터를 저장할 수 있으며, 기업이 기본 수동 검토를 담당하여 보안 모니터링 기능을 유지하면서 거의 "데이터 무보존"에 가까운 개인 정보 보호 효과를 달성할 수 있습니다. 이 메커니즘은 올가을부터 단계적으로 도입될 예정입니다.

대규모 모델 증류에 대해 Fable 5.1은 새로운 제한 사항도 추가했습니다. 해당 날짜 이후 생성된 API 계정은 Claude의 과거 사고 기록을 유지하면서 다중 턴 대화에서 이전 컨텍스트를 수동으로 수정할 수 없습니다. 앤트로픽은 이 변경이 공개적으로 알려진 기능 추출 방법을 차단하기 위한 것이라고 밝혔습니다.

또한 EU의 인공지능법 요구 사항을 충족하기 위해 Fable 5.1의 텍스트 출력에는 보이지 않는 워터마크가 포함됩니다. 앤트로픽은 탐지 API의 소규모 테스트도 시작했으며, 처음에는 규제 기관, 미디어, 팩트체크 기관, 연구 기관에 공개됩니다.

마지막으로 네티즌들의 말이 맞습니다. 일찍 일어나는 새가 5.1을 먼저 사용합니다.

이 콘텐츠는 정보 및 교육 목적으로만 제공되며 BTCC와 관련된 투자 자문을 하지 않습니다. BTCC는 위 내용의 진실성, 정확성 및 독창성을 보장하기 위해 최선을 다하지만, 보장할 수는 없습니다.

추천

9월 FOMC 전망: 단 한 번의 금리 인상, 정말 필요한가?BTCC 아침 주요 뉴스 선별 (9월16일)BTCC 아침 주요 뉴스 선별 (9월15일)BTCC 아침 주요 뉴스 선별 (9월14일)BTCC 데일리 (9.16)|CLARITY 법안 다시 제동, ARB 18% 역주행 상승