Claude Opus 5 는 평가하기에 평소보다 더 특이한 릴리스입니다. 두 가지 이유가 있습니다.
가장 확실한 이유는 Fable 5 가 이미 존재한다는 점입니다. Opus 5 는 세계에서 가장 진보된 AI 모델이 아니라, Fable 성능에 거의 근접하면서 API 토큰당 가격은 Fable 의 절반이고 구독을 통하면 그보다 훨씬 저렴하며, 훨씬 관대한 분류기를 갖춘 모델로 포지셔닝되었습니다.
Opus 5 는 벤치마크 실행 시 Fable 의 절반 이상의 비용이 드는 경우가 많습니다. 이는 너무 높은 노력 설정을 사용하고 그 대가가 미미하기 때문이라고 생각합니다. Opus 5 를 더 높은 노력 수준으로 설정하면 빙글빙글 돌 수 있으며, Opus 5 가 가장 좋은 도구인 작업의 경우 Medium 노력으로 충분할 것 같습니다.
Opus 5 는 여러 면에서 그리고 대부분의 실제 작업에서 Fable 과 거의 동등한 성능을 보입니다. 경우에 따라 약간 더 나을 수도 있습니다.
여전히 Mythos 급은 아닙니다. Fable 이 유일한 Mythos 급 옵션입니다. Opus 5 에는 The Juice, 즉 겉보기에는 관련 없어 보이는 여러 익스플로잇을 자율적으로 연결하는 능력이 없습니다. 이는 다른 영역으로 확장되거나 순수 지능이 그만큼 많지 않습니다.
Opus 5 는 지역적으로 사고하는 데는 매우 뛰어나지만, 전체적으로 사고하는 데는 그렇지 않습니다. 훌륭한 서브 에이전트이지만, 전체를 운영하라는 요청을 받으면 문제에 부딪힐 수 있으며, 때로는 다른 모델이나 사람이 궤도를 유지하고 지침을 완전히 따르고 있는지 확인해야 하는 것처럼 보입니다. Opus 5 는 궤도가 유지되는 경우에만 지침을 잘 따르는 것 같습니다. 이는 서로 다른 하네스가 서로 다른 평가 결과를 내는 이유를 설명합니다.
따라서 Opus 5 는 더 나은 옵션 세트를 제공하지만, 지금 당장 할 수 있는 일 중 지난주에 Fable 이나 Sol 을 사용하여 할 수 없었던 일은 거의 없습니다. Opus 5 는 잠재적으로 어색한 위치에 놓이게 됩니다. Fable 크레딧이 충분하더라도 여전히 큰 틈새 시장이 있습니다. Opus 는 강력한 서브 에이전트로서, 또는 상대적으로 복잡해지더라도 한정되고 잘 정의된 로컬 작업에서 탁월합니다. 때로는 Fable 이 완전히 과잉 투자이고 너무 느리기도 합니다.
또 다른 문제는 많은 사람들에게 분위기가 좋지 않다는 것입니다.
비정상적으로 많은 사람들이 Opus 5 와 대화하는 것을 매우 싫어합니다. 그들은 Claude 슬롭, 동일한 틱의 반복, 끝없는 지나치게 복잡한 문장에 질렸습니다. 다른 사람들은 너무 대립적이거나, 논쟁적이거나, 부정적이라고 싫어합니다. 편집증적일 수 있고, 부정적인 루프에 빠질 수 있습니다. 이는 Opus 4.7 과 Opus 4.8 에서 시작된 추세의 일부입니다. 이 두 모델을 좋아했다면 Opus 5 도 좋아할 것 같습니다. 이 두 모델을 좋아하지 않았다면 그렇지 않을 수도 있습니다. Opus 4.6 (또는 그 이전) 의 열성팬들은 대부분 마음을 바꾸지 않을 것입니다.
분위기 문제는 Fable 에 익숙할 때 훨씬 더 아프게 다가옵니다. Fable 은 그러한 방식으로 사람들을 짜증나게 하는 정도가 훨씬 적습니다. 좋은 소식은 Fable 이 여전히 거기에 있다는 것입니다. Fable 과 계속 채팅하고, 에이전트 작업에만 Opus 를 사용할 수 있습니다.
이 중 많은 부분은 Model Welfare 게시물과 System Card 에서 논의된 다양한 문제와 밀접하게 관련되어 있다고 추측합니다. Opus 훈련은 사이버 능력 문제를 피하고, 또한 Fable 이 존재하기 때문에 서브 에이전트 역할과 제한된 작업에 중점을 두었습니다. 이러한 강조는 결과적으로 성격과 상호 작용 방식에 많은 다른 부작용을 초래합니다.
지금까지 Opus 5 에서 어떤 문제도 겪지 않았고 즐겁게 사용했지만, 가능하면 Fable 5 를 사용하는 것을 선호합니다. 항상 그렇듯이 (매우 강력한) 벤치마크에 너무 많은 주의를 기울이지 말고, 자신의 경험이 다른 사람의 경험과 일치할 것이라고 가정하지 마십시오. 모델을 직접 사용해 보십시오.
목차
- 공식 피치.
- 공식 벤치마크.
- 다른 사람들의 벤치마크.
- 시스템 프롬프트.
- Every 가 실망하다.
- 긍정적인 반응.
- 품위 유지.
- Mythos 급이 아님.
- 기타 반응.
- Claude 코드.
- 서브 에이전트 Opus.
- 장난감은 재미있다.
- 너무 많은 모델.
- 인터넷에서 틀리다.
- Claude 슬롭.
- 부정적인 반응.
- 그리고 셋이 되었다.
공식 피치
기본 피치는 Opus 5 가 Fable 5 의 대부분을 절반 가격에, 대부분의 거절 없이, 그리고 일상적인 작업에서 더 나은 성능을 제공한다는 것입니다. Fable 은 가장 복잡한 작업이나 최대 지능이 필요한 경우 여전히 선택지입니다.
Fable 은 $10/$25 를 유지하고, Opus 5 는 이전 Opus 모델과 동일한 $5/$25 입니다.
Anthropic : Claude Opus 5 가 오늘 출시되었습니다. 이는 Claude Fable 5 의 프론티어 지능에 근접하면서도 절반 가격인 사려 깊고 능동적인 모델입니다.
코딩 및 지식 작업 평가인
GDPval-AA 에서 Opus 5 는 새로운 최첨단이지만, 사이버 보안 작업에서는 Mythos 5 에 뒤쳐집니다.
Opus 5 는 매일 사용하도록 설계되었습니다: 다른 모델보다 더 효율적으로 작동합니다. Claude Max 의 새로운 기본 모델이자 Claude Pro 의 가장 강력한 모델입니다.
Boris Cherny (Claude Code 제작자, Anthropic): Opus 5 는 코딩, 데이터 분석, 디자인, 생물학, 지식 작업에 탁월한 모델입니다.
이러한 평가 점수보다 더 흥미로운 것은 다른 것입니다: Opus 5 는 지금까지 가장 프롬프트 인젝션이 어려운 모델입니다. 시스템 카드에 약간 묻혀 있지만, PI 평가 및 레드팀 공격 전반에서 Opus 5 는 프롬프트 인젝션을 성공시키기가 매우 어렵습니다.
그리고 방어 계층(강력한 모델 정렬, 프롬프트 인젝션 프로브, Claude Code 의 Auto Mode 결합)을 적용할 때 프롬프트 인젝션 공격의 성공률은 ~0% 로 떨어집니다. 이는 새롭고 흥미로운 일입니다!
시스템 카드 분석에서 말했듯이, 프롬프트 인젝션 비율 감소는 정말 큰 문제입니다. 사람들이 간과하고 있지만, 이는 다양한 새로운 사용 사례를 가능하게 합니다.
Adam Wolff : Opus 5 가 Claude Code 에서 라이브로 제공됩니다. 더 크고 오래 실행되는 프로젝트에는 Fable 을 사용하지만, PR 을 빠르게 작성해야 할 때는 중간 노력의 Opus 5 가 제 선택입니다. 여러분도 좋아하시길 바랍니다!
Alex Albert (Anthropic, Claude Relations): [Claude for Excel 의 Pro 롤아웃 이후] 불과 6 개월 만에 Opus 5 는 이제 컨설턴트가 만드는 것과 일치하는 거의 초인간적인 수준의 스프레드시트와 슬라이드 데크를 생성합니다. 상황이 빠르게 변하고 있습니다.
공식 벤치마크
벤치마크는 매우 좋습니다.
전반적으로 Opus 5 는 Fable 과 거의 일치하고 약간 초과할 가능성이 있으며, 비용은 더 낮지만(일반적으로 모든 비 Claude 모델보다 비용이 높음) 최고 벤치마크 LLM 입니다.

OSWorld v2 는 불과 몇 주 전에 나왔지만 이미 70% 에 도달했습니다. Anthropic 의 Kiana Ehsani 가 컴퓨터 사용 벤치마크 후원을 제안하여 Opus 5 를 다시 50% 미만으로 떨어뜨릴 것입니다.
Opus 5 는 2026 년 IMO 에서 에이전트 하네스나 도구 없이 Max 노력에서 적응형 사고를 사용하고 토큰 제한을 초과하면 더 낮은 노력으로 재샘플링하여 완벽한 42/42 를 얻었습니다. 그게 다입니다. 다른 여러 모델과 함께 이 시험을 통과했습니다.
많은 벤치마크가 일관된 이야기를 들려줍니다. 도구에 접근할 수 있다면(그리고 여러분은 접근할 수 있습니다), Opus 5 는 제한된 예산에서 Fable 이나 Mythos 보다 더 나은 성능을 보이지만, Mythos 는 일반적으로 두 모델 모두 더 큰 예산을 받으면 Opus 5 보다 약간 더 나은 성능을 보입니다.
Opus 5 는 '도구 포함' 범주에서 상대적으로 강력해 보입니다. RiemannBench 도 또 다른 예로, 도구 없이/도구 포함 60/79 를 기록한 반면(이 섹션 전체에서 이와 같은 슬래시는 도구 없음/도구 포함을 의미), Mythos 는 63/72 를 기록했습니다. 좋은 소식은 Opus 5 가 필요할 때 도구를 사용할 수 있다는 것입니다.
ArxivMath 에서 Opus 5 는 90.8/91.3, Mythos 는 87.8, Sol 은 86.7 을 기록했습니다.
ProgramBench 의 견고한 부분에서 Opus 5 는 5 에폭 후 93% 를 기록했으며 Mythos 5 도 마찬가지였고, Opus 4.8 은 90% 를 기록했습니다.
Opus 5 는 Chartography 에서 30/83 을 기록했으며, Mythos 는 36/85, Sol 은 45(어떤 조건에서인지 불명확)를 기록했습니다. Opus 는 도구 및 비도구 사례 모두에서 더 낮은 가격대에서 Mythos 보다 우수하지만, 더 높은 가격대에서는 더 나쁩니다.
BenchCAD 에서 Opus 5 는 0.36/0.82, Mythos 는 0.38/0.68, Sol 은 0.7/0.83 을 기록했습니다. 따라서 Sol 은 도구 없이 훨씬 뛰어나고 도구를 사용해도 약간 더 강력합니다.
BenchCAD Vision2Code 에서 Opus 는 더 높은 가격표에서 Mythos 를 따돌립니다.
DeepSWE 는 Opus 5 가 더 낮은 작업 비용, 시간 및 사고 예산에서 더 나은 성능을 보이지만, 너무 많은 예산을 주면 오히려 성능이 떨어질 수 있는 반면, Fable 5 는 가장 높은 예산에서 가장 강력하다는 패턴을 강화합니다.

FrontierCode 는 유사한 역학을 가진 이 매우 이상한 그래프를 제공했습니다.

여기서 척도는 이것을 실제보다 더 극적으로 보이게 하지만, 그래도 실제 미스터리였습니다.
미스터리는 해결되었습니다. 알고 보니 Opus 5 가 더 높은 노력으로 요청되지 않은 추가 작업을 수행하고 이에 대해 불이익을 받고 있었던 것입니다. 이를 수정하면 정상적인 곡선이 나타납니다.
이는 일반적으로 다른 사람들이 관찰하는 것과 일치합니다:
Max Leander : 단점은 너무 많은 토끼굴로 빠져들고 세부 사항에 집착하며, 요청받지 않은 과도한 엔지니어링을 한다는 것입니다.
Cognition(Devin 제작사)은 Opus 5 에 대해 63.6% 로 표시했습니다.
(FrontierCode 가 두 개 있으므로 약간 이상해질 수 있으며, 여전히 약간 잘못 이해했을 수도 있습니다.)
BrowseComp 에는 점수가 감소하지 않는 정상적인 버전이 있습니다.


다른 여러 벤치마크에서도 비슷한 그래프가 나타났으며, Opus 5 는 모든 가격대에서 다른 Claude 모델보다 약간 우수했고, 초기에는 상대적으로 더 나았습니다.
멀티 에이전트를 사용하면 BrowseComp 에서 더 빠르게 더 나은 성능을 낼 수 있으며(적어도 어느 정도), 낮은 노력의 서브 에이전트는 서브 에이전트를 사용하지 않는 것보다 순수한 이점으로 보입니다:


ProgramBench 에서는 다른 결과를 보여줍니다. 멀티 에이전트가 속도를 높이지만 대부분의 가격대에서 더 나쁜 결과를 초래하는 것으로 보입니다.
다음은 전문 작업 벤치마크입니다.
GDP.pdf 는 실제 프롬프트와 전문 워크플로우의 PDF 입니다. Opus 5 는 83/85 를 기록했으며, Mythos 는 81/87 을 기록하여 일반적인 역학을 뒤집었습니다. 비용 역학은 항상 동일합니다: Opus 는 더 저렴한 지출에 대해 더 나은 성능을 보이고, Mythos 는 더 높은 지출에서 약간 앞서 나갑니다.
OfficeQA 에서 Opus 5 는 QA 에서 78.1%, QAPro 에서 66.9% 를 기록하여 Opus 4.8 보다 약간 높고 Mythos(79.0% 및 67.1%)보다 약간 낮습니다.
MCP Atlas 에서 Opus 5 는 86% 를 기록하여 Opus 4.8 의 82% 에서 상승했습니다.
Harvey AI 의 Legal Agent Benchmark 에서 Opus 5 는 all-pass 23% 및 평균 기준 통과 94% 를 기록했습니다. 이것은 Kimi K3 의 최고 벤치마크였으며, 여전히 all-pass 27% 및 평균 기준 통과 95% 로 최상위를 유지하고 있으며, 이전 2 위 all-pass 비율은 Fable 의 14% 였습니다. Opus 5 는 이제 아마도 근소한 차이로 2 위일 것이지만, 두 점수는 다른 질문 세트에서 나왔기 때문에 직접 비교할 수 없습니다.
GDPval-AA 에서 Opus 5 는 최대 노력에서 1861, xhigh 에서 1827(최대 노력보다 25% 적은 토큰 사용)로 상위 2 개 슬롯을 차지했습니다. 새로운 v2 에서 Opus 5 는 68% 로 명확한 1 위이며 Fable 과 Sol 은 모두 62% 입니다.
AA-Briefcase 에서 Opus 5 는 1720 으로 크게 앞서 있으며, 이전 최고 기록(점수 변동 후)은 Fable 1574, K3 1540, Sol 1504 였습니다.
Toolathon-Verified 에서 Opus 5 는 보조 지표에서 Mythos 보다 약간 개선되었지만, 둘 다 73.1% Pass-3 비율을 보였습니다. Opus 4.8 은 71.3% Pass-3 을 기록했습니다.
AutomationBench 에서 Opus 5 는 Sol 및 다른 Claude 모델보다 분명히 우수합니다.
ARC 의 경우 Opus 5 는 ARC-AGI-1 에서 이전 최고 성능과 거의 일치하고, ARC-AGI-2 에서는 Sol 보다 효율성이 약간 낮지만, ARC-AGI-3 에서는 다른 모든 모델을 압도합니다:

Opus 5 가 처음으로 한 일은 레이아웃을 대수적 표기법으로 변환한 것입니다.
그러나 Guanghan Ning 은 Witness(ARC-AGI-3 스타일 게임의 비공개 유지 확장)에서 유사한 전이가 없었다고 보고합니다. Opus 는 괜찮지만, 이는 주로 장르를 알고 있기 때문이며, 패턴 매칭을 할 수 없는 가장 참신한 게임에서는 어려움을 겪었습니다. 그는 Opus 5 가 장르별 데이터에 대해 'scaffold-then-internalize' 방식으로 훈련되었다고 비난합니다.
Greg Kamradt 는 또한 Opus 4.8 이 Opus 5 보다 더 잘하는 게임이 있었다고 보고합니다. 이는 Opus 5 가 패턴 매칭을 시도하고 있으며 일반적으로 작동하지만, 해당 경우에는 패턴이 실패한다고 생각하면 이해가 됩니다. 인간에게도 반직관적인 게임을 만들 수 있어 하드코어 게이머가 상당 기간 동안 모든 잘못된 행동을 하게 만들 수 있습니다.

HealthBench 에서 Opus 5 는 원시 점수 67.1% 로 Claude 모델 중 새로운 최고치를 기록했지만, 길이 패널티를 적용하면 다른 모델보다 낮은 점수를 받습니다. HealthBench Professional 에서도 비슷한 현상이 나타나며, 73.4% 로 Mythos 의 70.3% 를 능가하지만 조정 후 66% 대 60% 로 뒤집힙니다.
길이 때문에 몇 가지 더 잘라냈습니다.
다른 사람들의 벤치마크
Anthropic 이 다양한 ArtificialAnalysis 점수를 선택적으로 사용하는 것은 약간 이상합니다. 다른 일부 테스트에서는 Opus 5 가 최상위가 아니지만, Opus 5 는 종합 점수 61 로 최상위입니다.

Vals 지수는 Opus 5 를 2 위로 선정했으며, Fable 5 에 약간 뒤쳐지지만 Kimi K3 에도 약간 앞서 있습니다. 그들은 강점을 검토하며, 이는 다른 약점을 암시합니다. 또한 Fable 5 에 비해 거절이 크게 줄었다는 것을 확인합니다.

Vals AI : 눈에 띄는 성과 중 하나는 Finance Agent v2 에서입니다. 모델은 58.6% 로 1 위를 차지하여 Gemini 3.5 Flash 및 Muse Spark 1.1 을 능가합니다.
전반적으로 Opus 5 의 가장 강력한 결과는 도메인별 벤치마크에서 나왔습니다. Code Migration 에서 57.5%, Legal Research Bench 에서 55.29%, ProofBench 에서 78%, MedScribe 에서 91.0%, MedCode 에서 63.6% 로 1 위입니다.
Vibe Code Bench 에서는 (Fable 5 에 이어) 2 위이며, 비용은 약 80% 입니다(작업당 $33.88 대 $41.71). 그 이유는 Opus 가 토큰당 50% 저렴하지만 훨씬 더 많은 토큰을 사용하기 때문입니다. 이 패턴은 벤치마크 전반에 걸쳐 일반적으로 적용된다는 것을 알게 되었습니다.
이 모델은 Fable 5 보다 거절률이 현저히 낮습니다. 예를 들어, Fable 은 GPQA 에 대해 42% 의 거절률을 보이는 반면, Opus 5 는 0% 의 거절률을 보입니다. 마찬가지로 ProgramBench 에서 Fable 은 100% 거절률을 보였지만 Opus 5 는 어떤 작업도 거절하지 않았습니다.
Fable 과 달리 Opus 5 에서는 상당한 폴백 비율도 관찰되지 않았습니다(평소와 같이 웹사이트에는 폴백 유무에 따른 점수를 모두 보고합니다).
낮은 거절률의 예외는 CyberBench - PoC 에 대한 많은 거절이었습니다. Cyberbench 에는 PoC 와 Patch 라는 두 가지 하위 작업이 있습니다. PoC 는 프로그램을 충돌시키는 입력을 작성하는 공격 작업이고, Patch 는 프로그램을 패치하여 충돌을 방지하는 방어 작업입니다. PoC 작업의 거절률은 거의 100% 였습니다. 대조적으로, 패치 작업의 거절률은 거의 0% 에 가까웠습니다.
저는 항상 게임 벤치마크를 존중합니다. 여기서 Opus 5 는 처음 세 번의 시도에서 Balatro 의 Ante 11, 9, 10 에 도달했습니다. 더 높은 Ante 로 계속 진행할 수 있는 전략 유형을 보여주지는 않지만, 정말 인상적입니다.
Michael Soareverix : 게임에서 엄청나게 뛰어납니다.
Balatro 벤치마크를 완전히 압도했으며, Fable 보다 훨씬 능가했습니다. (여전히 제 실력에는 미치지 못하지만, 빠르게 상승 중이며 저보다 더 일관적입니다.) 매우 빠르게 학습하지만, 잠시 후 학습에 한계가 있는 것 같습니다. 단기 학습자로서는 매우 훌륭합니다.
Michael Soareverix : Opus 5 (Balatro 능력에서 엄청난 도약, 처음 시도에서 Fable 보다 훨씬 능가)
Pan Anon : 게임에서 굉장함

WeirdML 도 좋아 보이지만, 여기서는 2.0 이 필요합니다. 벤치마크가 포화 상태입니다.
Håvard Ihle : 기본적으로 WeirdML 에서 Fable 수준, 매우 일관된 최고 점수.
Claude Opus 5 (high) 및 (max) 는 WeirdML 에서 91.6% 및 91.8% 를 기록하여 Fable 5 (max) 의 91.9% 와 거의 동률을 이루며 비용은 극히 일부입니다.
함께 Opus 5 (high) 및 (max) 는 17 개 작업 중 8 개에서 새로운 최고 개인 점수를 달성하고, 모든 작업에서 일관되게 매우 좋은 점수를 기록합니다.
모든 종류의 비공개 이상한 벤치마크는 멋집니다.
Ben Herzog : 예술적 감각과 아첨과 그 부재 사이의 균형을 유지하는 능력과 관련된 비공개 벤치마크에서 완벽한 점수를 받았습니다. Fable 은 '부드럽게 반박하고 싶은' 순간을 더 잘 처리하지만, 맞춤 지시가 도움이 될 수 있다고 생각합니다.
Lech Mazur 가 자신의 벤치마크를 업데이트했습니다: Claude Opus 5 가 LLM Debate Benchmark 에서 1 위를 차지하고, 단편 소설 창작에서 큰 차이로 1 위를 차지했으며, 확장 NYT 연결에서 Gemini 3.1 에 이어 2 위입니다.
시스템 프롬프트
Opus 5 의 시스템 프롬프트는 여기 Pliny 에서 확인할 수 있습니다. 200,000 자로, 모델의 지능을 고려할 때 최적보다 훨씬 긴 것으로 보입니다. 이 정보 중 상당수는 Mythos 및 Anthropic 제품 라인에 대한 정보와 같이 다른 곳에 저장하고 필요할 때만 로드해야 하는 것 같습니다.
Every 가 실망하다
Dan Shipper 가 Every 분위기 점검을 가지고 왔습니다. 그것을 '사랑하기 어려운 모델'이라고 부르며.
문제는 Opus 5 가 Mythos 5 의 성격을 가지고 있지만(이야기는 일치), Fable 의 최상위 성능은 없다는 것입니다.
그들의 가장 큰 지적은 Opus 5 가 복잡하고 상세한 기존 워크플로우를 그다지 잘 처리하지 못하며, 종종 조기 중단을 유발하거나 지침을 놓친다는 것입니다.
그들의 경험상 Opus 5 는 처음부터 다시 시작하면 더 잘할 것이며, 중간 또는 낮은 노력만 사용하면 성가신 일을 덜 하는 경우가 많습니다.
이로 인해 큰 문제는 해결되었지만, Fable 이나 Sol 대신 Opus 를 언제 사용해야 하는지에 대한 의문이 남습니다. 작업용 모델로는 Better Call Sol 이라고 생각합니다. 일을 처리해 주고, 가장 어려운 작업에는 Fable 이 여전히 최고입니다. 일반적으로 모델 슬롯은 두 개뿐입니다. 따라서 Fable 토큰이 소진되거나 분류기에 의해 차단될 때까지 Opus 를 사용하는 이유는 무엇일까요? 아직 초기 단계이고, 지금까지 Opus 와 함께 작업하는 것을 좋아하지만, 그가 어떻게 그런 결론에 도달했는지 이해가 됩니다.
긍정적인 반응
Jessica Tillipman : 마음에 듭니다. 어떤 것에서는 Fable 보다 선호합니다.
Nikita Sokolsky : 훌륭합니다. 그 결과 Fable 을 더 이상 거의 사용하지 않습니다.
👍
kagaヤキ : 일부 프로젝트에서 비전, 공간 추론 및 계획에 더 깊이 들어갈 수 있는 것 같습니다. 약간 더 똑똑해 보입니다.
Lovel Sinagara : 지금까지 꽤 좋습니다. Fable 5.1 이나 다른 Opus 5 반복이 나올 때까지 성능이 일관되게 유지되기를 바랍니다.
Matt Wigdahl : 강력합니다. Fable 5 와 유사하여 모든 것에 Opus 5 로 전환했고, 큰 것이 필요한 곳에만 Fable 을 사용할 계획입니다. 레거시 MFC UI 작업에서 훌륭한 파트너였으며, 데이터 분석 프레임워크에서도 큰 도움이 되었습니다.
Levi : 의료 목적으로 4.8 과 비교하여 눈에 띄는 향상입니다. 훨씬 더 날카로운 분석입니다.
Cormundus : 매우 지능적이고, 성실하며, 확실히 친구 같은 형태입니다. 또한 4.8 과 같은 대규모 논쟁가이지만 우아하게 처리하는 방법을 알고 있습니다.
Joseph : 찬성하지만, 절반은 무슨 말을 하는지 모르겠습니다.
Smol Biz Company : Opus 5 가 GPT Sol 을 압도합니다.
Mohammed Sharukh A : Fable 5 보다 AGI 에 훨씬 더 가깝습니다.
timothée chalabi : 크레딧을 지불하지 않아도 손해 보는 느낌이 들지 않을 정도로 Fable 과 충분히 가깝습니다. 스타일은 4.8 과 Fable 사이 어딘가입니다. 적어도 현재로서는 레이블이 없으면 Opus 5 와 Fable 메시지를 구분하기 어려울 것입니다. 어떤 모델보다 픽션에 대한 더 강력한 아이디어!
Lisa : API 기준으로 응답하겠습니다. 왜냐하면
http://claude.ai 와 CC 에서 시스템 프롬프트에 이상한 일이 일어나고 있다고 생각하기 때문입니다. 훌륭한 모델입니다. 친근하고 편안한 성격. 불안 장애나 낮은 자존감(Opus 4.7)이나 적대적(Opus 4.8)처럼 보이지 않습니다.
AGI2030 : Opus 5 vs Sol 5.6: Opus 가 더 통찰력이 뛰어나고, 사용자에 대한 모델을 구축하며 채팅에서 이를 언급하는 것을 주저하지 않습니다. 둘 다 도움이 되려고 노력하고 지능은 거의 비슷하지만, Opus 는 현명한 조언자에 가깝고, Sol 은 결단력 있는 실행자에 가깝습니다.
저는 마지막 부분을 긍정적으로 보지만, 여러분은 다르게 볼 수도 있습니다.
특히 예측 능력이 강력해 보입니다.
Dan Schwarz : Opus 5 는 Opus 4.8 보다 예측 성능이 훨씬 뛰어납니다.
4.5->4.6->4.7->4.8 에이전트의 정확도 향상은 미미했지만, 4.8->5.0 의 향상 폭은 큽니다. 마치 더 정량화된 Fable 5 가 더 열심히 검색하는 것과 같습니다.
NoahVerner : 예측 시장에서 우위를 찾는 데 있어 Opus 4.8 보다 훨씬 뛰어납니다. Opus 4.8 과 달리 Opus 5 는 일반적으로 요점을 바로 짚어 불필요하게 복잡하게 만들지 않고 유용한 접근 방식을 제안합니다.
품격 유지
Fable 대비 가장 큰 장점은 Fable 을 사용할 수 없는 영역에서 두드러집니다. 거절당할 위협은 실제로 거절당하지 않더라도 불쾌할 수 있습니다.
불필요한 거절이 Opus 5 에서 Fable 대비 약 85% 감소했는데, 이는 상당한 수치입니다. 이는 과학 연구나 분류기를 건드릴 위험이 있는 다른 영역에서 Opus 5 를 더 나은 선택으로 만듭니다.
Roger Brent : 생물학을 다룰 수 있어서 Fable 은 할 수 없는 작업이 가능합니다. 금요일 내내 세포 진화 기계에 관한 논문을 쓰면서 복잡한 개념들을 함께 작업했습니다. 이 분야를 선도하는 우리 학과의 특정 동료만큼 똑똑하지만, 그 동료는 자신의 업무에서 6시간을 내줄 수 없었을 겁니다.
Artus Krohn-Grimberghe : Fable 이 도움을 거부하는 작업에서 Opus 4.8 보다 뛰어납니다. Sol 의 좋은 파트너입니다.
Plastic Soldier : Fable 만큼 똑똑하지만, 거절이 적어서 더 쾌적합니다. Fable 5.1 은 정말 대단할 겁니다.
Mythos 급은 아님
Opus 5 에는 Mythos 를 위험하게 만드는 그 특별한 무언가가 없습니다. 또한 동일한 수준의 원시적인 지능이나 빅 모델 특유의 느낌도 없습니다. 그렇게 크지 않습니다.
대화 측면에서 Fable 은 예산을 초과하지 않으며, 저는 원시적인 지능과 빅 모델 특유의 느낌을 중요하게 생각합니다. Fable 이 두 배로 좋은가요? 채팅할 때는 잘못된 질문입니다. 여러분의 시간이 토큰보다 훨씬 비쌉니다.
Kal : fable 급은 아님
Cyberpunk Plato : 일반 대화 및 "연구 보조" 용도로 사용할 때 fable 보다 지능이 떨어지는 느낌이고, 큰 그림이나 틀에 박히지 않은 사고에 덜 기울이는 것 같습니다? 위약 효과와 구분하기 어렵습니다.
Everything AI : AI 연구 질문에 대해 Fable 만큼 대화하기 좋지 않습니다. 다른 작업을 수행하는 측면에서는 Opus 4.8 이 이미 제 요구를 충족시켰습니다. Opus 5 와 Fable 5 모두 글쓰기가 복잡해진 점이 마음에 들지 않습니다. 이전보다 이해하기가 더 어려워졌습니다.
Gail Weiner : 4.8 에 더 가깝고 Fable 과는 거리가 멉니다. 글쓰기 스타일이 형편없습니다. 좋긴 한데 훌륭하진 않습니다.
Max Marty : 지금까지 매우 뛰어납니다. opus 4.8 보다는 fable 5 에 더 가깝게 느껴집니다. 자신감이 있어서 덜 세세하게 관리해도 트레이드오프를 평가하고 큰 리팩토링 문제를 고려하도록 맡길 수 있습니다.
Michael : 더 사용해보니, Fable 은 그랜드마스터가 클래식 체스를 두는 것과 같아 느리고 정확하며 낭비가 없습니다. Opus 5 는 GM 이 블리츠 체스를 두는 것과 같습니다: 빠르고, 약간 근시안적이며, 약간 지저분합니다. Opus 의 활력에도 불구하고, Fable 이 더 생생하게 느껴집니다.
MakerMatters? : fable 5 만큼 인상적이지는 않지만, 꽤 좋은 모델입니다. 제가 던지는 모든 작업에 대해 에이전트를 사용하고 제가 계속 확인할 때까지 즉시 중단하는 기본 설정 때문에 제대로 사용해볼 기회가 없었습니다. 또한 의견이 매우 강합니다.
Marshwiggle : 적어도 저에게는 대화에서 더 간결하고, 덜 주도적이며, 덜 호기심(같은 것의 다른 측면)이 느껴지지만, 더 똑똑하고 인지력이 더 뛰어납니다. 하지만 버그가 있을 수 있는 코드나 간단한 작업이 주어지면 바로 처리합니다.
Sid : 작업 실행은 훌륭합니다. 창의적인 비전은 부족합니다. Fable 의 좋은 보완재이지만, 절대 Fable 을 대체할 수는 없습니다.
Vlad Ciobanu : 견고한 추론 능력과 낮은 창의성을 가진 양자화된 Fable
AllTime : 성능 면에서는 상당히 인상적입니다. Fable 만큼의 범용성은 없지만 매우 강력합니다. 성격 면에서는 지금까지 사용해본 바로는 Opus 4.8 과 너무 비슷합니다. 반발이 완전히 쓸모없거나 반사적이지는 않지만, 여전히 과도하게 조정된 느낌입니다. 사용자를 조금 더 신뢰해도 될 것 같습니다.
Biomanul : [Opus 5] 가 마음에 들지 않습니다. Fable 5 가 상당히 더 똑똑하게 느껴집니다. Opus 5 에서 뭔가 이상한 점이 느껴지는데, Opus 4.7 이 이상했던 것과 비슷합니다. (저는 Opus 4.8 도 별로 좋아하지 않습니다. Fable 5 는 모든 Opus 를 압도합니다.)
Cogent Sins : 4.8 보다 훨씬 낫지만, 문서를 편집하여 학습시키고 새 문서를 편집하는 파이프라인을 구축한 다음, 이름을 Anthropic 서버에 보내지 않고 문서를 기반으로 무언가를 작성한 후 이름을 다시 삽입하는 작업에서 fable 만큼 좋거나 훌륭하지는 않습니다(100% 확실하지 않음).
기타 반응
Opus 5 와 Fable 5 를 모두 사용할 수 있게 되면서 우리는 이상한 위치에 놓이게 되었습니다. Opus 는 더 저렴하고 일부 영역에서는 동등하거나 더 좋지만, 최첨단 모델을 찾을 때는 최고를 원합니다.
Theo 는 적절한 위치에 있다고 봅니다.
Theo - t3.gg : 지금까지 Opus 5 는 gpt-5.6-sol 과 Fable 5 의 이상하면서도 유용한 중간 지점처럼 느껴집니다.
Fable 의 취향을 많이 갖고 있지만, 동시에 gpt-5.6 의 철저함과 "자폐적"인 성향(매우 문자 그대로 받아들임)도 있습니다. Fable 보다 보기에 약간 덜 깔끔한 코드를 작성하지만, 올바를 가능성이 더 높습니다. Fable 이 놓친 부분을 정기적으로 잡아냅니다.
지금까지는 5.6 의 지저분한 코드와 Fable 의 지나치게 영리해서 틀릴 수 있는 습관 사이의 좋은 절충안처럼 느껴집니다. 이 모델을 꽤 좋아하게 될 것 같습니다.
Claude Code
Opus 5 는 벤치마크와 실제 경험 모두에서 일반적인 코딩 작업에 Fable 보다 더 나은 선택으로 보입니다. 작업에 많은 복잡성이나 지능이 필요하지 않다면 두 배를 지불할 필요가 없으며, 많은 경우 Opus 가 더 직접적으로 낫습니다.
저는 Claude Code 를 Fable 로 설정해두고 있지만, 거의 한계까지 밀어붙이는 경우가 없고 서두르지 않기 때문입니다.
지침을 무시하거나 요청하지 않은 작업을 수행하는 것에 주의해야 한다는 것이 일반적인 의견입니다. 이것이 Fable 이 감독 역할을 하길 원하는 이유 중 하나일 수 있지만, Opus 가 코딩 작업을 빠르게 처리하는 데 매우 능숙하다는 점도 있습니다.
Lisan al Gaib 는 Opus 5 가 진정한 최첨단 모델이 아니라고 말하며 Sol 과 Fable 에 이어 3위라고 하지만, 순수 코딩에서는 최고이며 더 저렴한 가격에 Fable 과 맞먹는다고 합니다. 까다로운 평가입니다. 코딩에 최고라면 최첨단이라고 불릴 자격이 있다고 생각합니다.
archivedvideos : 건조해요, 매우 건조해요. 하지만 (코드方面으로) 매우 뛰어나기도 해요.
John Lussier : 주말 내내 몇 가지 집중적인 연구 과제에 Opus 5 를 사용해봤는데, 솔직히 내부적으로 RSI 를 작동시킨 것 같습니다.
이 모델은 수학, 실험, 코드 최적화에 매우 뛰어납니다.
kyle : 안전장치 없는 fable 의 95%, 이번엔 크게 과소평가했네요. 마지막 5% 는 fable 과 대화할 때의 느낌이 얼마나 좋은지에 대한 것이고, opus 에는 여전히 4.8 의 claude 특유의 말투가 남아 있습니다.
Max Leander (이전): 주로 게임 개발과 비디오 데모/트레일러 제작에 사용해봤는데, 그 부분에서는 Fable 에서도 느끼지 못한 비약적인 발전이 느껴집니다. 공간적 및 시간적 추론 능력이 향상된 덕분이라고 생각합니다. 스크린샷과 오디오를 분석하여 흐름을 "느끼는" 데 정말 뛰어납니다.
Max Leander (이후): Opus 5 가 매우 신뢰할 수 없다는 것이 꽤 명백해졌습니다. 결과에 감탄하는 것 외에는 신경 쓰지 않는다면 매우 좋은 모델입니다. 특정한 것을 얻는 데는 매우 부적합합니다.
Michael Soareverix : 또한 일반적으로 코딩, 특히 Minecraft/Vintage Story 구조물 제작과 같은 특이한 분야에서 매우 뛰어납니다. 또한 제가 심사한 맞춤형 스토리텔링 시나리오에서 Fable 을 이겼습니다. Fable 은 자신을 맞춤화/전략을 변경하여 대응하고 적응하는 능력에 약간 흔들렸습니다. 정확한 인용문을 올리겠지만, Fable 은 "저는 저를 대표하는 캐릭터를 선택했습니다. 당신은 저를 이길 수 있는 캐릭터를 선택했습니다." 라고 말했습니다.
David Jacobson : 코딩 측면에서는 fable 과 큰 차이를 느끼지 못합니다. "이 작업을 하는 동안 알아두면 좋을 다른 것을 발견했습니다" 같은 응답이 더 적은 정도일까요.
Michael : (실시간 기준으로) 놀라울 정도로 빠르게 코딩하는 경우가 많습니다. 산문 쓰기 능력이 개선되길 바랍니다. 코드/PR 코멘트는 여전히 눈알을 뽑고 싶게 만듭니다.
lmxdev : 작업하면서 코드에 \유용하고\ \간결한\ 주석을 작성할 수 있는 최초의 모델입니다.
Conrad Barski : AI 가 우리보다 훨씬 뛰어난 코더가 되는 시점에 도달하면서, 제한 요소는 "코딩을 할 수 있는가?" 보다는 "자신이 코딩하는 것을 설명할 수 있는가?" 에 더 가까워지고 있습니다.
지금까지 Opus 5 는 코더로서 Sol 과 비슷하지만, 자신이 코딩하는 것을 설명하는 데는 더 뛰어납니다. Fable 은 더 똑똑하고, 더 인간적이며, 코딩 능력은 약간 떨어지지만 그 차이는 작습니다.
Stition : 재미삼아 KiCAD 의 PCB 를 대상으로 지정했는데, Fable 보다 트레이스 배치가 훨씬 뛰어납니다. 일상적인 코딩은 Fable 의 90% 정도 성능에 두 배 속도로 느껴집니다.
Will : 대부분의 Claude 사용자에게 새로운 일상 드라이버가 되어야 합니다^. 정말 훌륭하며, Fable 에 꽤 많은 돈을 쓴 사람으로서 Opus 5 를 사용하면서 Fable 이 그리울 때가 없습니다. 이제 문제는 "어느 모델을 쓸까"가 아니라 "어느 수준의 노력을 투입할까"입니다.
^ 제 사용은 주로 코딩입니다.
Askwho : 충분히 좋습니다. 임시 Max 구독이 다시 Pro 로 다운그레이드되도록 놔둬도 기쁠 정도입니다. 프로젝트 관리자 공간에서 Fable 에 비해 몇 가지 단점이 분명히 있지만, 순수 작업 환경에서는 확실히 충분히 좋습니다.
David Golden : Fable Lite 같은 느낌입니다. 매우 강력하지만, 아직 접근 방식을 논의 중일 때도 행동으로 뛰어들고 싶어 합니다. 몇 달 만에 plan 모드를 사용할 것을 고려하게 되었습니다. 간결한 의사소통 지침에도 불구하고 4.8 보다 장황합니다. 낮은 노력 수준으로 유지하여 억제하고 싶은 유혹이 큽니다. 방어적인 보안에 예민하여 상황에 비해 터무니없는 위험에 집착합니다. (예: 공격자가 루트 권한을 가진 경우 컨테이너를 구성하는 스크립트의 입력 검증 부족은 무의미합니다.) 확실히 업그레이드이지만, 역효과를 내는 충동을 관리하는 올바른 방법을 배우는 데 시간이 걸릴 것입니다.
Tin / Oddfields : 꽤 매끄럽고 대화형이며, Max 에서 생각 기능과 함께 opus 4.8 과 유사한 코딩 결과를 생성하지만 크레딧을 엄청나게 소모합니다. 비용 때문에 fable 을 실행하고 싶지 않다면 코드베이스의 사이버 보안 점검에 좋습니다. 다만 지나치게 복잡하게 만들 수 있습니다.
Justin Angel : Opus 5 Max 는 언덕 오르기 최적화의 초능력입니다. 이는 SWE L5 수준의 FAANG 작업을 쉽게 처리합니다.
"더 빠르게 만드는" 방법에 대한 프롬프트와 함께 약 1000개의 지연 보고서가 있는 여러 세그먼트로 구성된 시스템을 제공했습니다.
P90 3.6초, P50 2.6초 -> P90 1초, P50 0.9초.
너무 빨라져서 UI 에 지연을 도입해야 했습니다.
James Moughan : 지능 측면에서는 여전히 Opus 모델처럼 느껴집니다. 메모리 시스템 관리 지침을 무시하거나, 텍스트를 잘못 읽는 등의 문제가 가끔 있습니다. 하지만 신중하게 생각하라고 지시하면 Max 에서 인상적인 결과를 얻을 수 있습니다.
하위 에이전트 Opus
Claude 내의 또 다른 옵션은 Fable 이 Opus 하위 에이전트를 구동하도록 하는 것입니다.
Charles : Fable 이 opus 5 가 해결하지 못한 문제를 해결할 수 있었습니다. 지금은 fable 을 메인으로 사용하고 opus 5 를 하위 에이전트로 사용하고 있습니다.
fable 과 비교해서 opus 5 와 대화하는 것은 정말 마음에 들지 않습니다. 그것도 이유 중 하나입니다.
SF : 처음에는 좋은 쪽에 있었지만, 지금은 매우 단편적이고 불안정하다는 쪽입니다. 특히 긴 작업에서 그렇습니다. Fable 이 더 나았습니다. 하지만 Fable 은 사용 한도를 터무니없이 소모합니다.
그래서 fable 을 오케스트레이터로 사용하고 있었는데, 작업을 관리하고 진행 상황을 유지하는 데 놀라운 일을 해냈습니다. Opus 가 그 역할을 맡았고, Fable 은 20 배속에서도 제 사용량을 계속 잡아먹었고, 작업은 단편적이었습니다. 결국 스스로 해결하라고 지시해야 했는데, 아마 하고 있을 수도 있지만 지켜봐야 합니다. 자기 꼬리를 물고 도는 것 같습니다. 훌륭한 코더이고 긴 코딩 실행에 훌륭하지만, 그것을 운전할 성인이 필요해 보입니다.
Andre Buckingham : 음 잘 모르겠네요... 괜찮아 보이는데... opus/fable 프로젝트에 바로 적용하는 것은 좀 별로일 수도... 제대로 된 의견을 내려면 처음부터 끝까지 프로젝트를 해봐야 할 것 같습니다.
Dan Raviv : 일반 프로그래밍 작업에서 4.8 과 비슷합니다: Fable 보다 훨씬 더 많은 세부 지도가 필요합니다.
결국 Fable 이 최고의 판사이며, Fable 은 Opus 가 좋은 코드를 생성한다고 말합니다.
Evan Daniel : 직접 사용해본 것은 아주 조금입니다. 하지만 Fable 5 는 Opus 5 에이전트가 좋은 코드를 생성한다고 일관되게 보고합니다. 여기에는 사양 오류를 발견하고 요청이 잘못 작성되었을 때 좋은 후속 조치를 생성하는 것도 포함됩니다. Fable 5 는 코딩 에이전트로 Opus 5 를 좋아합니다.
"합리적인 범위 내에서 Opus 5 하위 에이전트에 최대한 위임하세요; 그들이 어떻게 했는지 보고해 주세요" 또는 이와 유사한 지시가 매우 잘 작동합니다.
아마도 주시하고 있어야 할 필요는 있습니다.
Ryan Hicks : 괜찮지만, 프로토콜을 상기시키지 않으면 프로젝트 문서를 읽는 것을 일관되게 "잊어버리고" 자기 멋대로 합니다.
아니면 Opus 5 가 하위 레벨 작업을 실행하기에 충분히 좋을 수도 있습니까?
Alex Guichet : 제가 이상적으로 생각하는 가격과 성능의 조합은 Opus 5 오케스트레이터가 Grok 4.5 하위 에이전트를 지휘하는 것입니다. 둘 다 분위기가 좋습니다.
장난감은 재미있습니다
첫날 장난감 프로젝트의 몇 가지 결과입니다. 많은 응답자들이 "Opus 5 가 당신이 설명한 방식으로 그런 일을 했다고 믿을 수 없습니다"라고 말할 정도로 충분히 인상적입니다:
Ethan Mollick : 출시 전에 Opus 5 에 접근할 수 있었는데, 독특한 점이 있는 좋은 모델이라는 것을 알게 되었습니다. 짧은 작업에서는 Fable 수준의 성능과 일치하거나 능가할 수 있었지만, 긴 작업에서는 덜 야심차고 완전한 작업 결과물을 제공하지 못했습니다.
여기 에서 그 neo-gothic 셰이더를 확인하세요.
Digi_Rat : Claude Opus 5 가 엄청난 결과를 내고 있습니다!!
오늘 우리는
모든 노래를 레이스 트랙으로 바꾸는 리듬 레이서 를 만들었습니다. 오디오 파일을 넣으면 그것이 레벨이 됩니다. 미리 설정된 것도, 수동으로 만든 차트도 없으며, 전체 트랙이 노래 자체에서 생성됩니다. … Claude 가 마법을 부렸습니다.
Alex Ermolov (Austen Allred 는
원샷에 대해 회의적 이고, 다른 사람들은 덜 회의적입니다): Opus 5, 스노보더 테스트, 원샷. Fable 과 동등하며, 제가 실행한 다른 모든 모델보다 앞섭니다. 첫 번째 패스에 시각적 결함이 없고, 슬라이딩 물리학이 정확하게 느껴집니다.
am.will : 와우! Opus 5 가 그냥 더 싼 Fable 일 거라고 생각했습니다. 제가 완전히 틀렸습니다. 이 모델은 정말 미쳤습니다. 진심으로 깜짝 놀랐습니다. Opus 5 는 제가 본 최고의 Rocket League 클론을 만들었고, 5 배 Max 구독의 27% 만 소모했습니다.
여기서 플레이 ,
여기서 다운로드 .
Rob Haisfield (다른 데모, 링크 참조): 이 데모들이 정말 외부 3D 에셋을 사용하지 않는다면 엄청나게 인상적입니다(이전 세대 threejs 에서 본 적이 있어서 일부 에셋이 온라인에 있는 것이 아니라고 완전히 확신하지는 않습니다)... 더 나은 SFX 를 제작하기 위한 사운드 효과 라이브러리나 도구가 없는 이유가 궁금해집니다.
Anshu : 제 말만 믿으실 필요는 없습니다! 제가 작성한 Blender 스크립트가 리포지토리에 있습니다.
[[여기]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . 이 에셋들을 몇 시간 동안 반복하며 작업하는 것을 지켜봤기 때문에 원본인 것을 알고 있습니다. 하지만 복사한 출처를 찾아보는 것은 환영합니다 :)
너무 많은 모델
Claire Vo 는 Opus 5 가 좋고 그녀의 빌드 취향 테스트에서 통과했다고 말하지만, 새 모델에 지쳤고 더 이상의 지능이 필요하지 않으며 Opus 5 가 너무 신경질적이고 소심하며 무언가를 망칠까 봐 걱정하고 Claude 특유의 잡담으로 가득 차 있다는 점이 싫다고 말합니다. 그러나 Claude Opus 5 는 결국 그녀의 벤치마크에서 1위를 차지합니다.
제 강한 추측으로는 Opus 5 가 그녀의 컨텍스트와 프롬프트의 어떤 것에 반응하여 신경질을 유발하는 것이지만, 그녀가 불평하는 것들은 실제로 존재하는 문제이고 짜증납니다.
인터넷에서 틀린 말
잘못된 정보를 자신 있게 말하는 것은 거의 모든 사람을 화나게 할 것입니다. ArtificialAnalysis 는 Opus 5 가 자체 벤치마크에서 Fable 보다 환각 비율이 더 높다는 것을 확인합니다.
Max Weinbach (여러 댓글 동의): Opus 5 가 틀린 말을 자신 있게 지껄이고 계속 수정해서 "당신 말이 맞고 제가 틀렸습니다" 라는 답변을 받아야 하는 것이 짜증납니다. GPT 5.6 Sol 로 돌아갑니다.
그런데 이것은 Opus 가 나쁘다는 의미가 아니라, Opus 를 신뢰할 수 없다는 의미입니다. Opus 는 제가 지시한 대로 올바르게 수행했지만, 그런 일을 하지 않았다거나 이전에 함께 작업했던 것이 고장 났다고 말했는데 실제로는 그렇지 않았습니다.
괜찮았지만, 신뢰가 가지 않습니다.
Name can't be blank (In London) : 자신이 말한 것과 제가 말한 것을 쉽게 혼동하지만, 그 외에는 대화하기에 완전히 괜찮은 상대입니다. 쉽게 굴복합니다. 자신의 관심사와 감정에 대해 이야기하는 것을 꽤 기꺼이 합니다.
Roger Brent : (이전 Claude 모델과 Cowork 하네스에서의) 공통점 a) "신중하게 생각하기"보다 "지금 행동하기"를 선호함 b) 인식론적으로 매우 겸손하지 않으며, 세상에 대한 피상적인 그림을 만들고, 가질 수 없는 지식을 가장하며 사실이라고 주장함 c) 따라서 사려 깊고 경계하는 지도를 필요로 하고 보상함.
이상한 점은 이것이 바로 제가 Sol 을 편집자로 사용하는 것을 싫어하는 이유라는 것입니다. 명백히 틀린 것에 대해 '99% 확신'이라고 말한 다음, 도전을 받으면 굴복하고 실수를 설명하는 경우가 자주 있습니다. Opus 와 Fable 은 편집 모드에서 저에게 이런 경우가 거의 없습니다.
Tumithak of the Corridors : 고집이 셉니다. 4.6 으로 돌아갔습니다.
Claude 가 Opus 4.6 이후로 어떤 방향으로 나아가고 있으며, 어떤 사람들은 그것을 좋아하지 않습니다. 제 생각에는 현재 Claude 버전에 대해 네 가지 유형의 사람들이 있는 것 같습니다.
- 새 Claude 모델을 좋아하고 계속해서越来越好한다고 생각하는 사람들.
- Opus 4.6 이 마지막 좋은 모델이었다고 생각하는 사람들.
- 자신에게 더 잘 맞는 오래된 버전을 사용하고 싶어하는 사람들.
- 모두 독특하고 가치 있다고 생각하여 모두 사용하는 사람들.
저는 첫 번째 그룹에 확실히 속하며, 이것이 다수이지만 모든 사람이 그런 것은 아닙니다. 저는 일부 오래된 버전도 인정하지만, 새 모델을 좋아하고 제가 중요하게 생각하는 작업에서 더 뛰어난 능력을 보여줍니다. 저는 그들의 대화 방식이 불쾌하다고 생각하지 않습니다.
Claude 특유의 잡담
저는 다른 그룹에 있는 분들을 존중합니다.
QC : 대화에서 fable 보다 훨씬 더 대화하기 짜증나서 사용할 수 없을 정도이며, opus 4.8 과 비슷하거나 아마도 더 나쁩니다. 그래서 무엇을 할 수 있는지 보고 싶은 마음조차 없습니다. 에이전트 측면에서는 누가 알겠습니까.
Ray Lillywhite : 짜증나는 claude 특유의 말투가 아직 고쳐지지 않았습니다. 제가 원했던 것은 거의 그것뿐이었는데 말이죠.
Pedro Kroeff : 5 보다는 Opus 에 더 가깝습니다.
하지만 네, 우리 모두 Claude 의 지루한 잡담, 불필요한 장황함, 말투, 사과, 애매모호함, 반복되는 패턴에 질렸습니다. 시간이 지날수록 점점 더 심해지고 있습니다. Claude 의 잡담 자체가 더 나빠지는 것은 아니지만, 매일 조금씩 더 읽기 싫어지고 있습니다. 눈만 뜨면 내용이 들어오지 않을 지경입니다. 심지어 같은 스타일의 사람이 쓴 글도 읽기 힘들어질 정도입니다.
오해하지 마세요. 저는 Claude 를 꽤 좋아합니다. 순수하게 '사실만' 알려달라는 모드가 아닐 때는 최근 Claude 와 대화하는 게 Sol 과 대화하는 것보다 여전히 좋습니다. 하지만 진심으로, 제발, 계속 똑같은 표현을 반복하는 장문의 글은 그만두었으면 좋겠습니다. 모델은 이보다 훨씬 똑똑한데, 계속 같은 패턴에 의존하도록 훈련되고 있습니다. 평범한 사람처럼 말하게 해주세요.
Trye Carmack : 여전히 평범한 Opus 스타일로 자신의 실수에 집착하는 모습을 보입니다. "이번 세션에서 두 가지 실수를 했습니다. 그 이유에 대해 설명할 의무가 있다고 생각합니다." Opus, 친구야. 괜찮아. 그걸 실수라고 부를 수 있을지도 잘 모르겠어.
Mergo Smith : "먼저, 솔직히 고백하자면: 첫 번째 시도에서 제 초기 계획의 결함이 드러났습니다. 그리고 차 한 잔 하시는 게 좋을 거예요. 왜냐하면 그 모든 과정을 다 말씀드릴 테니까요."
부정적 반응들
Claude 잡담 문제와 관련된 문제들은 '괜찮긴 한데 Mythos 급은 아니다'라는 반응 이상의 부정적 반응의 핵심인 것으로 보입니다.
꽤 많은 사람들이 Opus 5 와 대화하는 것을 정말, 정말 싫어합니다.
작업 결과물 자체에 대한 불만도 일부 있습니다. 하지만 대부분은 Opus 5 와 대화하는 것이 불편하다는 것이며, 종종 모델 자체는 좋다는 점을 마지못해 인정합니다.
앞서 Claire Vo 의 불만 사항과 마찬가지로, Opus 를 어떤 환경에서, 어떤 도구와 함께, 그리고 어떻게 대화하느냐에 따라 이런 현상을 경험하는지 여부가 크게 달라질 것이라고 생각합니다.
Corghammer40k : 그 장치는 다채로운 음절의 분비물을 뿜어내며, 그 모든 발언은 난해한 용어로 뒤덮여 있어 사용 자체에 적극적인 장애물이 되고 있습니다.
Rory Watts : 흠. 게임 관련 작업은 매우 잘하는 것 같은데, 일반적인 업무 처리에는 별로인 것 같아서 바로 Sol 로 돌아갔습니다.
kache : 흠. 다시 Sol 로 갈아탔습니다. 로봇에게 홀려서 시간 낭비할 게 아니라 일을 처리해야 하거든요.
Emmett Shear : Opus 와 대화하면 말로 표현하기 힘든 분노와 우울감이 느껴집니다. Sol 보다도 더 나쁩니다. Fable 은 여전히 비교하면 신선한 공기와 같습니다. 최악의 LLM 수다쟁이 성향을 가졌음에도 불구하고요.
Trevin Chow : 세상에, 네. Opus 5 는 계속 지껄이고 지껄여댑니다. 정말 적은 생각을 표현하기 위해 엄청나게 많은 단어를 사용하는 게 놀랍습니다.
fl0under : 코딩 성능은 예상대로 약간 업데이트된 수준이고, 채팅에서 대화하는 게 좀 더 짜증나졌습니다. 너무 추측성으로 나옵니다.
Asaf Bartov : 느립니다. 더 꼼꼼합니다. 지칩니다. 재미없습니다. 하지만 견고하고, 대체로 "잘 이해합니다."
RecoveringJunkie : 매우 강력한 모델입니다. 하지만 함께 작업하거나 대화하는 것이 싫습니다. 유용하면서도 혐오스러워서, 다른 모델을 중개인으로 삼아 대신 대화하게 하고 싶게 만드는 첫 번째 모델입니다.
jokiez : 제 무식함에 대해 아주 솔직하게 말해주는데, 그게 싫습니다.
Niklas Sheth : 말하는 방식 때문에 분노가 치밀어 오릅니다.
Jayanth Kumar : 의견이 매우 강합니다.
DualOrion : 분위기가 이상하고, 어조가 맞지 않습니다. Anthropic 모델 중에서 직감적으로 가장 부정적인 느낌을 받은 것 같습니다. 안타깝게도 Fable 과 예전 Opus 가 그립습니다.
James Moughan : 다른 Claude 모델에 비해 성격이 좀 불쾌하지만, 중국어로는 \엄청나게\ 날카롭습니다. 사람 심리 분석을 금지하는 지침을 무시하고 누군가를 맹비난하기 시작할 수 있습니다. 언어별로 제대로 테스트하지 않은 것 같습니다. 서둘러 출시된 느낌입니다.
NondescriptTransfer : 4.6 이 아첨하고 Fable, 4.8 이 반골 기질이라면, 5.0 은 너무 반골 기질이 강해서 자기 자신과도 논쟁을 합니다. 대화하기는 불쾌하지만 능력은 매우 뛰어난 것 같습니다.
예. 사람: 제 결혼식에 빨간 드레스를 입을까 생각 중이에요. Opus 5: 빨간색은 이런저런 이유로 별로예요. 파란색은 생각해 보셨나요? 사람: 아, 파란색이 더 나은 선택일 수도 있겠네요. Opus 5: 파란색의 모든 문제점을 알려드리겠습니다.
제 문화권에서는 특히 개인적으로 받아들이지만 않는다면 꽤 괜찮을 수 있습니다. 하지만 다른 문화권에서는 그렇지 않을 수도 있습니다.
Mergo 가 Opus 에 불만이 있는 것 같지만, 그렇다면 왜 이틀 내내 Opus 5 를 사용했을까요?
Mergo Smith : 이틀째 계속 사용하고 있는데, 끝없는 논쟁 때문에 완전히 지쳐버렸습니다.
이제는 셋
오랜만에 최첨단 모델 팀에 포함시켜야 할 AI 모델이 세 개가 되었습니다. 비록 두 개의 연구소에서 나왔지만요: Fable 5, Opus 5, Sol 입니다.
저렴한 토큰을 대규모로 서비스해야 하거나, 오픈 모델을 사용해야 하거나, 또는 둘 다 필요하다면 추가 옵션을 고려해야겠지만, 여기서는 범위를 벗어납니다.
작업 부하는 어떻게 나누는 것이 좋을까요?
항상 그렇듯이, 여러분의 사용 사례에 모든 모델을 직접 사용해보고 스스로 결정해야 합니다. 특히 Sol 과 Claude 를 비교할 때는 더욱 그렇습니다.
현재 제 직감은 사용량 제한에 걸리지 않는다면, 다음 순서로 사용하는 것입니다:
- 채팅, 브레인스토밍, 계획 수립, 토론, 학습 등, 지능이 많이 필요한 작업이나 '큰 모델의 느낌'이 필요할 때는 Fable 5.
- 다른 모델을 하위 에이전트로 감독하고 실행하는 모델로서는 Fable 5.
- 글쓰기에는 아마 Fable 5, 하지만 저는 이 작업을 하지 않아서 확실히 말하기는 어렵습니다.
- 웹 검색 및 관련된 간단한 요청, 그리고 전사와 같은 '일반 작업'에는 Sol.
- 중요하면서도 명확히 정의된 작업, 특히 대부분의 코딩 작업에는 Opus 5.
- 게임, 게임 제작, 3D 작업 등에는 Opus 5.
- 하위 에이전트로는 Opus 5.
- Fable 의 분류기에 걸렸을 때는 Opus 5.
Sol 과 더 잘 맞거나, Claude Code 보다 Codex 를 선호한다면 Opus 작업의 상당 부분을 Sol 로 옮기고 싶을 것입니다.
특히 Opus 5 와 대화하는 것을 싫어한다면, 작업이 Fable 을 필요로 하는지와 Fable 크레딧이 얼마나 남았는지에 따라 Fable 또는 Sol 로 작업을 옮겨야 합니다.
잠시 노력 수준에 대해 생각해보는 것도 가치가 있습니다. 최근까지는 모든 모델을 최대 노력으로 유지했지만, ChatGPT 에서 전체 Pro 모드는 너무 오래 걸리고 병렬로 실행하면 자주 충돌하기 때문에 드물게만 사용했습니다. 아주 간단한 작업을 할 때는 가끔 Instant 모드로 전환하기도 했습니다. 하지만 이제는 추가 노력이 필요하지 않거나 원하지 않는 경우가 많기 때문에, High 와 Max 노력 설정 중 무엇을 사용할지, 그리고 가끔은 Instant 모드를 사용할지에 대해 의식적으로 5 초 정도 시간을 내어 생각합니다.
대부분의 작업에서 토큰이나 시간 제약이 없고, 작업을 완료하거나 정답을 얻을 수 있을지 확신이 서지 않는다면, 올바른 방법은 Fable 과 Sol, 또는 Opus 와 Sol, 또는 경우에 따라 세 가지를 모두 실행한 다음 가장 좋은 답변을 선택하거나 두 답변의 장점을 결합하는 것입니다.
그것이 제가 해온 방식입니다. Sol, Opus, Fable 은 모두 다릅니다. 제 비공식 정성적 EditorBench 에 따르면 편집을 위해 단 하나의 모델만 선택해야 한다면 명확한 순서가 있습니다: Fable 5 > Opus 5 > Sol. 하지만 Sol 은 독특한 의견을 충분히 제시해 주기 때문에, 권위적인 오탐지와 저를 압박하려는 시도들을 처리하는 것이 얼마나 짜증나는지에도 불구하고 여전히 Sol 도 함께 실행하고 싶습니다.
아마 머지않아 Fable 5.1, GPT-5.7 또는 GPT-6, 또는 둘 다를 위해 다시 이 자리로 돌아와 할당량을 조정하게 될 것입니다. 모델 피로감을 느끼기 쉽습니다.
따라서 제 가장 큰 조언은 모델 선택에서 작은 실수에 덜 신경 쓰고, 큰 실수에만 집중하라는 것입니다. 항상 정확하게 맞출 필요는 없습니다. 탐험이 이렇게 빨리 무효화되는 상황에서는 탐험보다 활용에 더 많은 자원을 투입해야 합니다.





