YouMind
로그인

어떤 모델이 제값을 할까? 실제 지식 업무에 14개 모델을 투입해 검증했습니다.

@andrewbusse
영어2026년 7월 23일
166K
11
3
1
8

TL;DR

14개 AI 모델을 분석한 결과, 벤치마크 상위권 모델이 실제 지식 업무에서는 기대에 미치지 못하는 경우가 많았습니다. 본 분석은 판단력과 작업 빈도를 기준으로 모델을 단거리 주자, 미들급, 헤비급으로 분류하여 최적의 모델을 선택할 수 있는 프레임워크를 제시합니다.

작업에 가장 적합한 모델은 리더보드 1위 모델이 아닌 경우가 대부분이다.

AI 세계에서는 크리스마스가 일주일에 한 번꼴로 찾아온다. 새로운 모델이 등장하면 모두가 똑같은 가짜 정밀도 벤치마크 차트를 바라보며, 이것이 지금까지 나온 것 중 최고라고 동의한다. 그러다 다음 주가 되면 다시 반복된다.

하지만 그 어떤 차트도 중요한 단 하나의 질문에 답하지 못한다. 모델이 실제로 당신의 일일 브리핑을 실행하거나 고객에게 견적을 보낼 수 있을까? Hyperagent 에서는 이러한 모든 모델에 최고 수준의 에이전트를 결합하여 제공한다. 그래서 우리가 직접 테스트를 진행했다. 14 개 모델, 42 번의 실행, 고객이 매일 에이전트에 맡기는 실제 지식 작업을 대상으로 했다. 세 가지가 눈에 띄었다.

  • 동일한 작업에서 비용이 최대 50 배 차이 났다. 동일한 테스트 배터리가 Qwen 3.7 Plus 에서는 $1.48, Fable 5 에서는 $75.16 이 들었다.
  • 벤치마크 우승자가 작업 우승자는 아니었다. GPT 5.6 Sol 은 기준 테스트에서 1 위를 차지했지만, Hyperagent 내에서 실제 작업을 실행하자 상위 3 위 안에 들지 못했다. Grok 4.5 는 기준 테스트에서 중간 수준이었지만, 완료된 작업, 속도, 비용에서 1 위를 차지했다.
  • 그리고 어떤 모델도 모든 것을 석권하지는 못했다. 올바른 선택은 작업에 따라 달라졌다.

여기서 얻은 교훈은 새로운 선호 모델이 아니다. 작업별로 어떤 모델이 비용 대비 가치를 제공하는지 결정하는 방법이다.

지식 작업을 위한 AI 모델 지도

에이전트에 맡길 모든 작업은 두 가지 질문으로 귀결된다. 얼마나 많은 판단이 필요한가, 그리고 얼마나 자주 실행되는가? 이 두 축을 그리면 지식 작업은 네 가지 영역으로 나뉘며, 각 영역은 서로 다른 유형의 모델을 필요로 한다.

Andrew Busse - inline image

볼륨 작업(왼쪽 위). 분류, 모니터링, 라우팅, 데이터 동기화. 절차가 명확하고 지속적으로 실행되며, 실패 시 수정 비용이 저렴하다. 이 작업은 빠르고 저렴한 모델을 원한다.

일상 작업(오른쪽 위). 초안 작성, 보고, 연구, 고객 커뮤니케이션. 한 주의 대부분을 차지하는 반복적인 지식 작업으로, 실제 종합 능력과 좋은 글쓰기 톤이 필요하며, 안정적이고 자주 수행되어야 한다.

고위험 작업(오른쪽 아래). 계약 검토, 가격 협상, 심층 분석. 드물지만, 잘못된 답변은 고객, 계약, 또는 분기 마진을 잃게 한다. 이 영역에서는 실패 위험이 모델 비용을 압도하며, 가장 비싼 모델이 그 가치를 발휘하는 곳이다.

최적화 불필요(왼쪽 아래). 가끔 발생하는 단순한 요청으로, 어떤 유능한 모델이든 기준을 충족하며 가격 차이가 너무 작아 결정할 가치가 없다. 이 지도에서 사람들이 고민하지 말라고 말하는 유일한 영역이다.

세 가지 모델 클래스

지도에서 세 가지 작업 클래스가 도출된다. 이는 모델을 좋고 나쁨으로 평가하기보다 작업의 경제성과 판단 프로필을 설명한다.

스프린터는 볼륨 작업을 위해 설계되었다. 절차가 명확하고 실패 시 수정이 쉬운 경우 빠르고 저렴하며 일관된 성능을 제공한다. Haiku 4.5, Gemini 3.5 Flash, DeepSeek V4 Pro.

미들웨이트는 일상 작업을 실행한다. 소스를 종합하고, 다단계 계획을 유지하며, 모든 보고서에 최고 요금을 부과하지 않고도 글을 잘 쓴다. Sonnet 5, GPT 5.6 Terra, Grok 4.5, GLM 5.2 — 대부분의 지식 작업이 여기에 속한다.

헤비웨이트는 고위험 작업을 담당하며, 잘못된 답변이 모델 비용보다 훨씬 더 큰 손실을 초래하는 작업에 더 강력한 판단력과 더 많은 추론 시간을 제공한다. Opus 4.8, GPT 5.6 Sol, Fable 5.

대부분의 사람들은 가장 높은 수준에서 시작하여 낮추는 본능을 가지고 있다. 모든 작업을 Fable 5 나 Opus 4.8 로 실행하고 원하는 결과를 얻은 다음, 품질이 떨어질 때까지 더 저렴한 모델을 시도하는 것이다. 효과는 있지만, 대부분의 작업에 그 정도는 필요하지 않다는 것을 발견했다. 작업을 명명하고 지도에 배치할 수 있으면, 보통 처음부터 올바른 클래스에서 시작할 수 있다. 일상 작업(대부분의 작업)의 경우, Sonnet 5 와 같은 견고한 미들웨이트에서 시작하는 것을 의미한다. 작업이 진정으로 고위험 영역에 있을 때만 위에서 아래로 검색하는 방법을 사용한다.

모델의 범위는 Claude, GPT, Gemini 보다 훨씬 넓다

대부분의 팀은 이미 알고 있는 몇 가지 모델 이름을 기본으로 사용한다. 합리적인 출발점이지만, 많은 모델이 활용되지 않고 있다. Hyperagent 에서 가장 유용한 작업을 수행하는 모델 중 일부는 널리 알려지지 않은 모델들이다. 다음은 테스트 배터리와 일상 사용, 그리고 고객이 실행하는 작업을 관찰한 운영 소감이다.

Grok 4.5 는 빠르고 실시간 연구에 특화되어 있다. 도구를 많이 사용하는 연구를 신속하게 처리하며, Hyperagent 의 기본 Exa Search 와 함께 사용할 때 특히 뛰어난 성능을 보였다. 또한 X 에 대한 기본 연결을 제공하므로 실시간 감정에 대한 질문에 답변 뒤에 있는 실제 게시물을 함께 반환할 수 있다. 전체 실행에서 완료된 작업 점수 1 위를 차지했으며 비용은 $9.71 이었다.

Muse Spark 1.1 은 깔끔한 글쓰기와 자체 검증 기능을 제공한다. 테스트 환경에서 2 위를 차지했으며, 초기 평가 결과 간결하고 잘 구조화된 문장을 생성하며, 작업을 반환하기 전에 자체 감사를 수행하는 유용한 습관을 가지고 있다. 아직 새로운 모델이므로, 장기 무인 작업보다는 감독하에 일상 작업부터 시작하는 것이 좋다.

Kimi K2.6 은 오픈 모델 가격에 딥 리서치를 제공한다. 검색을 병렬로 실행하고 증거를 단일 답변으로 통합하며 플래그십 요금을 부과하지 않아 강력한 연구 전문가 역할을 한다. 유일한 한계는 문서 크기로, 컨텍스트 창이 최대 256,000 토큰으로 제한된다.

GLM 5.2 는 가성비 최고의 선택이다. 일상적인 연구, 초안 작성, 긴 문서 작업에서 폐쇄형 미들웨이트에 놀라울 정도로 가까운 성능을 약 3 분의 1 가격에 제공하며, 문장력은 Sonnet 과 Opus 외에서 가장 강력한 수준이다. Hyperagent 팀의 많은 구성원이 일상적으로 사용하는 모델이 되었다.

Qwen 3.7 Plus 는 화면 작업에 특화되어 있다. 렌더링된 페이지에서 버튼, 필드, 메뉴를 찾는 데 특히 뛰어나며, 구조화된 추출에 저렴하다. 테스트 배터리에서 가장 저렴한 완전 실행을 기록했다. 인터페이스 작업이나 데이터 이동이 필요한 작업에 사용하고, 문장력이 중요한 작업에는 사용하지 않는 것이 좋다.

DeepSeek V4 Pro 는 매우 저렴한 비용으로 구조화된 분석을 제공한다. 데이터 조정, 정리, 예약된 숫자 작업 및 유사한 구조화된 작업에 가장 강력하다. 글쓰기는 직설적이고 간결하여 내부 설명에는 적합하지만 고객 대상 문장에는 부적합하다. 전문가이며 매우 경제적인 모델이다.

항시 작동하는 에이전트를 적정 가격에 운영하기

Steve Juba 는 6 인 규모의 여행사를 운영하고 있다. 그는 8 개의 실시간 데이터 소스에 연결된 브리핑 에이전트를 구축하여 하루에 여러 번 실행하며, 아침 컨텍스트 수집 시간을 8 개 탭에서 3 시간 이상에서 15 분으로 줄였다.

이와 같은 에이전트는 쓰는 것보다 읽는 양이 훨씬 많고 동일한 작업을 연간 수백 번 수행하므로, 실행당 작은 가격 차이가 반올림 오류가 아니라 실제 예산 항목이 된다. 매일 100,000 토큰을 읽고 2,000 토큰을 쓰는 브리핑을 생각해보자. 2026 년 7 월 기준 가격으로 이 작업의 대략적인 비용은 다음과 같다.

  • $16 a year on Qwen 3.7 Plus (스프린터)
  • $38 a year on Kimi K2.6 (미들웨이트)
  • $40 a year on Haiku 4.5 (스프린터)
  • $80 a year on Sonnet 5 (미들웨이트)
Andrew Busse - inline image

오픈 웨이트 옵션은 이와 같은 읽기 중심 작업의 계산 방식을 바꾼다. Kimi K2.6 은 이 작업에서 미들웨이트 수준의 연구와 종합을 $38 에 제공한다. 이는 Sonnet 5 의 절반 이하이며, Haiku 스프린터를 실행하는 것과 거의 같은 비용이다. 판단력을 비용과 맞바꾸는 것이 아니라, 스프린터 비용으로 미들웨이트 작업을 수행하는 것이다. 작업이 판단력 없이 순수 추출만 필요한 경우 Qwen 은 $16 에 실행할 수 있지만, 실제 종합이 필요한 순간 Kimi 가 거의 같은 가격으로 그 기능을 제공한다.

모델을 바꿔도 에이전트는 그대로

모델을 변경하는 것이 에이전트를 재구축하는 것을 의미한다면 이 모든 것은 의미가 없다. Hyperagent 내에서는 그렇지 않다. 모델은 단지 하나의 설정일 뿐이며, 역할은 그 위에 있기 때문이다. 모델을 변경해도 에이전트는 유용하게 만드는 모든 것을 유지한다.

  • 지침 및 범위
  • 스킬, 스크립트 및 작업 절차
  • 수정 사항에 대한 메모리
  • 참조 파일 및 회사 컨텍스트
  • 작업이 존재하는 시스템에 대한 연결
  • 품질 평가를 위한 루브릭
Andrew Busse - inline image

이를 통해 모델 선택이 마이그레이션이 아닌 테스트로 전환된다. 동일한 에이전트가 재구축 없이 두 모델에서 동일한 작업을 실행할 수 있으므로, 추측하지 않고 기준을 충족하는 가장 저렴한 모델을 찾을 수 있다.

또한 어려운 워크플로의 비용이 많이 드는 부분이 한 번만 지불되도록 한다. 작업이 진정으로 필요할 때, 더 무거운 모델을 사용하여 워크플로를 설계하고 디버깅한 다음, 절차를 스킬로 코드화하여 미들웨이트나 스프린터가 매일 훨씬 저렴한 비용으로 실행할 수 있게 한다.

하지만 주의해야 할 숨은 비용이 있다. 모든 출력에 수정이 필요하다면 청구 금액이 낮은 저렴한 모델이 실제로는 저렴하지 않다. 인간의 검토 시간과 실패 비용이 실제 가격의 일부이기 때문이다. 이를 검토세라고 부르자. 이는 얼마나 가벼운 모델을 사용할 수 있는지에 대한 하한선을 설정한다. Hyperagent 에서 다른 점은 검토가 단순히 지불되는 것이 아니라 복리 효과를 가진다는 것이다. 에이전트가 메모리를 통해 수정 사항을 학습함에 따라, 검토 노력이 하네스에 포착되어 다음 실행에서 더 나은 에이전트를 생성한다.

고객들은 이미 이러한 방식으로 에이전트를 운영하고 있다. Ankit Das 는 Sonnet 5 에서 판단을 내리는 Growth Orchestrator 와 GLM 5.2 에서 반복적인 채널 작업을 생성하는 8 명의 채널 전문가, 그리고 브랜드 준수 여부와 글쓰기 품질을 확인하는 별도의 QA 에이전트로 마케팅 운영을 구축했으며, 이 모든 것은 단일 스레드에서 시작된다. Eli Weiss 는 자신의 스킬과 루틴에서 약 85% Sonnet 과 15% Opus 로 분할을 더 간단히 설명한다. 대부분의 작업은 일상적인 드라이버에서 실행되고, Opus 는 추가 판단이 비용을 정당화하는 소수의 작업을 담당한다.

이것이 Hyperagent 내에서 모델 선택의 실질적인 가치이다. 작업 전반에 걸쳐 의도적으로 비용을 지출하고, 추가 판단이 결과를 바꾸는 작업을 위해 추가 비용을 아껴두라.

작업을 선택한 후 모델을 선택하라

이미 운영 중인 에이전트에 대해 다음 순서를 사용하라.

  1. 작업을 명명하라. '월요일 고객 보고서 준비'가 '보고 작업 도움'보다 더 유용하다.
  2. 지도에 배치하라. 얼마나 많은 판단이 필요한지, 얼마나 자주 실행될지 결정하라.
  3. 지도가 표시하는 위치에서 시작하라. 대부분의 작업에서 유능한 미들웨이트로 시작하고, 작업의 에지 케이스를 이해하고 프로세스를 스킬로 코드화할 때까지 사용하라.
  4. 한 단계 가벼운 클래스를 실제 실행 5 회 테스트하라. 지침, 스킬, 메모리, 소스, 루브릭을 변경하지 않고 유지하라.
  5. 전체 비용을 비교하라. 완료된 품질, 일관성, 시간, 사실 오류, 모델 비용, 인간 검토 시간을 추적하라.
  6. 의도적으로 업그레이드하라. 검토 부담이나 잘못된 답변의 비용이 모델 프리미엄을 초과할 때 헤비웨이트를 도입하라.
  7. 중요한 작업을 검토할 때는 다른 모델을 사용하라. 실수를 저지른 모델은 그 실수를 발견할 가능성이 가장 낮다.

안정적으로 기준을 충족하는 가장 저렴한 모델을 유지하라. 그리고 그 차액을 그럴 자격이 있는 작업에 사용하라.

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기