다른 모든 모델을 구식으로 만드는 Kimi K3의 7 가지 기능

@0xRicker
영어1일 전 · 2026년 7월 22일
327K
91
9
23
141

TL;DR

Kimi K3는 Moonshot AI가 선보이는 2.8T 파라미터 규모의 오픈 웨이트 모델로, 100만 토큰의 컨텍스트 윈도우를 지원하며 5분의 1 수준의 비용으로 최첨단 코딩 성능을 구현합니다.

세계에서 가장 큰 오픈 모델이 출시되었습니다. Fable 5 수준의 코딩 능력에, 비용은 5배 저렴하고, 토큰 사용량도 훨씬 적습니다. 주목할 만한 7가지 특징을 소개합니다.

7월 16일, 중국의 오픈 소스 모델이 조용히 최고 수준의 코딩 모델로 자리 잡았습니다. 이제 최첨단 가격을 지불하지 않고도 사용할 수 있게 된 것입니다.

Moonshot AI가 Kimi K3를 2.8조 개의 파라미터로 출시했습니다. 이는 세계에서 가장 큰 오픈 웨이트 모델입니다. Bloomberg, Forbes, Fortune이 48시간 이내에 모두 보도했으며, 그 이유는 간단합니다. 코딩 벤치마크에서 Claude Fable 5 및 GPT-5.5와 대등한 성능을 보이면서도 비용은 약 5분의 1에 불과하기 때문입니다.

Ricker - inline image

이것이 왜 중요한지 이해하려면, 지난 2년간 모두가 믿게 된 것을 기억해야 합니다. 최첨단 성능에는 최첨단 가격이 따른다는 것입니다. 최고의 코드를 원한다면, 최고 등급의 요금을 토큰당 지불하고, 통제할 수 없는 엔드포인트를 사용해야 했습니다. 이것이 당연한 거래였습니다. 모든 진지한 팀은 이를 예산에 반영했습니다.

K3는 단 한 번의 출시로 그 가정을 깨뜨립니다. 최첨단 수준의 결과물을 일반 상품 가격에 제공하면서, 누구나 다운로드할 수 있도록 가중치를 공개하는 이 조합이 비즈니스 언론이 반응한 부분입니다. 아래에는 다른 모든 모델을 한 세대 뒤처지게 만드는 7가지 기능이 있습니다. 첫 번째는 여러분의 API 요금이 곧 인하될 이유입니다.

Ricker - inline image

아래에는 다른 모든 모델을 한 세대 뒤처지게 만드는 7가지 기능이 있습니다. 첫 번째는 여러분의 API 요금이 곧 인하될 이유입니다.

1. 핵심

5배 저렴한 비용의 Fable 수준 백엔드 코딩

이것이 다른 모든 것을 재정의하는 기능입니다. 독립적인 테스트에서 Kimi K3는 실제 백엔드 코딩 작업에서 Claude Fable 5와 동등한 성능을 보여줍니다: API 디자인, 데이터베이스 스키마, 서비스 로직, 대규모 코드베이스 리팩토링 등. 장난감 수준의 코드 조각이 아닙니다. 예전에는 최첨단 구독을 정당화했던 종류의 작업입니다.

백엔드는 그 차이가 가장 명확하게 드러나는 분야입니다. 백엔드 코드는 지름길을 용납하지 않기 때문입니다. 올바르게 보이는 프론트엔드 컴포넌트는 대개 실제로도 올바릅니다. 하지만 올바르게 보이는 결제 핸들러는 부하가 걸렸을 때 상태를 손상시키거나, 경쟁 조건을 누출하거나, 에지 케이스를 조용히 놓칠 수 있습니다. 백엔드 작업에서 모델을 평가한다는 것은 압박 속에서도 정확성을 평가한다는 의미이며,这正是 약한 모델들이 최첨단 범위에서 벗어나는 지점입니다. K3는 그 범위 내에 머물러 있습니다.

차이는 청구서입니다. K3는 동일한 수준의 코드를 약 5분의 1 가격에 생산하며, 토큰 효율성이 더 높기 때문에 전체 프로젝트의 실제 격차는 표면 가격만으로 암시되는 것보다 더 큰 경우가 많습니다.

Ricker - inline image

막대 그래프가 어디에 있는지 보십시오. K3는 최첨단 범위 내에 있으며, 쫓아가는 것이 아닙니다. 이제 그 품질을 일정하게 유지하고, 거기에 도달하는 데 드는 비용을 살펴보십시오:

Ricker - inline image

여러분은 품질과 가격을 맞바꾸는 것이 아닙니다. Fable 수준의 백엔드 결과물을 유지하면서 청구서의 80%를 삭제하는 것입니다.

실제 엔지니어링 월 단위로 곱하면 그 숫자는 더 이상 추상적이지 않습니다. 매주 수천 개의 에이전트 코딩 작업을 실행하는 팀은 $1.00과 $0.20 사이를 한 번 선택하는 것이 아닙니다. 수만 번 선택하며, 그 격차는 경영진이 실제로 주목하는 항목으로 누적됩니다.

Ricker - inline image

2. 승수 효과

더 적은 토큰으로 더 많은 것을 말하다

토큰당 가격은 경제성의 절반에 불과합니다. 나머지 절반은 모델이 동일한 답변에 도달하기 위해 얼마나 많은 토큰을 사용하는지입니다. K3는 여기서 매우 효율적입니다. 더 적은 왕복, 더 적은 반복된 가정, 그리고 실제 코드 주변의 더 적은 채우기로 작동하는 솔루션을 추론합니다.

채팅보다 에이전트에게 이것이 더 중요한 미묘한 이유가 있습니다. 단일 대화에서 수다스러운 모델은 단지 느리게 느껴질 뿐입니다. 에이전트 루프에서는 모든 낭비된 토큰이 다음 단계에서 다시 소비되고, 그 다음 단계에서도 마찬가지입니다. 컨텍스트가 전달되기 때문입니다. 단계당 60% 더 가벼운 모델은 실행 전체에서 60% 저렴한 것이 아닙니다. 누적하여 더 가벼워집니다. 이후의 모든 단계가 다시 읽어야 할 흔적도 더 적게 남기기 때문입니다.

단일 프롬프트에서는 반올림 오류처럼 보입니다. 수천 단계의 실제 에이전트 실행에서는 프로젝트 비용이 달러에서 센트로 바뀌는 차이로 누적됩니다. 이것이 전체 빌드에서 Fable 5 대비 실질적인 비용 격차가 5배라는 헤드라인보다 더 큰 경우가 많은 이유입니다.

Ricker - inline image

3. 규모

2.8조 개의 파라미터, 다운로드 가능

K3는 지금까지 출시된 가장 큰 오픈 웨이트 모델입니다. Moonshot은 DeepSeek으로부터 그 왕관을 빼앗아 최초의 공개 3T급 모델이라고 부르고 있습니다. 참고로 OpenAI와 Anthropic은 모두 파라미터 수를 공개하지 않습니다. 여기서 한 연구소가 2.8T 모델을 공개하고 가중치를 제공하는 것입니다.

규모 자체가 핵심은 아닙니다. 중요한 것은 이제 이 정도의 용량을 여러분이 실행, 검사, 미세 조정 및 자체 호스팅할 수 있다는 것입니다. 통제할 수 없는 계량형 엔드포인트를 통해 대여하는 대신 말이죠. 백엔드 팀에게 이 구분은 학문적이지 않습니다. 자체 방화벽 뒤에 모델을 배치하고, 자체 코드베이스와 규칙에 맞게 조정하며, 독점 코드 한 줄을 타사 API로 보내지 않을 수 있다는 것을 의미합니다. 오픈 웨이트 릴리스는 7월 27일까지 제공됩니다.

Ricker - inline image

4. 메모리

한 번에 100만 개의 토큰 컨텍스트

K3는 단일 창에 100만 개의 토큰 컨텍스트를 보유합니다. 실질적으로는 전체 백엔드 코드베이스, 테스트, 문서, 마이그레이션 기록을 모두 한 번에 여유 공간까지 확보하여 로드할 수 있음을 의미합니다.

이것이 코딩 스토리를 벤치마크 아티팩트가 아닌 현실로 만드는 요소입니다. Fable처럼 코딩하는 모델은 유용합니다. Fable처럼 코딩하면서 전체 저장소를 한 번에 볼 수 있는 모델은 다른 종류의 도구입니다. 모든 호출자, 모든 유형, 모든 다운스트림 종속성을 완전히 파악하여 리팩토링합니다. 붙여넣은 세 개의 파일에서 추측하는 대신 말이죠.

유능한 모델이 자신 있게 코드베이스를 망가뜨리는 것을 본 사람이라면 누구나 그 실패 패턴을 알고 있습니다: 볼 수 있는 파일에 대해서는 올바른 코드를 작성했지만, 볼 수 없는 12개의 파일에 대해서는 잘못된 코드를 작성했습니다. 100만 개의 토큰 창은 모델을 더 똑똑하게 만들지 않습니다. 눈가리개를 제거할 뿐입니다. 동일한 Fable 수준의 추론이 이제 전체 그림에 대해 작동하며, 실제 백엔드 버그의 대부분이 숨어 있는 곳입니다.

Ricker - inline image

5. 병렬성

K3 Swarm Max는 작업을 병렬로 실행

K3는 두 가지 변형으로 출시되었습니다. K3 Max는 채팅 및 에이전트 작업을 처리합니다. K3 Swarm Max는 대규모 병렬 처리를 위해 설계되었습니다: 하나의 모델이 큐를 처리하는 대신 여러 에이전트가 동시에 작업합니다.

백엔드 작업의 경우 이것이 핵심입니다. 하나의 에이전트가 순차적으로 40개의 엔드포인트를 구현하는 대신, swarm은 이를 병렬 작업자에게 할당합니다. 각 작업자는 코드베이스의 일부를 담당하며 함께 완료됩니다. Fable 수준의 품질이 이제는 빠르기도 합니다. 처리량이 단일 대화의 길이가 아닌 에이전트 수에 따라 확장되기 때문입니다.

경제성은 속도 위에 쌓입니다. swarm의 각 에이전트가 K3 에이전트이기 때문에 전체 병렬 실행은 동일한 5배 비용 이점을 물려받습니다. 한 번에 40개의 Fable 에이전트를 펼칠 때처럼 병렬 처리를 위한 특권 비용으로 최첨단 요금을 지불하지 않습니다. swarm의 처리량과 일반 모델의 비용을 동시에 얻을 수 있습니다.

Ricker - inline image

6. 범위

장기 에이전트 작업에 최적화

K3는 장기 코딩 및 에이전트 워크로드를 위해 특별히 훈련되었으며, 사후에 개조된 것이 아닙니다. 수천 단계에 걸쳐 계획을 유지하고, 맥락을 잃지 않고 도구를 사용하며, 단계가 실패할 때 전체 실행을 탈선시키는 대신 복구합니다.

이를 100만 개의 토큰 창과 결합하면 전체 백엔드 기능을 처음부터 끝까지 담당할 수 있는 에이전트를 얻을 수 있습니다: 코드베이스 읽기, 변경 계획, 서비스 전반에 걸친 구현, 테스트 실행, 실패 읽기, 수정 등. 이전에는 최첨단 모델에서만 작동했던 종류의 루프가 이제 5분의 1 비용의 모델에서 작동합니다.

실패 복구 부분이 데모와 도구를 구분짓는 요소입니다. 대부분의 에이전트는 900단계에서 테스트가 실패할 때까지 인상적입니다. 그 시점에서 취약한 에이전트는 계획을 버리고 즉흥적으로 대처하기 시작합니다. K3는 실패한 단계를 막다른 길이 아닌 정보로 처리하도록 조정되었습니다. 오류를 읽고, 조정하고, 계속 진행합니다. 이것이 장기 실행이 실제로 완료되는 유일한 방법입니다.

Ricker - inline image

7. 변화

오픈 웨이트, 그리고 최첨단의 가격 재정의

일곱 번째 기능은 사양이 아닙니다. 다른 여섯 가지가 합쳐진 결과입니다. 이렇게 유능한 모델이 오픈 웨이트일 때, 모든 폐쇄형 모델의 가격 책정은 당연한 것이 아니라 의문이 됩니다.

K3Fable 수준의 백엔드 코드를 5분의 1 비용, 100만 개의 토큰 창, 병렬 swarm으로 제공한다면, 폐쇄형 연구소는 그들의 프리미엄을 정당화해야 하는 부담을 지게 됩니다. 이는 업계가 DeepSeek에서 보았던 것과 동일한 패턴이며, 이것이 이번 출시가 이틀 만에 3개의 비즈니스 매체의 첫 페이지를 장식한 이유입니다.

Moonshot은 우연히 이 지점에 도달한 것이 아닙니다. 이 회사는 1월에 43억 달러의 가치 평가로 5억 달러의 자금 조달을 마감했으며, 명시적으로 K3와 이를 훈련할 컴퓨팅 파워를 위해 earmarked되었습니다. 이는 최첨단급 모델을 공개하는 자금이 지원된 의도적인 추진이며, 가격 책정도 우연이 아닙니다. 그것이 전략입니다. 비용 면에서 폐쇄형 연구소를 저렴하게 공략하면서 개발자에게 비용을 지불하게 하는 유일한 축인 작동하는 코드에서 그들을 따라잡는 것입니다.

Ricker - inline image

한눈에 보는 7가지:

  • Fable 수준의 백엔드 코딩을 약 5배 저렴한 비용으로.
  • 토큰 효율적이므로 실제 격차는 더욱 큼.
  • 2.8T 파라미터, 세계에서 가장 큰 오픈 웨이트 모델.
  • 1M 토큰 컨텍스트, 전체 백엔드 저장소를 한 번에.
  • K3 Swarm Max로 병렬, 고처리량 빌드.
  • 장기 에이전트 워크로드, 처음부터 끝까지 담당.
  • 오픈 웨이트, 최첨단의 가격 기준 재정의.

Fable 수준의 코드. 5분의 1 가격. 오픈 웨이트.

최첨단은 예전에는 비용을 지불하고 방문해야 하는 곳이었습니다. Kimi K3는 최고의 코딩 등급을 이제 여러분이 실행하고, 소유하고, 감당할 수 있는 것으로 만들었습니다. 이제 다른 모든 모델은 동일한 결과에 대해 5배 더 많은 비용이 드는 이유를 설명해야 합니다.

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기