헤드라인 숫자는 이야기의 전부가 아닙니다
7월 27일, Moonshot AI가 수정된 MIT 라이선스로 Kimi K3의 전체 가중치를 공개합니다. 스펙 시트는 자랑으로 가득합니다: 2.8조 개의 파라미터, 백만 개의 토큰 컨텍스트 윈도우, 그리고 DeepSeek V4 Pro보다 약 75% 더 큰 역대 최대 규모의 오픈 웨이트 모델이라는 타이틀까지.
하지만 크기는 미끼입니다. 진짜 이야기는 누가 프론티어 수준의 지능에 대한 접근을 통제하는지가 바뀌었다는 점입니다. 3년 동안 최고의 모델은 API 뒤에 있었습니다. 사용자는 임대료를 내고, 제공자가 조건을 정했으며, 공급업체가 엔드포인트 가격을 변경하거나 모델의 동작을 조용히 바꾸면 사용자의 제품이 그 피해를 고스란히 받았습니다.
오픈 웨이트는 그런 구조를 깨뜨립니다. 파일이 공개되면 어떤 연구소도 그 기능을 되돌릴 수 없습니다. 이 한 가지 사실이 모든 사람의 경제성을 바꿉니다. 단 하나의 샤드도 다운로드하지 않을 사람들까지도 말이죠.
스펙 시트 한눈에 보기
Spec
Value
파라미터
2.8조
전문가
총 896개, 토큰당 16개 활성화
컨텍스트 윈도우
1,048,576 토큰
라이선스
수정된 MIT
가중치 공개일
7월 27일
DeepSeek V4 Pro 대비 크기
약 75% 더 큼
K2 대비 스케일링 효율
약 2.5배
가격
요금
입력 (캐시 적중)
$0.30 / 100만 토큰
입력 (캐시 미스)
$3.00 / 100만 토큰
출력
$15.00 / 100만 토큰
2.8T 모델이 2.8T 비용을 피하는 방법
이 크기의 Dense 모델은 사용이 불가능할 것입니다. 모든 토큰에서 모든 파라미터를 실행하는 것은 모든 조 단위 모델이 부딪히는 벽입니다: 너무 느리고, 너무 비싸며, 물리 법칙을 피할 방법이 없습니다.
K3는 공격적인 Mixture-of-Experts 설계로 이를 우회합니다. 모델 내부에는 896개의 전문가 하위 네트워크가 있습니다. 주어진 토큰에서 그중 16개만 활성화됩니다. 2.8조 개의 파라미터에 저장된 지식을 활용하면서도, 그보다 훨씬 작은 규모의 모델에 해당하는 추론 비용만 지불하면 됩니다.
이것이 Sparsity이며, K3는 이전의 어떤 오픈 모델보다 이것에 더 의존합니다. K2는 이 접근 방식이 효과가 있음을 증명했습니다. K3는 이를 핵심 전략으로 전환합니다.

핵심 작업을 수행한 두 개의 연구 논문
두 가지 아키텍처 변경으로 나머지가 가능해졌으며, 둘 다 모델이 출시되기 전에 오픈 연구로 발표되어 Moonshot이 단일 벤치마크 결과가 나오기도 전에 연구자들로부터 신뢰를 얻을 수 있었습니다.
첫 번째는 Kimi Delta Attention(KDA)으로, 하이브리드 선형 어텐션 메커니즘입니다. 표준 어텐션 비용은 컨텍스트가 길어질수록 이차적으로 증가하기 때문에, 백만 토큰 윈도우는 보통 마케팅 자료에만 머물곤 합니다. KDA는 다르게 확장되며, 그 차이가 바로 누구나 실제로 지불할 수 있는 가격에 1M 윈도우가 존재할 수 있는 유일한 이유입니다.
두 번째는 Attention Residuals로, 표준 잔차 연결을 대체합니다. Moonshot은 이를 일관된 스케일링 이득의 원인으로 꼽으며, 일반적인 성능 저하 없이 더 깊은 모델을 구축할 수 있게 해줍니다. 자체 수치에 따르면, 이 조합은 K2 대비 약 2.5배의 스케일링 효율을 제공합니다.
백만 개의 토큰이 없애는 것

프로덕션 AI의 검색 인프라 대부분은 해결책으로 존재합니다. 청킹, 임베딩, 벡터 데이터베이스, RAG 파이프라인: 이 모든 것은 모델이 작업 메모리에 한 번에 충분히 담을 수 없기 때문에 이를 보완하기 위한 것입니다.
백만 개의 토큰은 기본값을 바꿉니다. 전체 코드베이스가 단일 프롬프트에 들어갑니다. 1년치 내부 문서. 50개의 비디오 트랜스크립트. 모든 것이 동시에 어텐션에 있으며, 모델은 검색된 조각을 이어붙이고 이음새가 유지되길 바라는 대신 전체 코퍼스에 걸쳐 추론합니다.
네이티브 비전은 입력 표면을 더욱 넓힙니다. 스크린샷, 화이트보드 사진, 아키텍처 다이어그램 및 차트는 주변의 코드 및 텍스트와 동일한 컨텍스트에서 읽을 수 있습니다. K3의 가장 강력한 벤치마크 승리가 프론트엔드 코딩에서 나온 것은 우연이 아닙니다. 모델이 디자인을 보고 하나의 컨텍스트 윈도우 내에서 구현을 작성하기 때문입니다.
벤치마크보다 더 중요한 가격표
명시된 요금: 캐시 적중 시 입력 토큰 백만 개당 $0.30, 캐시 미스 시 $3.00, 출력 토큰 백만 개당 $15.00이며, 컨텍스트는 1,048,576 토큰입니다.
캐시 수치가 주목해야 할 부분입니다. Moonshot은 긴 코딩 세션에서 90% 이상의 캐시 적중률을 보고합니다. 에이전트가 실제로 무엇을 하는지 생각해보세요. 몇 시간 동안 동일한 저장소를 반복해서 다시 읽습니다. 캐싱이 없으면 매번 전체 입력 가격을 지불합니다. 캐싱이 있으면 긴 세션의 비용이 약 4배로 줄어듭니다.
장기 실행 에이전트는 바로 이 계산에 달려 있습니다. K3는 최소한의 감독으로 몇 시간 동안 실행되며, 저장소를 탐색하고, 터미널 도구를 조정하고, 자신의 작업을 확인하는 세션을 위해 설계되었습니다. 가격 구조가 바로 제품입니다.
누구도 놓쳐서는 안 될 함정
K3에는 이코노미 모드가 없습니다. 추론은 영구적으로 켜져 있으며 최대로 고정되어 있습니다. 독립 테스터들은 사소한 SVG 요청에 13,000개 이상의 생각 토큰을 소모하는 것을 목격했으며, 이는 일회성 쿼리에 약 $0.25에 해당합니다.
교훈은 라우팅입니다. 빠르고 저렴하며 대량의 호출은 더 작은 모델에 맡겨야 합니다. K3는 컨텍스트 크기와 작업 복잡성이 항상 켜져 있는 추론을 정당화할 때만 그 비용을 정당화합니다. 범용 채팅 엔드포인트로 사용하는 것은 돈을 불태우는 것과 같습니다.
연결은 5분이면 충분합니다
API는 OpenAI 호환입니다. base_url과 키만 변경하면 기존 코드를 그대로 사용할 수 있습니다:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Kimi K3를 한 문장으로 소개해주세요."}],12)13print(completion.choices[0].message.content)
추론은 최상위 필드를 통해 구성되며, 현재는 "max"만 허용합니다:
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "2의 제곱근이 무리수임을 증명하세요."}],5)6print(completion.choices[0].message.content)
스트리밍은 표준 방식으로 작동하며, 추론 내용은 별도의 델타 필드로 도착하므로 생각 과정과 답변을 독립적으로 렌더링할 수 있습니다:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "하늘이 파란 이유를 설명해주세요."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
비전 입력은 동일한 메시지 내에서 텍스트와 함께 base64로 인코딩된 이미지를 사용합니다. 이것이 바로 스크린샷-투-코드 워크플로우의 전부입니다:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "이 랜딩 페이지를 HTML과 Tailwind로 다시 만들어주세요."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
가중치를 직접 다루지 않는 사람들에게도 의미가 있는 이유
여기 솔직한 부분이 있습니다. 거의 아무도 2.8조 개의 파라미터를 자체 호스팅하지 않을 것입니다. Sparsity가 있더라도 하드웨어 비용은 취미 수준을 훨씬 넘어서며, 대부분의 회사 범위도 벗어납니다.
그것이 요점이 아니었습니다. 공개된 가중치는 폐쇄된 연구소가 유사한 기능에 대해 청구할 수 있는 가격에 상한선을 설정합니다. 제3자 호스팅 업체들은 K3를 상품화된 마진으로 제공하기 위해 서로 경쟁할 것이며, 이는 이전의 모든 주요 오픈 릴리스에서 나타났던 역학과 동일합니다. 전체 시장의 가격은 오픈 베이스라인 쪽으로 이동합니다.
그 혜택은 여러분이 이미 사용하고 있는 제공업체의 청구서를 통해, 파일을 다운로드하든 하지 않든 여러분에게 도달합니다.
실용적인 플레이북
전체를 한 번에 입력하세요. 검토할 전체 저장소, 전체 계약 폴더, 전체 콘텐츠 라이브러리. 더 이상 청킹이 필요하지 않은 것을 청킹하지 마세요.
오래 실행하세요. 여러 시간의 엔지니어링 세션을 큐에 넣고 나중에 결과를 확인하세요. 캐시가 모든 재읽기 비용을 흡수합니다.
문제에 카메라를 겨누세요. 랜딩 페이지를 스크린샷으로 찍고 재구축을 요청하세요. 화이트보드를 사진으로 찍고 구현을 요청하세요.
사소한 트래픽은 차단하세요. 항상 최대로 추론하는 모델은 빠르고 대량의 호출에 적합한 도구가 아닙니다. 그러한 작업은 다른 곳으로 라우팅하고 K3는 그에 합당한 작업을 위해 남겨두세요.
10일 카운트다운
3년 동안 프론티어는 여러분이 임대하고, 조건을 정할 수 없었으며, 경고 없이 가격이 변할 수 있는 무언가였습니다.
7월 27일, 그것은 파일이 됩니다. 그리고 파일은 구독과 달리, 여러분이 소유하는 것입니다.





