Kimi K3, Yapay Zeka Abonelik Dönemini Resmen Bitirdi

@0xDominiqq
İNGILIZCE3 gün önce · 18 Tem 2026
275K
83
12
4
176

TL;DR

Moonshot AI'ın Kimi K3 modeli; 2,8 trilyon parametreli açık ağırlıklı yapısı ve 1 milyon tokenlık bağlam penceresiyle dikkat çekiyor. Uzmanların Karışımı (MoE) mimarisinden ve yenilikçi dikkat mekanizmalarından yararlanan model, maliyetleri düşürerek kapalı API sistemlerinin hakimiyetine meydan okuyor.

Ana rakam hikayenin kendisi değil

27 Temmuz'da Moonshot AI, Değiştirilmiş MIT lisansı altında Kimi K3'ün tüm ağırlıklarını yayımladı. Teknik özellikler sayfası adeta bir gösteriş: 2,8 trilyon parametre, bir milyon token bellek penceresi ve şimdiye kadar yayımlanmış en büyük açık ağırlıklı model unvanı; DeepSeek V4 Pro'dan kabaca %75 daha büyük.

Ancak boyut bir yemdir. Asıl hikaye, sınır seviyesindeki zekaya erişimi kimin kontrol ettiğindeki değişimdir. Üç yıl boyunca en iyi modeller bir API'nin arkasında yaşadı. Kirayı siz ödediniz, ev sahibi şartları belirledi ve satıcı uç noktayı yeniden fiyatlandırdığında veya modelin davranışını sessizce değiştirdiğinde, ürününüz hasarı üstlendi.

Açık ağırlıklar bu düzeni bozar. Dosyalar halka açık olduğunda, hiçbir laboratuvar yeteneği geri alamaz. Bu tek gerçek, tek bir parçayı bile indirmeyecek kişiler de dahil olmak üzere herkes için ekonomiyi değiştirir.

Teknik özellik sayfasına bir bakış

Özellik

Değer

Parametre

2,8 trilyon

Uzman

Toplam 896, token başına 16 aktif

Bellek penceresi

1.048.576 token

Lisans

Değiştirilmiş MIT

Ağırlık yayını

27 Temmuz

DeepSeek V4 Pro'ya kıyasla boyut

~%75 daha büyük

K2'ye kıyasla ölçekleme verimliliği

~2,5 kat

Fiyatlandırma

Oran

Girdi (önbellek isabeti)

1 milyon token başına $0,30

Girdi (önbellek kaçırma)

1 milyon token başına $3,00

Çıktı

1 milyon token başına $15,00

2,8 trilyonluk bir model 2,8 trilyonluk faturadan nasıl kaçıyor

Bu boyutta yoğun bir model kullanılamaz olurdu. Her token üzerinde her parametreyi çalıştırmak, tüm trilyon ölçekli modellerin çarptığı duvardır: çok yavaş, çok pahalı, fiziğin etrafından dolaşmanın yolu yok.

K3, agresif bir Uzman Karışımı (MoE) tasarımıyla bunun üstesinden gelir. Modelin içinde 896 uzman alt ağ bulunur. Herhangi bir token üzerinde bunlardan yalnızca 16'sı ateşlenir. 2,8 trilyon parametrenin depolanmış bilgisini alırken, bunun çok daha küçük bir kısmı boyutundaki bir modelin çıkarım maliyetini ödersiniz.

Bu seyrekliktir ve K3 buna daha önceki hiçbir açık modelden daha fazla yaslanır. K2, yaklaşımın işe yaradığını kanıtladı. K3, bunu temel bahis haline getiriyor.

Dominique - inline image

Ağır yükü kaldıran iki araştırma makalesi

İki mimari değişiklik, geri kalanını mümkün kılıyor ve her ikisi de model piyasaya sürülmeden önce açık araştırma olarak yayımlandı. Bu, Moonshot'a tek bir kriter ortaya çıkmadan önce araştırmacılar nezdinde güvenilirlik kazandırdı.

Birincisi, Kimi Delta Attention (KDA), hibrit bir lineer dikkat mekanizmasıdır. Standart dikkat maliyetleri, bağlam uzadıkça ikinci dereceden artar; bu nedenle milyonluk token pencereleri genellikle pazarlama sunumlarında kalır. KDA farklı ölçeklenir ve bu fark, 1 milyonluk bir pencerenin herkesin ödeyebileceği bir fiyata var olmasının tek nedenidir.

İkincisi ise Dikkat Artıkları (Attention Residuals), standart artık bağlantıların yerine geçen bir mekanizmadır. Moonshot, bunu tutarlı ölçekleme kazanımlarına bağlayarak, olağan bozulma olmadan daha derin modeller oluşturmalarına olanak tanıdığını belirtiyor. Kendi sayılarına göre, kombinasyon K2'nin yaklaşık 2,5 katı ölçekleme verimliliği sağlıyor.

Bir milyon token neyi öldürür?

Dominique - inline image

Üretim yapay zekasındaki erişim altyapısının çoğu, bir geçici çözüm olarak var olur. Parçalama, gömme, vektör veritabanları, RAG boru hatları: bunların tümü, bir seferde yeterince çalışan bellekte tutamayan modelleri telafi eder.

Bir milyon token varsayılanı değiştirir. Tek bir istemin içine tüm bir kod tabanı gider. Bir yıllık dahili belgeler. Elli video transkripti. Her şey aynı anda dikkat alanında bulunur ve model, alınan parçaları birbirine dikip dikişlerin dayanacağını ummak yerine tüm külliyat üzerinde akıl yürütür.

Yerel görüş, girdi yüzeyini daha da genişletir. Ekran görüntüleri, beyaz tahta fotoğrafları, mimari diyagramlar ve çizelgeler, etraflarındaki kod ve metinle aynı bağlamda okunabilir. K3'ün en güçlü kriter zaferlerini ön uç kodlamada kazanması tesadüf değildir: model, tasarımı görür ve uygulamayı tek bir bağlam penceresi içinde yazar.

Kriterlerden daha önemli olan fiyatlandırma tablosu

Listelenen oranlar: Önbellek isabetinde milyon giriş tokeni başına $0,30, önbellek kaçırmada $3,00, milyon çıkış tokeni başına $15,00, 1.048.576 token bağlamı ile.

Önbellek sayısı bakılması gereken sayıdır. Moonshot, uzun kodlama oturumlarında %90'ın üzerinde önbellek isabet oranı bildiriyor. Bir aracının gerçekte ne yaptığını düşünün: saatlerce aynı depoyu tekrar tekrar okur. Önbellekleme olmadan, her geçişte tam giriş fiyatını öder. Önbellekleme ile uzun bir oturumun maliyeti yaklaşık 4 kat düşer.

Uzun vadeli aracılar tam da bu matematikle yaşar veya ölür. K3, minimum denetimle saatlerce süren, bir depoda gezinme, terminal araçlarını düzenleme, kendi çalışmasını kontrol etme oturumları için üretilmiştir. Fiyatlandırma yapısı ürünün ta kendisidir.

Kimsenin atlamaması gereken püf nokta

K3'ün ekonomi modu yoktur. Akıl yürütme kalıcı olarak açıktır ve maksimumda sabittir. Bağımsız test uzmanları, önemsiz bir SVG talebinde 13.000'den fazla düşünce tokeni yaktığını gördü; bu, tek kullanımlık bir sorgu için kabaca $0,25'tir.

Ders, yönlendirmedir. Hızlı, ucuz, yüksek hacimli çağrılar daha küçük modellere aittir. K3, yalnızca bağlam boyutu ve görev karmaşıklığı her zaman açık akıl yürütmeyi haklı çıkardığında maliyetini çıkarır. Genel amaçlı bir sohbet uç noktası olarak kullanmak parayı ateşe vermektir.

Bağlamak beş dakikanızı alır

API, OpenAI ile uyumludur. base_url ve anahtarı değiştirin, mevcut kodunuzu koruyun:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Kimi K3'ü tek cümlede tanıt."}],
12)
13print(completion.choices[0].message.content)

Akıl yürütme, üst düzey bir alan aracılığıyla yapılandırılır ve şu anda yalnızca "max" değerini kabul eder:

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "2'nin karekökünün irrasyonel olduğunu kanıtla."}],
5)
6print(completion.choices[0].message.content)

Akış, standart şekilde çalışır; akıl yürütme, ayrı bir delta alanında gelir, böylece düşünceyi ve yanıtı bağımsız olarak görüntüleyebilirsiniz:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "Gökyüzünün neden mavi olduğunu açıkla."}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

Görüş girdisi, aynı mesajda metnin yanında base64 kodlu görüntüleri alır. Ekran görüntüsünden koda iş akışının tamamı budur:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "Bu açılış sayfasını HTML ve Tailwind ile yeniden oluştur."},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

Bu, ağırlıklara asla dokunmayan insanlara neden ulaşıyor?

İşte dürüst kısım: neredeyse hiç kimse 2,8 trilyon parametreyi kendi kendine barındırmayacak. Seyreklikle bile, donanım faturası hobi sahibinin menzilinin çok ötesinde ve çoğu şirketin de ötesindedir.

Amaç bu değildi. Kamuya açık ağırlıklar, kapalı laboratuvarların karşılaştırılabilir yetenek için talep edebileceği fiyatlara bir tavan koyar. Üçüncü taraf sunucular, daha önceki her büyük açık sürümde oynanan aynı dinamikle, K3'e emtia marjlarında hizmet vermek için birbirleriyle yarışacak. Tüm pazardaki fiyatlar, açık tabana doğru kayar.

Fayda, hiçbir dosya indirip indirmediğinize bakılmaksızın, halihazırda kullandığınız sağlayıcının faturası aracılığıyla size ulaşır.

Pratik bir oyun kitabı

Ona bütün şeyler verin. İnceleme için eksiksiz depolar, tam sözleşme klasörleri, tüm bir içerik kitaplığı. Artık parçalama gerektirmeyen şeyleri parçalamayı bırakın.

Uzun süre çalıştırın. Çok saatli mühendislik oturumlarını kuyruğa alın ve sonuçları daha sonra kontrol edin. Önbellek, her yeniden okumanın maliyetini karşılar.

Sorunlara bir kamera doğrultun. Bir açılış sayfasının ekran görüntüsünü alın ve yeniden oluşturulmasını isteyin. Bir beyaz tahtanın fotoğrafını çekin ve uygulamasını isteyin.

Önemsiz trafiği ondan uzak tutun. Her zaman maksimumda akıl yürüten bir model, hızlı, yüksek hacimli çağrılar için yanlış araçtır. Bunları başka yere yönlendirin ve K3'ü hak eden işler için saklayın.

On günlük geri sayım

Üç yıl boyunca sınır, sizin belirlemediğiniz şartlarda, uyarı vermeden değişebilecek fiyatlarla kiraladığınız bir şeydi.

27 Temmuz'da bir dosyaya dönüşüyor. Ve bir dosya, bir aboneliğin aksine, sahip olduğunuz bir şeydir.

YouMind’da yeniden üret

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet