Kimi K3 ha appena decretato la fine dell'era degli abbonamenti AI

@0xDominiqq
INGLESE3 giorni fa · 18 lug 2026
275K
83
12
4
176

TL;DR

Kimi K3 di Moonshot AI introduce un modello open-weight da 2,8 trilioni di parametri con una finestra di contesto da un milione di token, sfruttando la tecnologia Mixture-of-Experts e meccanismi di attenzione innovativi per abbattere i costi e sfidare il predominio delle API chiuse.

Il numero principale non è la storia

Il 27 luglio, Moonshot AI pubblica i pesi completi di Kimi K3 sotto una licenza MIT modificata. La scheda tecnica è un'ostentazione: 2,8 trilioni di parametri, una finestra di contesto di un milione di token e il titolo di modello open-weight più grande mai rilasciato, circa il 75% più grande di DeepSeek V4 Pro.

Ma la dimensione è un'esca. La vera storia è uno spostamento in chi controlla l'accesso all'intelligenza di frontiera. Per tre anni, i migliori modelli sono vissuti dietro un'API. Pagavi un affitto, il proprietario stabiliva le condizioni, e se il fornitore ritariffava l'endpoint o cambiava silenziosamente il comportamento del modello, il tuo prodotto assorbiva il danno.

I pesi aperti rompono quell'accordo. Una volta che i file sono pubblici, nessun laboratorio può riprendersi la capacità. Questo singolo fatto cambia l'economia per tutti, comprese le persone che non scaricheranno mai un singolo shard.

La scheda tecnica a colpo d'occhio

Specifica

Valore

Parametri

2,8 trilioni

Esperti

896 totali, 16 attivi per token

Finestra di contesto

1.048.576 token

Licenza

MIT modificata

Rilascio dei pesi

27 luglio

Dimensioni vs DeepSeek V4 Pro

~75% più grande

Efficienza di scaling vs K2

~2,5x

Prezzi

Tariffa

Input (cache hit)

$0,30 / 1M token

Input (cache miss)

$3,00 / 1M token

Output

$15,00 / 1M token

Come un modello da 2,8T evita un conto da 2,8T

Un modello denso di queste dimensioni sarebbe inutilizzabile. Eseguire ogni parametro su ogni token è il muro che tutti i modelli su scala trilione incontrano: troppo lento, troppo costoso, nessun modo per aggirare la fisica.

K3 lo aggira con un design Mixture-of-Experts aggressivo. All'interno del modello vivono 896 sottoreti specializzate. Su ogni dato token, solo 16 di esse si attivano. Ottieni la conoscenza memorizzata di 2,8 trilioni di parametri pagando il costo di inferenza di un modello di una frazione di quella dimensione.

Questa è la scarsità (sparsity), e K3 ci punta più di qualsiasi altro modello open prima di esso. K2 ha dimostrato che l'approccio funzionava. K3 lo trasforma nella scommessa centrale.

Dominique - inline image

Due articoli di ricerca che hanno fatto il lavoro pesante

Due cambiamenti architetturali rendono possibile il resto, ed entrambi sono stati pubblicati come ricerca aperta prima che il modello fosse rilasciato, il che ha fatto guadagnare a Moonshot credibilità tra i ricercatori prima ancora che apparisse un singolo benchmark.

Il primo è Kimi Delta Attention, un meccanismo di attenzione lineare ibrido. I costi dell'attenzione standard crescono in modo quadratico man mano che il contesto si allunga, motivo per cui le finestre da un milione di token di solito rimangono nelle presentazioni di marketing. KDA scala in modo diverso, e quella differenza è l'unica ragione per cui esiste una finestra da 1M a un prezzo che chiunque possa effettivamente pagare.

Il secondo è Attention Residuals, un sostituto per le connessioni residue standard. Moonshot lo accredita dei guadagni di scaling coerenti, permettendo loro di costruire modelli più profondi senza il solito degrado. Secondo i loro stessi numeri, la combinazione offre circa 2,5 volte l'efficienza di scaling di K2.

Cosa uccidono un milione di token

Dominique - inline image

La maggior parte dell'infrastruttura di recupero nell'IA in produzione esiste come soluzione alternativa. Frammentazione, embeddings, database vettoriali, pipeline RAG: tutto questo compensa modelli che non possono contenere abbastanza nella memoria di lavoro contemporaneamente.

Un milione di token cambia le impostazioni predefinite. Un intero codebase entra in un singolo prompt. Un anno di documenti interni. Cinquanta trascrizioni video. Tutto siede nell'attenzione simultaneamente, e il modello ragiona sull'intero corpus invece di cucire insieme frammenti recuperati e sperare che le cuciture tengano.

La visione nativa amplia ulteriormente la superficie di input. Screenshot, foto di lavagne, diagrammi architetturali e grafici sono leggibili nello stesso contesto del codice e del testo che li circonda. Non è un caso che i più forti successi di benchmark di K3 siano arrivati nel coding front-end: il modello vede il design e scrive l'implementazione all'interno di una finestra di contesto.

La tabella dei prezzi che conta più dei benchmark

Le tariffe elencate: $0,30 per milione di token di input in caso di cache hit, $3,00 in caso di cache miss, $15,00 per milione di token di output, con un contesto di 1.048.576 token.

Il numero della cache è quello da fissare. Moonshot riporta tassi di cache hit superiori al 90% in sessioni di coding lunghe. Pensa a cosa fa effettivamente un agente: rilegge lo stesso repository più e più volte per ore. Senza cache, paga il prezzo intero dell'input su ogni passaggio. Con essa, il costo di una sessione lunga crolla di circa 4 volte.

Gli agenti a lungo orizzonte vivono o muoiono esattamente su questa matematica. K3 è costruito per sessioni che durano ore con supervisione minima, navigando un repo, orchestrando strumenti da terminale, controllando il proprio lavoro. La struttura dei prezzi è il prodotto.

Il problema che nessuno dovrebbe ignorare

K3 non ha una modalità economica. Il ragionamento è permanentemente attivo e fissato al massimo. I tester indipendenti lo hanno visto bruciare oltre 13.000 token di pensiero per una richiesta SVG banale, circa $0,25 per una query usa e getta.

La lezione è il routing. Le chiamate veloci, economiche e ad alto volume appartengono a modelli più piccoli. K3 guadagna il suo costo solo quando la dimensione del contesto e la complessità del compito giustificano un ragionamento sempre attivo. Usarlo come endpoint di chat generico è come dare fuoco ai soldi.

Collegarlo richiede cinque minuti

L'API è compatibile con OpenAI. Sostituisci base_url e chiave, mantieni il tuo codice esistente:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],
12)
13print(completion.choices[0].message.content)

Il ragionamento viene configurato tramite un campo di primo livello, che attualmente accetta solo "max":

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "Prove that the square root of 2 is irrational."}],
5)
6print(completion.choices[0].message.content)

Lo streaming funziona in modo standard, con il ragionamento che arriva in un campo delta separato, così puoi renderizzare il pensiero e la risposta in modo indipendente:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "Explain why the sky is blue."}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

L'input visivo accetta immagini codificate in base64 insieme al testo nello stesso messaggio. Questo è il flusso di lavoro da screenshot a codice nella sua interezza:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "Rebuild this landing page in HTML and Tailwind."},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

Perché questo raggiunge persone che non toccano mai i pesi

Ecco la parte onesta: quasi nessuno ospiterà da sé 2,8 trilioni di parametri. Anche con la scarsità, il conto hardware è ben oltre la portata degli hobbisti, e anche oltre la maggior parte delle aziende.

Non è mai stato questo il punto. I pesi pubblici mettono un tetto a ciò che i laboratori chiusi possono addebitare per capacità comparabili. Gli host di terze parti si faranno gara per servire K3 a margini di commodity, la stessa dinamica che si è verificata con ogni importante rilascio open prima di esso. I prezzi in tutto il mercato tendono verso la linea di base aperta.

Il beneficio ti raggiunge attraverso la fattura del fornitore che già usi, che tu scarichi o meno un file.

Un manuale pratico

Alimentalo con cose intere. Repository completi per la revisione, intere cartelle di contratti, un'intera libreria di contenuti. Smetti di frammentare ciò che non richiede più frammentazione.

Eseguilo a lungo. Metti in coda sessioni di ingegneria di più ore e controlla i risultati più tardi. La cache assorbe il costo di ogni rilettura.

Punta una fotocamera sui problemi. Fai uno screenshot di una landing page e chiedi la ricostruzione. Fotografa una lavagna e chiedi l'implementazione.

Tieni il traffico banale lontano da esso. Un modello che ragiona sempre al massimo è lo strumento sbagliato per chiamate veloci e ad alto volume. Instradale altrove e riserva K3 per il lavoro che lo merita.

Il conto alla rovescia di dieci giorni

Per tre anni, la frontiera è stata qualcosa che affittavi, a condizioni che non stabilivi tu, a prezzi che potevano cambiare senza preavviso.

Il 27 luglio diventa un file. E un file, a differenza di un abbonamento, è qualcosa che possiedi.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali