Ciao amici, sono Jin Chenma.
Iniziamo con una domanda: in termini di contenuti che elaborano, quali sono i tipi comuni di grandi modelli AI che incontriamo solitamente?
La maggior parte delle persone ha familiarità con testo, immagini, audio e video. Negli ultimi anni, vari fornitori hanno continuamente competere e iterato in queste direzioni, rendendo le capacità più potenti e la concorrenza più feroce.
Dopo aver visto così tanti aggiornamenti, mi chiedevo: oltre a rendere più forti i modelli esistenti, emergeranno nuove forme di modello?
Di recente, un modello chiamato Jev è diventato virale. All'inizio ho pensato: è solo un'altra azienda che rilascia un nuovo grande modello linguistico?
Ma dopo aver approfondito, ho trovato questo modello davvero impressionante.
Dietro di esso, TypeSafe AI ha proposto una classe di modelli chiamati System One Models, progettati specificamente per compiti di giudizio nel software. Jev è il loro primo modello pubblico.
Le categorie precedenti (testo, immagine, audio, video) erano divise per tipo di contenuto; questa volta, hanno cambiato l'angolo: prendendo "prendere decisioni" come un compito autonomo e progettando un modello attorno ad esso.
Penso che questa direzione potrebbe avere un impatto profondo sul futuro sviluppo e sulla divisione del lavoro nei modelli AI.
In questo articolo, spiegherò chiaramente cos'è Jev, come differisce dagli LLM standard, dove può essere utilizzato e come iniziare.
Partendo dall'analogia del codice QR
Come capire Jev? Immagina di voler generare un codice QR.
Normalmente, useresti uno strumento generatore di codici QR. Ma supponiamo che tu abbia assunto un artista capace di disegnare qualsiasi cosa, chiedendogli di disegnare il codice QR pixel per pixel.
Naturalmente, questo artista è abile e può farlo. Ma generare un codice QR ha strumenti dedicati. Hai bisogno solo di un codice QR funzionante, non di un paesaggio dipinto insieme ad esso.

Allo stesso modo, confrontando Jev con i Large Language Models:
Gli LLM possono scrivere articoli, codice e discutere problemi complessi. Se chiedi a un LLM di leggere un commento e giudicare il sentimento dell'utente, certamente può farlo.
Ma se il compito richiede solo una scelta o un punteggio, considera: possiamo creare un modello più veloce, più economico e accessibile programmaticamente specificamente per tali compiti?
Questo è esattamente ciò che fa Jev.
Rinuncia alla generazione di testo libero per specializzarsi in giudizi con ambiti di risposta chiari. Ad esempio, se fornisci quattro opzioni—"Soddisfatto", "Insoddisfatto", "Misto", "Indeterminato"—seleziona una e fornisce probabilità per ogni opzione.
Proprio come i codici QR hanno strumenti dedicati, i compiti che richiedono solo scelte e punteggi possono essere gestiti da modelli specializzati. Secondo le introduzioni ufficiali, l'ottimizzazione di Jev per questi compiti di giudizio riduce il tempo di risposta e i costi di chiamata.
Ad esempio, filtrare massicci commenti di e-commerce quotidianamente richiede di giudicare sentimento, urgenza e metodi di gestione. Giudizi più veloci ed economici riducono i tempi di attesa complessivi e i costi. I programmi ricevono i risultati e procedono con la classificazione o il passaggio a umani.
L'origine di Jev
Chi ha creato Jev? Perché costruire un modello esclusivamente per il giudizio?
Jev proviene da TypeSafe AI, fondata da Diogo Almeida, che in precedenza ha lavorato sulla ricerca sui modelli di chat presso OpenAI.
Si è concentrato su un problema: l'AI è bravissima a chattare, ma perché non è facile integrare queste capacità nel software per compiti automatizzati?
Il software eccelle nell'eseguire regole esplicite. Se la condizione A è soddisfatta, fai l'azione B. Ma molti giudizi reali sono difficili da pre-definire con regole.
Come leggere i commenti. Quali espressioni sono reclami? Quali sono scherzi? Quali sembrano positive ma contengono critiche nascoste? È difficile coprire tutti gli schemi di discorso degli utenti con poche regole.
TypeSafe vuole rendere il giudizio semantico un componente richiamabile. Quando un programma deve capire il testo o scegliere il prossimo passo, delega questo piccolo compito al modello, ottiene il risultato e continua l'esecuzione.
Chiamano questi modelli System One, prendendo in prestito dal concetto in Thinking, Fast and Slow. Pensalo come la parte di giudizio veloce e intuitiva.
Il nome Jev deriva dall'economista Jevons. L'aspettativa del team è semplice: più basso è il costo delle chiamate intelligenti, più posti le persone li utilizzeranno.
Alcuni passaggi precedentemente sembravano troppo costosi per una singola chiamata AI. Se il giudizio è abbastanza veloce ed economico, diventa degno di essere rivalutato.
Come differisce Jev dagli LLM?
Rendere le chiamate software per il giudizio AI più economiche e facili è un buon punto di partenza. Ma gli LLM esistenti possono anche giudicare e restituire risultati strutturati. Perché costruire Jev?
Prima, vediamo come gli LLM consegnano i risultati del giudizio ai programmi.
Gli LLM supportano l'output strutturato, il che significa che le risposte si adattano a slot predefiniti. Ad esempio, uno slot per il sentimento, un altro per l'urgenza, un altro per il metodo di gestione. Il programma sa cosa rappresenta ogni posizione.
Potresti conoscere JSON, un formato comune per dati strutturati. Gli sviluppatori possono vincolare gli output degli LLM a seguire formati specifici.
Quindi, guardando solo se l'output finale è testo o JSON, non rivela la principale differenza tra Jev e gli LLM.
La differenza sta nel modo in cui il modello genera il risultato.
Gli LLM generativi standard tipicamente producono risposte token per token. I token sono piccoli frammenti di testo elaborati dal modello. Anche se richiedi dati a formato fisso, di solito genera il risultato passo dopo passo.
Jev usa un metodo di output specializzato per compiti di giudizio, fornendo giudizi multipli e probabilità in parallelo. Puoi fare diverse domande sullo stesso commento e ottenere tutti i risultati in una richiesta.
Questa differenza di output riguarda la velocità e il costo menzionati prima. Il software che elabora enormi quantità di dati quotidianamente incorre in costi significativi anche per piccoli passi. Gli Agenti, che chiamano strumenti ed eseguono compiti continui, devono decidere ripetutamente il prossimo passo. La velocità di risposta e il costo della chiamata influenzano direttamente il design del software, le spese operative e l'esperienza utente. Alcuni passaggi precedentemente saltati a causa della lentezza o dell'alto costo possono ora includere il giudizio AI.
C'è anche la stabilità dell'output. Definiamo un set di opzioni, e restituisce risultati entro quell'ambito, facilitando l'elaborazione del programma a valle.
Tre nuove funzionalità di Jev
Il cuore di Jev risiede in tre nuove funzionalità. La loro logica di progettazione è interessante e vale la pena esaminarla.
In breve, Choice fa selezioni dalle opzioni date; Score assegna valutazioni basate su criteri; Noul giudica la probabilità che un'affermazione sia vera.
Qui, userò il Playground ufficiale per dimostrare queste funzionalità con un esempio pratico.
Usiamo l'elaborazione dei commenti di e-commerce. Supponiamo che tu gestisca un negozio online che riceve recensioni dei clienti quotidiane. Devi misurare la soddisfazione, identificare i problemi che necessitano di follow-up, determinare i metodi di gestione e dare priorità ai casi urgenti.
Invieremo questo commento a Jev:
"Il prodotto è buono, ma la spedizione ha richiesto dieci giorni, e il servizio clienti non ha risposto."
Useremo le tre funzionalità per giudicare questo commento e vedere i risultati.
Choice: Fare selezioni
Prima, chiedi: Qual è il sentimento generale?
Opzioni fornite: Soddisfatto, Insoddisfatto, Misto, Indeterminato.
Risultato: "Misto".
Questo è facile da capire. L'utente loda il prodotto ma si lamenta della logistica e del servizio. Scegliere solo "Soddisfatto" o "Insoddisfatto" perde parte del significato.
Similmente, possiamo chiedere: Come dovrebbe essere gestito questo commento successivamente?
Opzioni: "Passaggio a umano," "Risposta automatica," "Nessuna risposta necessaria." Regola aggiunta: Le lamentele irrisolte sul servizio richiedono follow-up umano.
Risultato: "Passaggio a umano".
Nota, il contenuto della domanda a scelta multipla può variare. Sentimento, dipartimento, prossima azione—tutto può essere inquadrato in questo modo. Le opzioni sono fornite da noi; Jev giudica in base al materiale e ai requisiti.

Score: Assegnare valutazioni
Poi, chiedi: Quanto è urgente questo commento? Con quale rapidità dobbiamo fare follow-up?
Prima di assegnare il punteggio, definisci gli standard. Tre livelli impostati qui:
- 0: Recensione generale o semplice inquiry, senza lamentele irrisolte.
- 1: Lamento irrisolto sulla logistica o sul servizio, ma senza problemi di sicurezza, perdite maggiori o scadenze strette.
- 2: Problemi espliciti di sicurezza, perdite maggiori o scadenze strette.
Jev restituisce 1, indicando urgenza media secondo questo standard.
I punteggi dipendono fortemente dagli standard forniti. Puoi passare a valutare la qualità della risposta o la rilevanza, ma devi definire cosa costituisce bene o male.
Può anche restituire punteggi frazionari tra i livelli, non solo interi.

Noul: Giudicare la verità delle affermazioni
Infine, dai un'affermazione:
"L'utente ha esplicitamente richiesto un rimborso nel commento."
Questo tipo restituisce una probabilità tra 0 e 1, rappresentando la probabilità che l'affermazione sia vera.
Risultato: 0.03 (3%).
L'utente è scontento, ma non ha chiesto esplicitamente un rimborso. Quindi, il modello dà una bassa probabilità a "richiesta esplicita di rimborso".

Guardando tutti i risultati restituiti insieme chiarisce il quadro:

Queste quattro domande sono state inviate insieme, producendo tutti i risultati in una volta. L'API ha riportato un tempo di valutazione del modello di circa 85 millisecondi.
Ora, il programma ha informazioni utilizzabili: categoria di sentimento, obiettivo di routing, livello di priorità, intenzione di rimborso. L'elaborazione può continuare in base a questi risultati.
Per cosa può essere usato Jev?
Abbiamo elaborato un commento. Su una piattaforma di e-commerce con volumi giornalieri massicci, questo uso si espande ulteriormente.
Primo, statistiche.
Quali utenti sono soddisfatti? Chi si lamenta della logistica? Quali problemi necessitano di servizio clienti? Il modello giudica il significato; il programma aggrega i conteggi e visualizza le categorie.
Secondo, filtraggio iniziale per decidere cosa necessita di elaborazione più profonda.
Le recensioni generali vanno alle statistiche. Gli elementi che non richiedono risposta saltano le risposte individuali. I problemi irrisolti vanno agli umani. Le risposte automatiche adatte alla generazione LLM vengono passate a modelli più grandi con contesto.
Precedentemente, avere un LLM generale costoso schermare tutto prima comportava alti costi iniziali. Ora, Jev gestisce lo screening frontale, lasciando l'elaborazione profonda agli LLM.
Può funzionare il filtraggio per parole chiave?
Parzialmente, ma le parole chiave mancano di contesto.
Esempio:
"La qualità è davvero ottima, è caduto a pezzi dopo un giorno."
Corrispondere a "qualità ottima" classifica erroneamente questo come positivo. Leggere l'intera frase rivela sarcasmo.
Jev prende ancora input in linguaggio naturale e capisce il significato completo. La sua specializzazione è nel tipo di compito e nel formato di output, non solo nella corrispondenza delle parole chiave.
Trasformare i risultati in azioni richiede programmi esterni.
Restituire "passaggio a umano", il programma mette in coda per revisione manuale. Restituire "risposta automatica", il programma chiama un LLM per generare la risposta. Le azioni sono eseguite da regole di workflow e strumenti.
Negli Agenti, questo sistema esterno che organizza chiamate di modelli, strumenti e workflow è spesso chiamato Harness. Jev si adatta alle posizioni di giudizio all'interno dell'Harness, aiutando a scegliere i prossimi passi.
Pertanto, credo che Jev e gli LLM siano complementari, non mutualmente esclusivi.
Specificamente, sostituisci gli LLM con Jev per classificazione e punteggio. Più tardi, per scrivere copy, codice o ragionamenti complessi multi-step, affidati agli LLM.
Così, un sistema può usare diversi modelli per diverse fasi, combinando capacità organicamente.

Come provare Jev?
Il modo più diretto è aprire TypeSafe Playground.
Accedi, metti il testo da analizzare in State (materiale per il giudizio). Imposta le domande in Questions, seleziona il tipo di giudizio, riempi le opzioni o i criteri di punteggio, clicca Run per vedere i risultati.
Prova il commento precedente o scambia con una recensione positiva per osservare i cambiamenti.
Per integrarlo nel tuo software, usa l'API.
L'API permette a un software di esporre capacità per un altro. Ottieni una API Key dalla console. Il tuo programma invia materiali e domande con questa credenziale, riceve i risultati ed esegue la logica successiva.
Sono forniti anche SDK ufficiali, che avvolgono funzioni di interfaccia comuni per comodità dello sviluppatore.
Prezzi: $0.042 per milione di token di input, output gratuito. L'input include materiali, domande e criteri. Il filtraggio di commenti ad alto volume può usare questo modello pay-per-call nei flussi esistenti.
Il futuro dei modelli di giudizio specializzati
Dopo aver studiato Jev, ero impressionato: qualcuno avrebbe dovuto farlo molto tempo fa, ma nessuno l'ha fatto.
Penso che questo approccio sia corretto. Mentre tutti gareggiano per aumentare le prestazioni dei grandi modelli, TypeSafe AI ha aperto una nuova pista, creando modelli personalizzati per dati strutturati, giudizio probabilistico, selezione e scenari decisionali.
I benefici di costo e velocità sono amichevoli per gli Agenti. Aspettare che i grandi modelli restituiscano lentamente i dati è inefficiente in alcuni contesti.
Credo che altri fornitori seguiranno probabilmente questa tendenza, costruendo modelli specializzati per le fasi di giudizio degli Agenti.
Un Agente può avere modelli per giudizio veloce, altri per pensiero complesso/scrittura/codice, più modelli di immagine/audio/video, lavorando insieme.
Quando il giudizio è abbastanza veloce ed economico, possiamo posizionare l'AI in più posti precedentemente ritenuti non degni della chiamata. Per me, questa è la parte più emozionante della direzione di Jev.





