Modello Jev: Guida per principianti da zero a uno

194K
388
67
45
758

TL;DR

Jev è un nuovo modello AI progettato per il processo decisionale strutturato anziché per la conversazione, offrendo velocità, costi bassi e affidabilità per le attività di automazione.

Hai probabilmente visto il modello Jev di recente. Cos'è?

Non parla affatto. Non può chattare con te, scrivere documenti o programmare.

Eppure questa strana creatura è esplosa nella community dell'IA negli ultimi due giorni, raccogliendo un round seed da 40 milioni di dollari, con persone in fila per richiedere l'accesso.

Quindi, cos'è Jev?

黄小木 - inline image

La nascita di Jev

Jev proviene da una società di San Francisco chiamata TypeSafe AI, rilasciata il 15 settembre 2026.

Il suo fondatore, Diogo Almeida, è un ex ricercatore di OpenAI e uno dei co-inventori di RLHF (Reinforcement Learning from Human Feedback).

È stato questo metodo a trasformare i freddi modelli linguistici nell'articolato ed empatico ChatGPT.

In altre parole, era una delle persone che hanno insegnato all'IA come parlare.

Ora, la persona che ha insegnato all'IA a parlare ha costruito un'IA che si rifiuta di parlare.

La sua motivazione è semplice.

Ha detto che una domanda lo tormentava da quattro anni:

I modelli hanno superato gli umani nel chiacchierare, quindi perché c'è ancora così poca vera automazione?

Abbiamo investito trilioni di dollari, ma la vita quotidiana non è cambiata molto e la maggior parte del software non è davvero intelligente.

Cos'è Jev?

I modelli simili a ChatGPT sono come consulenti eloquenti.

Rispondono a qualsiasi cosa tu chieda, citano riferimenti, chiacchierano per ore, hanno un alto QI emotivo e gestiscono qualsiasi argomento.

Jev è una specie diversa.

È come un ispettore di qualità concentrato su una linea di montaggio: gli dai del materiale e, invece di spiegare, salutare o commentare, ti dà un giudizio netto.

Modelli come Doubao che usiamo quotidianamente presentano un ragionamento lento e faticoso, simile alla risoluzione di complessi problemi matematici.

Jev presenta un giudizio intuitivo, come sapere istantaneamente se qualcuno è arrabbiato solo guardando la sua faccia.

In parole povere: "Uno sguardo, ottieni il risultato."

黄小木 - inline image

Perché i chatbot chiacchieroni sono il collo di bottiglia

Immagina di gestire un negozio online che riceve centinaia di messaggi di assistenza clienti ogni giorno. Vuoi che l'IA li instradi automaticamente: contabilità alla contabilità, logistica alla logistica, problemi tecnici al tecnico.

Sembra semplice.

Se usi un LLM standard, il processo appare così:

Passo 1: Scrivi un lungo prompt supplicandolo: "Per favore, giudica a quale dipartimento appartiene questo messaggio. Nota, rispondi solo con il nome del dipartimento, non dire nient'altro."

Passo 2: A volte risponde obbedientemente "Contabilità", e sei felice.

Ma a volte non riesce a trattenersi, rispondendo con un paragrafo tipo: "Questo messaggio sembra riguardare principalmente questioni di contabilità; suggerisco di verificare prima i registri delle detrazioni, poi..." Si impegna troppo ad aiutare e non riesce a controllare la bocca.

Passo 3: Il tuo programma ha bisogno di logica extra per estrarre la parola chiave "Contabilità" da quella risposta verbosa. Questo processo è disordinato e soggetto a errori.

Passo 4: Il problema più critico: occasionalmente allucina.

Imposti tre dipartimenti, ma potrebbe restituirne un quarto o inventarne uno inesistente. Questo è noto come "allucinazione".

La causa principale è che il testo è troppo libero.

La libertà è buona per chattare.

Poiché può generare qualsiasi testo, gli LLM possono chattare, scrivere poesie e raccontare storie.

Ma quando hai bisogno di automazione, questa libertà diventa un incubo.

Non puoi mai garantire che non devierà la prossima volta.

Anche se la probabilità di deviazione è 1 su 10.000, non osi incorporarlo in un sistema non monitorato per funzionare autonomamente.

黄小木 - inline image

Se l'IA è inaffidabile, incontrollabile e imprevedibile, non può essere fidata né integrata su larga scala nel software reale.

La soluzione di Jev: Trasformare le domande e risposte in compilazione di moduli

Jev cambia completamente il paradigma di interazione.

Non conversi con esso.

Gli consegni un modulo a struttura fissa e lui spunta semplicemente le caselle nei campi che hai definito.

Ogni chiamata richiede due cose.

Primo, lo "Stato": il materiale da giudicare.

Può essere semplice come una frase, es. "La mia carta è stata addebitata due volte." O complesso, come un record completo di ticket, un dialogo di assistenza clienti o dati strutturati con informazioni sull'ordine e politiche di rimborso.

Disponi tutto il contesto di sfondo in una volta sola, come spargere file su un tavolo prima di chiedere un giudizio agli esperti.

Secondo, la "Domanda": cosa vuoi che giudichi.

Restituisce sempre una risposta formattata rigorosamente.

Il tuo programma la usa direttamente senza dover analizzare, pulire o indovinare.

Crucialmente, c'è una garanzia assoluta: è matematicamente impossibile che compili il formato in modo errato o dia una risposta fuori dalla tabella.

Tutte le possibili risposte sono bloccate in anticipo. Può solo scegliere tra le opzioni fornite da te e non può uscire dallo script.

Quindi ottieni esattamente il tipo di risposta che hai richiesto, fornendo una base per un funzionamento stabile.

黄小木 - inline image

Caratteristiche di Jev

1. Scelta multipla

Arriva un messaggio del cliente: "Ho ricevuto la taglia sbagliata delle scarpe, posso cambiarle con la taglia 10?" Chiedi: "A quale team dovrebbe andare?" Opzioni: Resi, Logistica, Contabilità.

Rispondi nettamente "Resi". Fornisce anche punteggi di confidenza per ogni opzione. Poiché il messaggio è chiaro, è quasi sicuro al 100% che siano Resi, con quasi zero per gli altri.

Se il messaggio diventa "Taglia sbagliata, e sulla mia carta di credito c'è un addebito misterioso extra, cosa farete?", è meno pulito.

Potrebbe dire: 60% probabile Resi, 40% probabile Contabilità. Jev non finge di essere certo; mostra onestamente la sua esitazione.

2. Scala di valutazione

Arriva una segnalazione di bug. Fornisci una scala a 3 punti:

0: Difetto cosmetico, nessun impatto sull'uso;

1: Funzione rotta, ma esiste una soluzione alternativa;

2: Completamente bloccato, inutilizzabile.

Potrebbe restituire "1.3".

1.3 significa che il bug rientra principalmente nella categoria "funzione rotta con soluzione alternativa" ma tende leggermente verso "completamente bloccato". Questo è più preciso che forzare una scelta binaria tra 1 e 2, più vicino alla realtà.

Quando definisci le scale, descrivi situazioni specifiche, non gradi.

Scrivere "Funzione rotta ma esiste una soluzione alternativa" funziona bene; confronta questo contro il materiale.

Ma scrivere "Gravità media" fallisce perché "Media" è vaga senza punto di riferimento.

Allo stesso modo, ignora i numeri 0, 1, 2 stessi. Devi definire chiaramente cosa comporta ogni livello tramite SOP.

3. Giudizio Vero/Falso

Risponde sì/no con un punteggio di probabilità da 0 a 1.

Chiedi: "Questo cliente sta richiedendo un rimborso?"

Restituisce 0.99, il che significa quasi certamente sì.

Puoi porre più domande in parallelo in una singola chiamata:

Quale team (Scelta multipla), Quanto è arrabbiato il cliente (Valutazione), È una richiesta di rimborso (Vero/Falso), Il tono è furioso (Vero/Falso), L'ordine non è stato spedito (Vero/Falso).

Queste vengono risposte simultaneamente, indipendentemente e in parallelo.

Aggiungere più domande aumenta appena il tempo di risposta.

Questo porta a un'abitudine di programmazione controintuitiva: ufficialmente incoraggiato a porre quante più domande possibile.

Chiedi tutti i potenziali giudizi per quel messaggio in una volta sola. Anche se alcuni non sono usati ora, costa poco tempo o denaro extra.

Questo è opposto alla mentalità di "risparmio token" con gli LLM standard.

Auto-valutazione

Gli LLM standard hanno un difetto: rispondono con sicurezza sia che sappiano sia che no.

Questo è fatale per l'automazione.

Esempio:

Un'IA che ha ragione il 95% delle volte sembra ok. Ma se non sai perché fallisce nel restante 5%, non puoi automatizzarla.

Jev allega un punteggio di "confidenza" a ogni risposta. Usi questo per valutare se il modello capisce realmente.

Con i punteggi di confidenza, progetti una logica di gestione simile a quella umana, tipicamente in tre livelli:

Alta confidenza: Elaborazione automatica, nessun umano necessario.

Confidenza media: Approccio cauto, forse conferma umana o raccolta di più info.

Bassa confidenza: Non forzarlo. Instrada a un umano o a un modello di ragionamento più forte/costoso. Dice esplicitamente: "Questo è oltre me, non spingermi."

Questo meccanismo—agire solo quando certi, ammettere incertezza altrimenti—è il prerequisito per fidarsi dei sistemi automatizzati.

Un'IA che dice "Non lo so" è di gran lunga più affidabile di una che è sempre sicura.

黄小木 - inline image

Efficienza dei costi

Jev è circa 200x più veloce e circa 400x più economico rispetto agli LLM comparabili.

Una singola risposta richiede 70-500ms, più veloce di un battito di ciglia.

Perché? Perché Jev non deve parlare.

Questa tariffazione sblocca casi d'uso precedentemente impensabili.

Puoi filtrare enormi database elemento per elemento, taggando tutto. Fare questo con gli LLM era proibitivo in termini di costi.

Puoi integrarlo nelle UI per reazioni in tempo reale perché è abbastanza veloce da far sentire agli utenti zero latenza.

黄小木 - inline image

Come usare Jev

Definisci il problema

Non porre domande grandi e vaghe. Scomponile in piccole e specifiche, poi combina le risposte programmaticamente.

Esempio:

Per rilevare email spam, il modo pigro è chiedere: "Questo è spam?"

Questo è grande e ambiguo.

Nasconde più giudizi dietro una risposta sfocata, rendendolo opaco e non regolabile.

Invece, scomponi "Questo è spam?" in piccoli giudizi chiari:

Chiede credenziali di accesso?

Afferma che hai vinto un premio a cui non hai partecipato?

Crea urgenza ("Agisci ora o perdi")?

L'istituzione dichiarata dal mittente corrisponde al dominio dell'email?

La destinazione del link corrisponde al testo visualizzato?

Ogni sotto-domanda è estremamente specifica, lasciando poco spazio all'ambiguità. Poi, pesa queste risposte nel tuo codice per calcolare un punteggio finale di rischio spam.

Jev mira a essere un nuovo blocco costruttivo con giudizio di buon senso, non una scatola nera incontrollata.

Definisci gli scenari

I casi d'uso sono concreti, spesso sostituendo la noiosa revisione manuale.

Assistenza Clienti:

Instradamento automatico dei ticket, rilevamento richieste di rimborso, identificazione clienti arrabbiati che necessitano priorità, estrazione elementi di follow-up dai log delle chiamate.

Moderazione Contenuti:

Segnalazione automatica di spam, abusi, frodi, violazioni della privacy. Valutazione della gravità: avvisi leggeri vs ban. Questo lavoro è esaustivo e mentalmente drenante per gli umani.

Recruiting & Vendite:

Punteggiatura dei CV contro criteri rigidi, corrispondenza esperienza candidato/ruolo, qualificazione lead di vendita.

QA per altre IA:

Usa Jev per controllare l'output di un altro LLM: Ha deviato? È stato jailbroken? Le citazioni sono fabbricate? I parametri degli strumenti sono corretti?

Poiché Jev è veloce ed economico, usarlo per QA costa centesimi rispetto al modello principale. Aggiunge una porta di qualità per l'IA costosa.

Pulizia Big Data:

Taggare, classificare e filtrare rapidamente海量 documenti, chat, commenti. Solo la struttura dei costi di Jev rende fattibile questa scala.

Conclusione

Se sei ancora confuso, ricorda questo:

Jev è economico, veloce, non chatta, ma ti aiuta a prendere decisioni.

Mentre il costo dell'intelligenza scende di un ordine di grandezza, i casi d'uso esplodono esponenzialmente. Queste sono opportunità per te.

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali