Jev 모델: 초보자를 위한 0에서 1까지의 가이드

@ai_xiaomu
중국어2026년 9월 19일
194K
388
67
45
758

TL;DR

Jev는 대화보다는 구조화된 의사결정에 중점을 둔 새로운 AI 모델로, 자동화 작업을 위해 속도, 낮은 비용 및 신뢰성을 제공합니다.

최근 Jev 모델을 보셨을 겁니다. 정확히 무엇일까요?

전혀 말을 하지 않습니다. 채팅도, 문서 작성도, 코딩도 할 수 없습니다.

하지만 이 낯선 존재는 지난 이틀간 AI 커뮤니티에서 폭발적인 관심을 받으며 4,000만 달러의 시드 라운드를 유치했고, 접근 권한을 신청하려는 사람들이 줄을 서고 있습니다.

그렇다면 Jev는 무엇일까요?

黄小木 - inline image

Jev의 탄생

Jev는 샌프란시스코에 위치한 TypeSafe AI라는 회사가 2026년 9월 15일에 출시했습니다.

창업자 Diogo Almeida는 전 OpenAI 연구원으로, RLHF(인간 피드백 기반 강화 학습)의 공동 발명자 중 한 명입니다.

바로 이 방법론 덕분에 차가운 언어 모델이 유창하고 공감 능력 있는 ChatGPT로 변모할 수 있었습니다.

즉, 그는 AI에게 말하기 방법을 가르친 인물 중 한 명입니다.

그런데 AI에게 말을 가르친 그 인물이, 이번에는 말을 거부하는 AI를 만들었습니다.

그의 동기는 단순합니다.

그는 4년간 자신을 괴롭혀 온 질문이 있다고 말했습니다.

모델은 이미 인간보다 채팅 능력이 뛰어난데, 왜 진정한 자동화는 여전히 더딘 걸까?

수조 달러를 투자했지만 일상생활은 크게 변하지 않았고, 대부분의 소프트웨어는 진정한 지능을 갖추지 못했습니다.

Jev란 무엇인가?

ChatGPT 같은 모델들은 유창한 컨설턴트와 같습니다.

무엇이든 답변하고, 참고 자료를 인용하며, 몇 시간이고 대화하고, 높은 EQ를 보여주며 어떤 주제든 다룹니다.

Jev는 다른 종(species)입니다.

마치 생산 라인에서 집중하는 품질 검사원처럼, 재료를 건네면 설명이나 인사, 평론 대신 명확한 판정만 내립니다.

우리가 일상적으로 사용하는 Doubao 같은 모델들은 복잡한 수학 문제를 풀듯 느리고 노력적인 추론을 특징으로 합니다.

반면 Jev는 직관적인 판단을 특징으로 하며, 얼굴 표정만 보고 상대가 화났는지 즉시 알 수 있는 것과 유사합니다.

쉽게 말해: "한눈에 보고, 결과를 얻는다."

黄小木 - inline image

말 많은 챗봇이 병목인 이유

하루에 수백 건의 고객 서비스 메시지를 받는 온라인 매장을 운영한다고 상상해 보세요. AI가 이를 자동으로 분류하길 원합니다: 회계 관련은 회계팀으로, 물류 관련은 물류팀으로, 기술 문제는 기술 팀으로.

단순해 보입니다.

표준 LLM을 사용하면 프로세스는 다음과 같습니다:

1단계: 긴 프롬프트를 작성하여 "이 메시지가 어느 부서에 속하는지 판단해 주세요. 주의: 부서 이름만 답하고 다른 말은 하지 마세요."라고 간청합니다.

2단계: 가끔은 순종적으로 "회계"라고 답해 기쁩니다.

하지만 때로는 참지 못하고, "이 메시지는 주로 회계 문제와 관련되어 보이는군요; 먼저 공제 기록을 확인하신 후..."와 같은 문단을 만들어냅니다. 너무 도와주려다 입이 통제되지 않는 셈입니다.

3단계: 프로그램에서는 장황한 응답에서 키워드 "회계"를 추출하기 위해 추가 로직이 필요합니다. 이 과정은 번잡하고 오류가 발생하기 쉽습니다.

4단계: 가장 중요한 문제: 가끔 환각(hallucination) 현상을 일으킵니다.

세 개의 부서만 설정했는데 네 번째 부서를 반환하거나 존재하지 않는 부서를 만들어낼 수 있습니다. 이것이 바로 '환각'이라고 불리는 현상입니다.

근본 원인은 텍스트가 지나치게 자유롭기 때문입니다.

자유로움은 채팅에는 좋습니다.

어떤 텍스트든 생성할 수 있기 때문에 LLM은 채팅도 하고 시를 쓰고 이야기를 들려줄 수도 있습니다.

하지만 자동화가 필요할 때, 이 자유로움은 악몽이 됩니다.

다음에도 이탈하지 않을 것이라고 절대 보장할 수 없기 때문입니다.

이탈 확률이 1/10,000이라도, 모니터링 없이 자율적으로 실행되는 시스템에 통합할 엄두를 낼 수 없습니다.

黄小木 - inline image

AI가 신뢰할 수 없고, 제어 불가능하며, 예측 불가능하다면 대규모 실제 소프트웨어에 신뢰성 있게 통합될 수 없습니다.

Jev의 해결책: Q&A를 양식 작성으로 전환

Jev는 상호작용 패러다임 자체를 완전히 바꿉니다.

대화를 나누는 것이 아닙니다.

고정된 구조의 양식을 건네면, 정의한 필드의 체크박스를 채우는 역할만 합니다.

호출 시 두 가지가 필요합니다.

첫째, "State": 판단할 재료입니다.

"카드가 두 번 결제됐어요"와 같이 간단한 문장일 수도 있고, 전체 티켓 기록, 고객 서비스 대화, 주문 정보 및 환불 정책이 포함된 구조화된 데이터처럼 복잡할 수도 있습니다.

전문가에게 판단을 요청하기 전에 서류를 테이블 위에 펼쳐 놓듯, 모든 배경 맥락을 한 번에 제시합니다.

둘째, "Question": 무엇을 판단하길 원하는지입니다.

항상 엄격하게 형식이 지정된 답변을 반환합니다.

프로그램에서는 파싱, 클리닝, 추측 없이 직접 사용할 수 있습니다.

결정적으로, 강력한 보장이 있습니다: 형식을 잘못 입력하거나 표 밖의 답변을 하는 것은 수학적으로 불가능합니다.

가능한 모든 답변은 사전에 고정됩니다. 주어진 옵션 중에서만 선택할 수 있으며, 대본을 벗어날 수 없습니다.

따라서 요청한 유형의 답변을 정확히 얻을 수 있어 안정적인 운영의 기반을 마련합니다.

黄小木 - inline image

Jev의 특징

1. 객관식

고객 메시지가 도착합니다: "신발 사이즈를 잘못 받았는데, 10호로 교환 가능한가요?" "이건 어느 팀으로 보내야 하나요?"라는 질문과 함께 옵션: 반품, 물류, 회계를 제공합니다.

명확하게 "반품"이라고 답합니다. 각 옵션에 대한 신뢰 점수도 제공합니다. 메시지가 명확하므로 반품일 확률은 거의 100%이며, 나머지는 거의 0에 가깝습니다.

메시지가 "신발 사이즈가 틀렸고, 신용카드에 미스터리한 추가 청구가 있는데 어떻게 할 거예요?"로 바뀌면 덜 깔끔해집니다.

이 경우 이렇게 말할 수 있습니다: 반품일 가능성 60%, 회계일 가능성 40%. Jev는 확실한 척하지 않으며, 자신의 망설임을 솔직하게 보여줍니다.

2. 평가 척도

버그 리포트가 도착합니다. 3점 척도를 제공합니다:

0: 외관상의 결함, 사용에는 영향 없음;

1: 기능 고장, 그러나 우회 경로(workaround) 존재;

2: 완전히 막힘, 사용 불가.

"1.3"이라는 값을 반환할 수 있습니다.

1.3은 버그가 대부분 '기능 고장이나 우회 경로가 있는' 범주에 속하지만 '완전히 막힘' 쪽으로 약간 기울어져 있음을 의미합니다. 이는 1과 2 사이에서 강제로 이분법적 선택을 하는 것보다 더 정밀하며 현실에 더 가깝습니다.

척도를 정의할 때는 정도(degree)가 아닌 구체적인 상황(specific situations)을 묘사해야 합니다.

"기능 고장이지만 우회 경로가 있음"이라고 쓰면 잘 작동합니다; 이는 자료와 비교하기 때문입니다.

하지만 "중간 심각도(Medium severity)"라고 쓰면 실패합니다. '중간'은 모호하고 기준점이 없기 때문입니다.

마찬가지로 0, 1, 2라는 숫자 자체는 무시합니다. SOP를 통해 각 수준이 무엇을 포함하는지 명확히 정의해야 합니다.

3. 참/거짓 판단

0에서 1 사이의 확률 점수와 함께 예/아니오로 답합니다.

"이 고객이 환불을 요청하고 있나요?"라고 물어보세요.

0.99를 반환하면 거의 확실히 '예'라는 뜻입니다.

한 번의 호출로 여러 질문을 병렬로 수행할 수 있습니다:

어느 팀인지(객관식), 고객의 분노 정도(평가), 환불 요청 여부(참/거짓), 어조가 격앙되었는지(참/거짓), 주문이 배송되지 않았는지(참/거짓).

이들은 동시에, 독립적으로, 병렬로 답변됩니다.

질문을 추가해도 응답 시간이 거의 증가하지 않습니다.

이는 반직관적인 코딩 습관을 만듭니다: 공식적으로 최대한 많은 질문을 하도록 권장됩니다.

해당 메시지에 대해 가능한 모든 판단을 한 번에 물어보세요. 지금 사용하지 않더라도 추가 시간이나 비용 부담은 미미합니다.

이는 표준 LLM에서의 '토큰 절약' 사고방식과는 정반대입니다.

자기 평가(Self-Assessment)

표준 LLM에는 치명적인 결함이 있습니다: 아는지 모르는지와 관계없이 항상 자신감 있게 답한다는 점입니다.

자동화에는 치명적입니다.

예시:

AI가 95%의 정확도를 보인다고 해서 괜찮은 게 아닙니다. 나머지 5%에서 실패하는지 모른다면 자동화할 수 없기 때문입니다.

Jev는 모든 답변에 '신뢰도(confidence)' 점수를 첨부합니다. 이를 통해 모델이 실제로 이해했는지 파악할 수 있습니다.

신뢰도 점수가 있으면 인간과 유사한 처리 로직을 설계할 수 있으며, 일반적으로 세 단계로 나뉩니다:

높은 신뢰도: 자동 처리, 인간 개입 불필요.

중간 신뢰도: 신중한 접근, 인간 확인 또는 추가 정보 수집 필요.

낮은 신뢰도: 억지로 진행하지 마세요. 인간이나 더 강력하고 비싼 추론 모델로 라우팅하세요. 모델은 명시적으로 "이건 제 능력을 넘어서요, 무리하지 마세요"라고 말합니다.

확실할 때만 행동하고, 그렇지 않을 때는 불확실성을 인정하는 이 메커니즘은 자동화 시스템을 신뢰하기 위한 전제 조건입니다.

"모르겠다"고 말하는 AI가 항상 자신감 있는 AI보다 훨씬 더 신뢰할 수 있습니다.

黄小木 - inline image

비용 효율성

Jev는 유사한 LLM 대비 약 200배 빠르고 약 400배 저렴합니다.

단일 응답 시간은 70~500ms로, 눈 깜짝할 새보다 빠릅니다.

왜 그럴까요? Jev는 말을 할 필요가 없기 때문입니다.

이 가격 구조는 이전에 생각지도 못했던 사용 사례를 가능하게 합니다.

대규모 데이터베이스를 항목별로 필터링하고 모든 것에 태그를 달 수 있습니다. LLM으로는 비용이 감당되지 않아 불가능했던 작업입니다.

UI에 임베드하여 실시간 반응이 가능합니다. 충분히 빨라 사용자가 지연을 느끼지 않기 때문입니다.

黄小木 - inline image

Jev 사용법

문제 정의

크고 모호한 질문을 던지지 마세요. 작고 구체적인 질문으로 분해한 후, 프로그래밍 방식으로 답변을 조합하세요.

예시:

스팸 메일을 탐지하려면, 게으른 방법은 "이게 스팸인가요?"라고 묻는 것입니다.

이는 크고 모호합니다.

여러 판단을 하나의 흐릿한 답변 뒤에 숨겨 불투명하고 조정 불가능하게 만듭니다.

대신 "이게 스팸인가요?"를 작고 명확한 판단들로 분해하세요:

로그인 자격 증명을 요구하는가?

응모하지 않은 경품에 당첨되었다고 주장하는가?

긴급성을 조성하는가("지금 행동하지 않으면 기회를 잃습니다")?

발신자가 주장하는 기관이 이메일 도메인과 일치하는가?

링크 대상이 표시된 텍스트와 일치하는가?

각 하위 질문은 매우 구체적이어서 모호성의 여지가 거의 없습니다. 그런 다음 코드에서 이러한 답변에 가중치를 부여하여 최종 스팸 위험 점수를 계산합니다.

Jev는 통제 불가능한 블랙 박스가 아니라, 상식적인 판단을 내리는 새로운 빌딩 블록이 되고자 합니다.

시나리오 정의

사용 사례는 실질적이며, 종종 수동 검토의 노동을 대체합니다.

고객 서비스:

티켓 자동 라우팅, 환불 요청 탐지, 우선 케어가 필요한 분노한 고객 식별, 통화 로그에서 후속 조치 항목 추출.

콘텐츠 모더레이션:

스팸, 학대, 사기, 개인정보 유출을 자동으로 플래깅. 심각도 등급화: 가벼운 경고 vs 계정 정지. 이 작업은 인간에게 소모적이고 정신적으로 고통스럽습니다.

채용 및 영업:

하드 기준에 따른 이력서 점수화, 후보자 경험과 직무 매칭, 영업 리드 자격 검증.

다른 AI의 QA:

Jev를 사용하여 다른 LLM의 출력을 점검하세요: 이탈했는가? 젤브레이크(jailbroken) 되었는가? 인용문이 조작되었는가? 도구 파라미터가 정확한가?

Jev는 빠르고 저렴하므로, 메인 모델과 비교했을 때 QA 비용은 푼돈 수준입니다. 비싼 AI에 품질 게이트를 추가하는 셈입니다.

빅데이터 클리닝:

방대한 문서, 댓글, 채팅을 빠르게 태깅, 분류, 필터링. Jev의 비용 구조만이 이런 규모를 실현 가능하게 합니다.

결론

아직 혼란스럽다면 이것만 기억하세요:

Jev는 저렴하고, 빠르며, 채팅은 안 하지만 판단을 돕습니다.

지능의 비용이 한 자릿수(order of magnitude)만큼 떨어지면, 사용 사례는 지수적으로 폭발합니다. 이것은 당신에게 기회입니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기