YouMind
로그인

Jev 모델 해설: 빠르고 저렴한 의사결정을 위한 새로운 AI

@jinchenma_ai
중국어2026년 9월 20일
123K
237
32
17
355

TL;DR

Jev는 TypeSafe AI가 분류 및 점수 매기기 같은 판단 작업에 특화하여 설계한 새로운 AI 모델로, 에이전트 워크플로우에서 LLM보다 더 빠르고 저렴한 대안을 제공합니다.

안녕하세요, 진천마입니다.

먼저 질문 하나를 드려볼게요. 우리가 흔히 접하는 대형 AI 모델들은 처리하는 콘텐츠 기준으로 어떤 유형으로 나뉠까요?

대부분 텍스트, 이미지, 오디오, 비디오에 익숙하실 겁니다. 지난 몇 년간 다양한 벤더들이 이 방향에서 끊임없이 경쟁하고 기술을迭代하며 성능은 점점 더 강력해지고 경쟁은 치열해졌습니다.

이런 업데이트를 많이 지켜보면서 저는 계속 궁금했습니다. 기존 모델을 더 강하게 만드는 것 외에 새로운 형태의 모델이 등장할 수 있을까?

최근 Jev라는 모델이 화제가 되었습니다. 처음에는 '또 다른 회사가 새 대형 언어 모델을 출시했나?'라고 생각했습니다.

하지만 깊이 파고들어 보니 이 모델은 정말 인상적이었습니다.

이 모델의 배경에는 TypeSafe AI가 있습니다. 이들은 소프트웨어 내 판단 작업을 위해 특별히 설계된 System One Models라는 클래스의 모델을 제안했으며, Jev는 그들의 첫 공개 모델입니다.

기존 분류(텍스트, 이미지, 오디오, 비디오)는 콘텐츠 유형에 따라 나뉘었지만, 이번에는 관점을 바꾸어 '판단'을 독립적인 작업으로 보고 이를 중심으로 모델을 설계했습니다.

저는 이 방향성이 향후 AI 모델의 발전과 분업에 심오한 영향을 미칠 수 있다고 생각합니다.

이 글에서는 Jev가 무엇인지, 표준 LLM과 어떻게 다른지, 어디서 사용할 수 있는지, 그리고 어떻게 시작할 수 있는지를 명확히 설명하겠습니다.

QR 코드 비유로 시작하기

Jev를 어떻게 이해해야 할까요? QR 코드를 생성한다고 상상해 보세요.

보통은 QR 코드 생성 도구를 사용합니다. 하지만 만약 무엇이든 그릴 수 있는 아티스트를 고용하여 픽셀 단위로 QR 코드를 그려달라고 한다고 가정해 봅시다.

물론 이 아티스트는 실력이 뛰어나서 해낼 수 있을 것입니다. 하지만 QR 코드 생성에는 전용 도구가 있습니다. 우리는 풍경화 같은 예술 작품이 아니라 기능적인 QR 코드가 필요할 뿐입니다.

金尘马 - inline image

마찬가지로 Jev와 대형 언어 모델(LLM)을 비교해 보면 다음과 같습니다.

LLM은 기사 작성, 코딩, 복잡한 문제 논의 등을 수행할 수 있습니다. LLM에게 댓글을 읽고 사용자의 감정을 판단하라고 요청하면 분명히 해낼 수 있습니다.

하지만 작업이 단순히 선택이나 점수 매기기만 요구한다면 이렇게 생각해 볼 수 있습니다. 이런 작업을 위해 더 빠르고 저렴하며 프로그래밍 방식으로 접근 가능한 전용 모델을 만들 수 있지 않을까요?

바로 이것이 Jev가 하는 일입니다.

Jev는 자유 형식 텍스트 생성을 포기하고, 명확한 답변 범위를 가진 판단 작업에 특화되었습니다. 예를 들어 "만족", "불만", "복합적", "판단 불가"라는 네 가지 옵션을 제공하면, 그중 하나를 선택하고 각 옵션에 대한 확률을 반환합니다.

QR 코드에 전용 도구가 있듯, 선택과 점수 매기기만 필요한 작업은 전문화된 모델로 처리할 수 있습니다. 공식 소개에 따르면, Jev는 이러한 판단 작업을 최적화하여 응답 시간과 호출 비용을 줄여줍니다.

예를 들어, 매일 방대한 양의 전자 상거래 댓글을 필터링하려면 감정, 긴급성, 처리 방법을 판단해야 합니다. 더 빠르고 저렴한 판단은 전체 대기 시간과 비용을 줄여줍니다. 프로그램은 결과를 받아 분류하거나 인간 상담원에게 인계하는 절차를 진행합니다.

Jev의 기원

누가 Jev를 만들었을까요? 왜 오직 판단만을 위한 모델을 구축했을까요?

Jev는 TypeSafe AI에서 개발했으며, 이 회사는 OpenAI에서 챗봇 모델 연구를 담당했던 Diogo Almeida가 설립했습니다.

그는 한 가지 문제에 집중했습니다. AI는 대화에는 탁월하지만, 왜 이러한 기능을 소프트웨어에 통합하여 자동화 작업을 수행하기는 어려운 걸까?

소프트웨어는 명시적 규칙 실행에 능숙합니다. 조건 A가 충족되면 동작 B를 수행하는 식이죠. 하지만 현실 세계의 많은 판단은 규칙으로 사전 정의하기 어렵습니다.

댓글 읽기 같은 경우가 그렇습니다. 어떤 표현이 불만인가요? 어떤 것이 농담인가요? 겉으로는 긍정적으로 보이지만 숨겨진 비판이 담긴 경우는요? 몇 가지 규칙으로 모든 사용자 발화 패턴을 커버하기는 어렵습니다.

TypeSafe는 의미 기반 판단을 호출 가능한 컴포넌트로 만들고자 했습니다. 프로그램이 텍스트를 이해하거나 다음 단계를 선택해야 할 때, 이 작은 작업을 모델에 위임하고 결과를 받아 실행을 이어가는 방식입니다.

이들은 이러한 모델을 System One이라고 부르며, 《생각에 관한 생각(Thinking, Fast and Slow)》의 개념에서 차용했습니다. 빠르고 직관적인 판단 부분을 떠올리면 됩니다.

Jev라는 이름은 경제학자 제본스(Jevons)에서 유래했습니다. 팀의 기대는 단순명료합니다. 지능형 호출 비용이 낮아질수록 사람들은 더 많은 곳에서 이를 사용할 것이라는 점이죠.

이전에는 단일 AI 호출 비용이 너무 높아 생략하던 단계들도 있었습니다. 판단이 충분히 빠르고 저렴해진다면, 다시 고려해 볼 가치가 생깁니다.

Jev는 LLM과 어떻게 다를까?

소프트웨어가 AI 판단을 호출하는 비용을 절감하고 쉽게 만드는 것은 좋은 출발점입니다. 하지만 기존 LLM도 판단을 수행하고 구조화된 결과를 반환할 수 있습니다. 그렇다면 왜 굳이 Jev를 만든 걸까요?

먼저 LLM이 프로그램을 위해 판단 결과를 전달하는 방식을 살펴보겠습니다.

LLM은 구조화된 출력을 지원하며, 이는 답변이 미리 정의된 슬롯에 맞춰진다는 뜻입니다. 예를 들어 감정용 슬롯, 긴급성용 슬롯, 처리 방법용 슬롯 등이 있으며, 프로그램은 각 위치가 무엇을 의미하는지 알고 있습니다.

JSON이라는 구조화된 데이터의 일반적인 형식을 아실 수도 있습니다. 개발자는 LLM 출력 특정 형식을 따르도록 제약할 수 있습니다.

따라서 최종 출력이 텍스트냐 JSON이냐만 봐서는 Jev와 LLM의 주요 차이점을 파악할 수 없습니다.

차이는 모델이 결과를 생성하는 방식에 있습니다.

표준 생성형 LLM은 일반적으로 토큰 단위로 답변을 생성합니다. 토큰은 모델이 처리하는 텍스트의 작은 조각입니다. 고정 형식의 데이터를 요청하더라도 보통 단계별로 결과를 생성합니다.

Jev는 판단 작업을 위해 특수한 출력 방식을 사용하며, 병렬로 여러 판단과 확률을 제공합니다. 동일한 댓글에 대해 여러 질문을 하고 한 번의 요청으로 모든 결과를 얻을 수 있습니다.

이러한 출력 방식의 차이는 앞서 언급한 속도와 비용과 관련이 있습니다. 매일 대량의 데이터를 처리하는 소프트웨어는 작은 단계라도 상당한 비용이 발생합니다. 도구를 호출하고 연속적인 작업을 실행하는 에이전트는 다음 단계를 반복적으로 결정해야 합니다. 응답 속도와 호출 비용은 소프트웨어 설계, 운영 비용, 사용자 경험에 직접적인 영향을 미칩니다. 이전에는 느리거나 비용이 높아 건너뛰던 단계에도 이제 AI 판단을 포함시킬 수 있게 되었습니다.

출력 안정성도 중요합니다. 옵션 세트를 정의하면 해당 범위 내에서 결과를 반환하므로 하위 프로그램 처리가 용이합니다.

Jev의 3가지 새로운 기능

Jev의 핵심은 세 가지 새로운 기능에 있습니다. 이들의 설계 로직은 흥미롭고 살펴볼 가치가 있습니다.

간단히 말해, Choice는 주어진 옵션 중 선택을 수행하고; Score는 기준에 따라 등급을 매기며; Noul은 문장이 참일 확률을 판단합니다.

여기서는 공식 Playground를 사용하여 실제 예제로 이러한 기능들을 시연하겠습니다.

전자 상거래 댓글 처리를 예로 들어보겠습니다. 온라인 매장을 운영하며 매일 고객 리뷰를 받는다고 가정해 봅시다. 만족도를 측정하고, 후속 조치가 필요한 문제를 식별하며, 처리 방법을 결정하고, 긴급한 사례를 우선순위화해야 합니다.

다음 댓글을 Jev에 제출하겠습니다.

"제품은 좋지만 배송에 열흘이 걸렸고, 고객센터는 답장이 없었어요."

세 가지 기능을 사용해 이 댓글을 판단하고 결과를 확인해 보겠습니다.

Choice: 선택 수행

먼저 질문합니다. 전반적인 감정은 무엇인가요?

제공된 옵션: 만족, 불만, 복합적, 판단 불가.

결과: "복합적."

이해하기 쉽습니다. 사용자는 제품을 칭찬했지만 물류와 서비스에 대해서는 불만을 표했습니다. "만족"이나 "불만" 중 하나만 선택하면 의미가 일부 손실됩니다.

마찬가지로 이렇게 물어볼 수도 있습니다. 이 댓글은 다음에 어떻게 처리해야 하나요?

옵션: "인간 상담원에게 인계", "자동 답변", "답변 불필요". 추가 규칙: 해결되지 않은 서비스 불만은 인간 후속 조치가 필요합니다.

결과: "인간 상담원에게 인계."

다중 선택 질문의 내용은 다양할 수 있다는 점에 주목하세요. 감정, 부서, 다음 행동 등 모두 이러한 방식으로 구성할 수 있습니다. 옵션은 우리가 제공하며, Jev는 자료와 요구 사항에 따라 판단합니다.

金尘马 - inline image

Score: 등급 매기기

다음으로 질문합니다. 이 댓글의 긴급성은 어느 정도인가요? 얼마나 빨리 후속 조치를 해야 하나요?

채점 전에 기준을 정의합니다. 여기서는 세 가지 수준을 설정했습니다.

  • 0: 일반적인 리뷰나 단순 문의이며, 해결되지 않은 불만이 없음.
  • 1: 해결되지 않은 물류 또는 서비스 불만이 있지만, 안전 문제, 주요 손실, 마감 기한 압박은 없음.
  • 2: 명시적인 안전 문제, 주요 손실, 또는 마감 기한 압박이 있음.

Jev는 1을 반환하며, 이 기준에 따라 중간 수준의 긴급성을 나타냅니다.

점수는 제공한 기준에 크게 의존합니다. 답변 품질이나 관련성 평가로 전환할 수도 있지만, 무엇이 좋고 나쁜지 반드시 정의해야 합니다.

정수뿐만 아니라 수준 사이의 소수 점수도 반환할 수 있습니다.

金尘马 - inline image

Noul: 문장 진위 판단

마지막으로 문장을 제시합니다.

"사용자가 댓글에서 환불을 명시적으로 요청했다."

이 유형은 0과 1 사이의 확률을 반환하며, 문장이 참일 가능성을 나타냅니다.

결과: 0.03 (3%).

사용자는 불만족스러워했지만 환불을 명시적으로 요청하지는 않았습니다. 따라서 모델은 "명시적 환불 요청"에 낮은 확률을 부여합니다.

金尘马 - inline image

반환된 모든 결과를 함께 보면 상황이 명확해집니다.

金尘马 - inline image

네 가지 질문이 함께 제출되어 한 번에 모든 결과를 얻었습니다. API는 모델 평가 시간이 약 85 밀리초라고 보고했습니다.

이제 프로그램은 유용한 정보를 확보했습니다. 감정 카테고리, 라우팅 대상, 우선순위 수준, 환불 의도. 이러한 결과를 바탕으로 처리를 계속할 수 있습니다.

Jev는 어디에 사용할 수 있을까?

우리는 하나의 댓글을 처리했습니다. 일일 트래픽이 방대한 전자 상거래 플랫폼에서는 이 사용법이 더욱 확장됩니다.

첫째, 통계 분석.

어떤 사용자가 만족했나요? 누가 물류에 대해 불만하나요? 어떤 문제가 고객 서비스를 필요로 하나요? 모델은 의미를 판단하고, 프로그램은 카운트를 집계하고 카테고리를 표시합니다.

둘째, 더 깊은 처리가 필요한 항목을 결정하기 위한 초기 필터링.

일반적인 리뷰는 통계로 넘어갑니다. 답변이 필요 없는 항목은 개별 답변을 생략합니다. 해결되지 않은 문제는 인간 상담원에게 전달됩니다. LLM 생성에 적합한 자동 답변은 컨텍스트와 함께 더 큰 모델로 전달됩니다.

이전에는 비싼 일반 LLM이 모든 것을 먼저 스크리닝하도록 하여 초기 비용이 높았습니다. 이제 Jev가 프런트엔드 스크리닝을 처리하고, 심층 처리는 LLM에 맡깁니다.

키워드 필터링으로 가능하지 않나요?

부분적으로는 가능합니다. 하지만 키워드는 맥락을 놓칩니다.

예시:

"품질이 정말 훌륭해요, 하루 만에 망가졌지만요."

"훌륭한 품질"과 일치시키면 이를 긍정적으로 잘못 분류할 수 있습니다. 문장 전체를 읽어보면 아이러니함이 드러납니다.

Jev는 여전히 자연어 입력을 받아 전체 의미를 이해합니다. 그 특화는 키워드 매칭만이 아닌 작업 유형과 출력 형식에 있습니다.

결과를 행동으로 전환하려면 외부 프로그램이 필요합니다.

"인간 상담원에게 인계"가 반환되면 프로그램은 수동 검토 대기열에 넣습니다. "자동 답변"이 반환되면 프로그램은 LLM을 호출하여 답변을 생성합니다. 행동은 워크플로우 규칙과 도구에 의해 실행됩니다.

에이전트에서 모델 호출, 도구, 워크플로우를 조직하는 이러한 외부 시스템을 종종 Harness라고 부릅니다. Jev는 Harness 내의 판단 위치에 적합하며, 다음 단계를 선택하는 데 도움을 줍니다.

따라서 저는 Jev와 LLM이 상호 배타적이지 않고 보완적이라고 믿습니다.

구체적으로, 분류 및 채점에는 LLM 대신 Jev를 사용합니다. 이후 카피라이팅, 코딩, 복잡한 다단계 추론에는 LLM에 의존합니다.

이렇게 하면 시스템은 단계별로 다른 모델을 사용하여 역량을 유기적으로 결합할 수 있습니다.

金尘马 - inline image

Jev를 어떻게 체험할 수 있을까?

가장 직접적인 방법은 TypeSafe Playground를 여는 것입니다.

로그인하고, 분석할 텍스트를 State(판단 자료)에 넣습니다. Questions에서 질문을 설정하고, 판단 유형을 선택한 후, 옵션이나 채점 기준을 입력하고 Run을 클릭하여 결과를 봅니다.

이전 댓글을 시도해 보거나 긍정적인 리뷰로 교체하여 변화를 관찰해 보세요.

소프트웨어에 통합하려면 API를 사용하세요.

API는 한 소프트웨어가 다른 소프트웨어에 기능을 노출할 수 있게 합니다. 콘솔에서 API Key를 발급받으세요. 프로그램은 이 자격 증명으로 자료와 질문을 보내고, 결과를 받아 후속 로직을 실행합니다.

개발자 편의를 위해 일반적인 인터페이스 함수를 래핑한 공식 SDK도 제공됩니다.

가격 정책: 입력 토큰 백만 개당 $0.042, 출력은 무료입니다. 입력에는 자료, 질문, 기준이 포함됩니다. 대량 댓글 필터링은 기존 흐름에서 이 종량제 모델을 활용할 수 있습니다.

전문 판단 모델의 미래

Jev를 조사한 후 저는 감탄했습니다. 누군가는 오래전에 이것을 했어야 했지만 아무도 하지 않았다는 점이죠.

저는 이 접근 방식이 옳다고 생각합니다. 모두가 대형 모델 성능 향상에 열을 올리는 동안, TypeSafe AI는 새로운 트랙을 열어 구조화된 데이터, 확률적 판단, 선택, 의사결정 시나리오를 위한 맞춤형 모델을 만들었습니다.

비용과 속도 이점은 에이전트에게 친화적입니다. 대형 모델이 천천히 데이터를 반환하는 것을 기다리는 것은 일부 컨텍스트에서 비효율적입니다.

다른 벤더들도 이 트렌드를 따라 Agent 판단 단계를 위한 전문 모델을 구축할 가능성이 높다고 믿습니다.

에이전트는 빠른 판단용 모델, 복잡한 사고/작성/코딩용 모델, 이미지/오디오/비디오 모델을 모두 갖추고 협력할 수 있습니다.

판단이 충분히 빠르고 저렴해지면, 이전에 호출 비용이 너무 높아 가치 없다고 여겨졌던 곳에 AI를 배치할 수 있습니다. 저에게는 이것이 Jev 방향성의 가장 흥분되는 부분입니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기