며칠 동안 인터넷을 서핑했다면, AI 커뮤니티를 뒤흔들고 있는 새로운 AI 모델인 Jev 를 접했을 가능성이 높습니다. Jev 는 전통적인 LLM 이 아닙니다. 텍스트 작성이 아닌 의사결정을 위해 설계되었습니다. 지난 며칠간 Jev 에 대해 깊이 있게 살펴본 결과, 저는 이 열풍이 실재하며 제품 개발자에게 엄청난 잠재력이 있다고 진심으로 믿습니다.
제가 이전에 언급했듯이, 비기술적 직종에 종사하는 사람들도 AI 기술의 작동 원리를 이해하는 것이 매우 중요합니다. 에이전트 시스템의 작동 방식을 이해하면 자신의 제품에 기술을 신중하게 적용할 수 있습니다.
Jev 에 관한 모든 자료를 읽었음에도 여전히 그것이 무엇인지 이해하지 못했다고 호소하는 사람들이 여러 명 있었습니다. 그래서 이 글은 그들을 위한 것입니다. 일반 대중(Jev 에 익숙하지 않은 사람들)을 위한 가이드입니다. 지금까지 Jev 에 대해 읽은 모든 내용이 질문만 남겼다면, 이 글은 다를 것입니다. 끝까지 읽으면 Jev 가 무엇인지, LLM 과 어떻게 다른지, 그리고 자신이 만드는 제품에 이를 어떻게 적용할 수 있는지에 대한 기초적인 이해를 갖게 될 것입니다.
소프트웨어에서 의사결정의 중요성
소프트웨어는 의사결정으로 가득 차 있습니다. 이 고객 메시지는 긴급한 처리가 필요한가요? 이 결제는 사기인가요? 페이지를 영어로 렌더링해야 하나요, 아니면 프랑스어로 해야 하나요?
제품은 하루에 수백만 번 이러한 결정을 내려야 할 수도 있습니다.
하지만 컴퓨터가 내릴 수 있는 의사결정의 복잡성에는 한계가 있습니다. 위의 질문들은 간단한 규칙으로 답변할 수 있습니다. 예를 들어, 사용자의 언어 설정이나 IP 주소를 기반으로 페이지를 영어 또는 프랑스어로 렌더링할지 결정할 수 있습니다. 하지만 모든 질문이 그렇게 간단하지는 않습니다.
예를 들어 핫도그 사진을 생각해 보세요. 어떤 간단한 규칙 집합으로도 컴퓨터가 제 사진에 실제로 핫도그가 포함되어 있는지 식별할 수는 없습니다.
그래서 컴퓨터 과학자들은 컴퓨터가 더 복잡한 결정을 내리도록 하는 새로운 방법을 고안했습니다: 머신러닝(Machine Learning). 깔끔한 알고리즘과 핫도그가 포함된 수많은 사진 예시를 결합하면, 컴퓨터가 핫도그가 포함된 사진을 꽤 능숙하게 식별할 수 있다는 사실이 밝혀졌습니다.

GIF
우리의 핫도그 모델은 분류기(Classifier)라고 불리는 모델 유형입니다. 사물을 분류하기 때문에 이렇게 부릅니다. 오늘날 소프트웨어에서는 복잡한 의사결정을 내리기 위해 분류기를 광범위하게 사용합니다.
하지만 분류기의 문제는 학습된 도메인 밖에서는 일반화되지 않는다는 점입니다. 핫도그 사진을 식별할 수 있는 제 분류기는 사기 거래를 식별하는 데 도움이 되지 않을 것입니다. 또한 분류기를 학습시키는 데 필요한 데이터와 전문 지식 때문에 컴퓨터가 해결할 수 없는 많은 유형의 문제들이 존재했습니다. 그러다...
대규모 언어 모델(Large Language Model)
OpenAI 가 2022 년 11 월 ChatGPT 를 출시했을 때 전 세계를 뒤흔들었습니다. ChatGPT 가 그렇게 인기 있었던 이유는 순수한 지능 때문이 아니라, 일반화 능력 때문이었습니다.
ChatGPT 는 핫도그와 사기 거래에 대해 동시에 대화할 수 있을 정도로 세상에 대한 기초적인 이해력을 갖추고 있었습니다.
ChatGPT, Claude, Grok, Kimi 와 같은 대규모 언어 모델(LLM)의 주요 기능은 텍스트 생성입니다. 하지만 이러한 모델을 사용해 본 사람들은 그들이 사고하고, 추론하며, 궁극적으로 의사결정을 내릴 수 있다는 것을 압니다. 예를 들어, LLM 이 특정 이미지가 핫도그인지 여부를 판단하는 방식은 다음과 같습니다.

GIF
네, 대규모 언어 모델은 의사결정을 내릴 수 있습니다. 그리고 다양한 지식 영역에 걸쳐 결정을 내릴 수 있습니다.
LLM 이 성배(Holy Grail)일까요? 우리는 마침내 오늘날 소프트웨어의 의사결정에 적용할 수 있는 범용 의사결정 모델을 갖게 된 걸까요?
실용적으로는 그렇지 않습니다. LLM 은 놀라운 능력을 가지고 있지만, 상대적으로 느리고 비쌉니다. 대부분의 소프트웨어 애플리케이션 유형에 사용하기에는 너무 느리고 비용이 많이 듭니다.
넓은 범위의 일반 지식 영역에서 빠르고 저렴하게 의사결정을 내릴 수 있는 모델이 있다면 좋았을 텐데...
일반화되는 분류기, Jev 소개
Jev 는 텍스트 생성보다는 의사결정에 최적화된 새로운 클래스의 모델입니다.
Jev 는 분류기처럼 상대적으로 빠르고 저렴한 동시에 LLM 처럼 일반화되는 특성을 유지합니다. 주장에 따르면 Jev 는 동등한 LLM 보다 20-200 배 빠르고 40-400 배 저렴합니다.
이는 Jev 가 LLM 처럼 토큰 단위로 답변을 반환하지 않고 단순히 의사결정 결과를 반환하기 때문입니다.
엔지니어들이 이에 대해 흥분하는 이유가 바로 이것입니다. Jev 가 이전에는 볼 수 없었던 수준의 지능을 제공하는 것이 아니라, 이전에는 볼 수 없었던 수준의 지능이 이토록 빠르고 저렴하게 작동한다는 점이 중요합니다.
Jev 와 채팅할 수 없습니다. 이는 챗봇이 아닙니다. Jev 는 입력으로 다음 세 가지를 기대합니다:
- 답하고 싶은 질문
- 해당 질문에 대한 가능한 답변 세트
- 질문에 답하기 위해 필요한 컨텍스트 (Jev 는 이를 "state" 라고 부름)
그러면 Jev 는 다음과 같은 출력을 제공합니다:
- 선택된 답변
- 그 답변이 정확할 확률
끝입니다. 채팅은 없고, 오직 의사결정만 있습니다.
Jev 는 세 가지 유형의 의사결정을 지원합니다:
- Yes/No, Jev 는 이를 "Noul" 이라고 부릅니다: 문장이 참일 것으로 추정되는 확률을 반환합니다
- Choice: 최대 255 개의 객관식 옵션 중에서 선택하며 각 옵션이 정답일 확률을 제공합니다
- Score: 2 단계부터 10 단계까지의 척도로 무언가를 평가합니다
이러한 선택 사항들은 기존 방식보다 훨씬 적은 시간과 비용으로 고급 의사결정을 가능하게 합니다. 각 유형에 대한 예를 살펴보겠습니다.
Noul (Yes/No)
새로운 핫도그 가게를 오픈했고, 고객 피드백이 들어올 때마다 검토하여 적절히 대응하거나 반응하고 싶다고 가정해 봅시다.
각 리뷰에 대해 먼저, 그 리뷰가 음식에 대한 불만인지라는 간단한 질문을 던져 보겠습니다. Jev 에 대한 입력은 다음과 같이 보일 수 있습니다.
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "food_complaint": {6 "type": "noul",7 "instructions": "Does this review express dissatisfaction with the food itself?",8 "criteria": {9 "true": "Complains about the taste, temperature, or quality of the food.",10 "false": "Does not complain about the food. Complaints only about queues or service do not count."11 }12 }13 }14}
답변하고자 하는 질문("instructions"), Yes 또는 No 를 선택해야 하는 기준, 그리고 Jev 가 정확한 의사결정을 내리는 데 필요한 state 를 정의한 것을 볼 수 있습니다.
따라서 위 질문을 Jev 에게 전달합니다. 그러면 Jev 는 다음과 같이 출력합니다.
1{2 "answers": {3 "food_complaint": {4 "type": "noul",5 "noul": 0.046 }7 }8}
Jev 는 이 특정 피드백이 음식에 대한 불만일 확률이 불과 4% 라고 판단합니다. 따라서 이 리뷰를 우선순위가 낮은 것으로 분류하고 시간이 날 때 후속 조치를 취할 수 있습니다.
Choice
Jev 에게 피드백을 카테고리로 분류하도록 요청하여 각 피드백 항목을 조금 더 자세히 이해해 봅시다. Jev 에 대한 요청은 다음과 같이 보일 수 있습니다.
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "main_topic": {6 "type": "choice",7 "instructions": "What is the main topic of this review? Select the option that best captures its primary focus.",8 "criteria": {9 "queue": "Queue length or waiting time is the main focus.",10 "food": "The taste, temperature, or quality of the food is the main focus.",11 "service": "Staff friendliness, helpfulness, or how they handled the order is the main focus. Comments only about waiting time belong under queue.",12 "other": "The main focus is something other than food, waiting time, or staff service."13 }14 }15 }16}
Jev 가 선택할 수 있는 각 옵션과 언제 그 옵션을 사용해야 하는지에 대한 설명("criteria")을 정의했습니다. Jev 는 다음과 같이 반환합니다.
1{2 "answers": {3 "main_topic": {4 "type": "choice",5 "choice": "queue",6 "probabilities": {7 "queue": 0.80,8 "food": 0.15,9 "service": 0.03,10 "other": 0.0211 },12 "confidence": 0.6013 }14 }15}
좋습니다. Jev 는 "queue" 를 답변으로 선택했습니다. 또한 각 선택지에 확률을 부여하는 것을 볼 수 있습니다.
Score
이제 Jev 로 하여금 핫도그 가게에서의 전반적인 경험에 대해 고객이 얼마나 만족하는지를 정의된 5 단계로 평가해 보겠습니다.
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "overall_satisfaction": {6 "type": "score",7 "instructions": "How satisfied is this customer with their overall experience? Consider both positive and negative comments.",8 "criteria": [9 "Very dissatisfied: strongly negative about the experience overall.",10 "Dissatisfied: mostly negative, despite any positives.",11 "Mixed: meaningful positives and negatives, with neither clearly dominating.",12 "Satisfied: mostly positive, despite some complaints.",13 "Very satisfied: strongly positive, with no meaningful complaints."14 ]15 }16 }17}
다시 한번 명확한 질문, 가능한 답변 세트, 그리고 state 를 제공합니다. Jev 는 다음과 같이 반환합니다.
1{2 "answers": {3 "overall_satisfaction": {4 "type": "score",5 "score": 2.1,6 "probabilities": {7 "0": 0.05,8 "1": 0.15,9 "2": 0.50,10 "3": 0.25,11 "4": 0.0512 }13 }14 }15}
4 점 만점에 2.1 점, 개선의 여지가 있네요.
Jev 의 마법은 LLM 보다 훨씬 빠르고 저렴하게 이러한 의사결정을 내릴 수 있다는 점입니다. 여기 우리의 핫도그 가게에 남겨진 60 개의 피드백 항목을 검토할 때 Jev(왼쪽)와 LLM(gpt-5.6 Luna, 오른쪽)을 나란히 비교한 결과가 있습니다.

Jev 의 속도와 비용 우위는 소프트웨어를 통해 의사결정을 내리는 장벽을 낮춥니다.
Jev 적용하기
사용자를 위한 결과를 개선하기 위해 의사결정을 내릴 수 있는 제품 내 모든 곳에서 Jev 적용을 고려해 보세요. 몇 가지 예시는 다음과 같습니다.
무언가가 참인지 거짓인지 아는 것이 조치 변경으로 이어질 수 있는 곳이라면 어디든 Yes/No 를 사용하세요.
- 이 고객의 메시지가 구독 취소를 암시하나요?
- 이 공급업체 업데이트는 배송이 마감일을 놓칠 것임을 시사하나요?
- 이 학생의 설명은 다루어야 할 오해를 드러내나요?
- 이 회의록에는 아무도 소유자로 지정되지 않은 약속이 포함되어 있나요?
- 이 플레이어의 메시지는 막혀서 힌트가 필요함을 시사하나요?
옵션 세트에서 선택하는 것이 다음 행동을 결정할 수 있는 곳이라면 어디든 Choice 를 사용하세요.
- 이 특이한 고객 요청은 어떤 전문가 팀이 처리해야 하나요?
- 이 사용자가 달성하려는 목표와 가장 잘 맞는 제품 튜토리얼은 무엇인가요?
- 게임 내에서 플레이어가 방금 말한 것에 응답해야 하는 캐릭터는 누구인가요?
- 방문객의 질문에 가장 잘 답하는 박물관 오디오 가이드 세그먼트는 무엇인가요?
- 레시피에서 누락된 재료의 역할을 가장 잘 보존하는 대체품은 무엇인가요?
어떤 기준을 얼마나 충족하는지 판단하여 우선순위를 정하거나 조치를 조정할 수 있는 곳이라면 어디든 Score 를 사용하세요.
- 이 소프트웨어 버그가 고객의 실제 워크플로우를 얼마나 방해하나요?
- 이 여행 일정표는 누군가의 이상적인 휴가와 얼마나 일치하나요?
- 이 고객 인터뷰는 특정 제품 가설을 얼마나 뒷받침하나요?
- 이 장면의 대사는 캐릭터의 확립된 목소리에서 얼마나 벗어나 있나요?
- 플레이어가 이미 알고 있는 내용을 고려할 때, 이 게임 힌트는 얼마나 노출도가 높은가요?
Jev 로 구축할 시간
Jev 는 우리가 사용자를 위해 구축할 수 있는 소프트웨어 및 경험의 종류에 새로운 가능성을 열어주었습니다.
이제 Jev 가 무엇이고 어떻게 작동하는지 알았으니, 당신이 구축하는 제품에 이를 어떻게 적용할 계획인가요?





