Jev가 뭔가요? 사람들이 이미 Jev로 구축하고 있는 9가지

@mvanhorn
영어2026년 9월 18일
137K
702
47
24
1.8K

TL;DR

Jev는 텍스트 생성이 아닌 빠르고 저비용의 의사결정을 위해 설계된 특화 AI 모델입니다. 이 글에서는 브라우저 자동화, RAG 필터링, 모델 라우팅 등 9가지 실제 응용 사례를 상세히 다루며, 기존 LLM 대비 효율성을 강조합니다.

요약 (TL;DR) 및 초보자 설명 (ELI5)

AI는 에세이 작성이 아니라, 객관식 문제를 푸는 것에 가깝다고 생각하세요.

이 모델은 채팅을 하지 않습니다. 소프트웨어가 즉시 실행할 수 있는 결정을 내립니다: "스팸인가?" "이 에이전트는 어떤 도구를 써야 할까?" "사람의 확인이 필요한가?"

흥미로운 점은 TypeSafe 자체 워크플로우 벤치마크 기준, 최첨단 LLM 대비 약 200배 빠르고 400배 저렴하며, 응답 속도는 찰나에 불과하다는 것입니다.

왜 이것이 강력한가? 앱이나 에이전트가 비싸고 느린 LLM 대화 수백 번 없이도 수많은 사소한 판단을 내릴 수 있다고 상상해 보세요.

복잡한 사고와 작성을 위해 큰 모델을 유지하되, 그 사이의 빠른 의사결정은 Jev에게 맡기세요.

참고로 이 제품은 ChatGPT 공동 개발자이자 RLHF(강화학습 기반 인간 피드백)의 공동 발명가 중 한 명인 Diogo Almeida가 2년간 비밀리에 개발했습니다.

여기까지가 홍보 문구입니다. 이제 실제 근거(receipts)를 살펴볼 차례입니다.

/last30days 도구로 9번 스캔하고, 모든 원본 파일을 완독했으며, 주요 게시물은 라이브 페이지와 대조하여 직접 검토했습니다. 출시 이틀 만에 해당 발표 포스트는 좋아요 6만 6천 개와 조회수 3,140만 회를 기록했습니다.

https://x.com/CompleteSkeptic/status/2099925682726002904

이를 기반으로 구축된 브라우저 에이전트는 하루 만에 조회수 180만 회를 달성했습니다. 또 다른 개발자는 청구서를 계산해 봤는데, 분류, 모델 라우팅, 의도 파악 및 스티어링에 걸쳐 약 5,000건의 요청 비용이 2달러 정도였습니다.

https://x.com/MichaelLee04/status/2100003037150683593

저는 이러한 워크플로우를 직접 실행하지 않았습니다. 대신 커뮤니티 연구를 통해 사람들이 실제로 배포하는 것들을 순위 매겼습니다. 출처와 구체적인 수치가 명시된 31개의 후보 워크플로우 중, 복사해서 쓸 수 있는 페이로드(payload)와 함께 반드시 참고해야 할 9가지를 선별했습니다.

🧠 메커니즘, 60초 안에 이해하기

앱의 상태(state)와 타입이 지정된 질문(typed question)을 입력하면, 확률이 포함된 타입이 지정된 결정(typed decision)을 반환합니다. JSON 프롬프트 작성도, 파싱 레이어도, 검증 절차도 필요 없습니다.

질문 유형은 세 가지이며, 이것이 전체 인터페이스입니다: \Choice\는 최대 255개 옵션 중 하나를 선택하고, \Score\는 무언가를 척도 위에 배치하며, \Noul\은 예/아니오 질문에 대해 0에서 1 사이의 숫자로 답변합니다. 모든 답변에는 \probabilities\(확률)와 \confidence\(신뢰도 점수)가 포함됩니다. 하나의 호출에서 동일한 상태에 대해 20개의 질문을 하면 병렬로 평가되므로, 20개 비용이 1개 비용과 거의 동일합니다. 입력 토큰당 가격은 백만 토큰당 $0.042입니다. 출력은 무료입니다.

커뮤니티 역시 제 트윗과 동일한 관점을 채택했으며, 더 많은 공감을 얻었습니다: LLM은 답을 생성하지만, Jev는 결정을 내린다, 좋아요 2,278개.

제 헤드라인 수치에는 각주가 붙습니다. TypeSafe는 응답 시간을 70~500밀리초로, 최첨단 모델보다 40배에서 200배 빠르다고 밝혔습니다. 홈페이지에 명시된 정확한 수치(자체 워크플로우 평가 기준)는 193.6배 빠르고 444.6배 저렴합니다. 비교 대상(baseline)이 중요합니다:

홈페이지에 들어가면 가장 먼저 눈에 띄는 것은 OpenAI의 중간급 모델 중 하나인 GPT-5 X Terra와의 나란히 비교된 결과입니다.

  • Nimrod, YouTube, 조회수 13,747회

모델 클래스 이름이 'System One'이지만, 이는 카너먼(Kahneman)을 인용한 것이 아닙니다.

Jev라는 이름의 실제 유래는 카너먼이 아니라, 19세기 경제학자 윌리엄 스탠리 제본스(William Stanley Jevons)입니다.

제본스의 역설(Jevons paradox): 자원을 저렴하게 만들면 사람들은 그것을 훨씬 더 많이 소비한다. 의사결정 모델에 이 이름을 붙이는 것은 일종의 선언적 논지(thesis statement)입니다.

또한 이것은 농담이기도 합니다. Rob Shocks는 자신의 231,655회 조회된 분석 영상에서 "My name is Jeff" 클립으로 편집했고, 142개의 좋아요를 받은 상위 댓글은 단순히 "My name is Jev killed me."(내 이름은 제프, 죽여버려)였습니다. Diogo 본인이 직접 농담에 응하고 있습니다, 좋아요 129개.

1. 🌐 7초 만에 항공권을 찾고 비용은 $0.0039인 브라우저 에이전트

무엇인가? Jev가 다음 클릭을 선택하고, 타이핑이 필요할 때만 소형 LLM이 깨어나는 초소형 오픈소스 브라우저 에이전트입니다.

누가 운영하나? Browser Use의 창립자 Gregor Zunic입니다. 좋아요 7.2K, 조회수 1.8M, 북마크 7.6K. 그는 포스트에서 영상이 1배속으로 재생된다고 언급했습니다.

https://x.com/gregpr07/status/2100411066966749359

왜 선정되었나? 이 모델 위에서 만들어진 것 중 가장 많이 시청된 콘텐츠이며, 성공적인 패턴을 가장 명확하게 보여줍니다: 매 단계마다 새로운 액션 공간(action space)을 설정하고, DOM을 상태로 삼으며, Jev가 후보 중에서 선택하고, 생성(generation)은 폴백(fallback)으로만 사용하는 방식입니다. LangChain의 공식 블로그 글에 따르면 Browserbase의 Kyle Jeong도 비슷한 방식으로 몇 센트 미만으로 이를 구현하고 있습니다.

페이로드는 저장소입니다: browser-use/jev-ultrafast. 직접 만들기 전에 클론부터 해보세요.

2. 🧹 즉각적인 컴팩션(compaction): 모든 도구 호출을 점수 매기고 불필요한 것 제거

무엇인가? 코딩 에이전트가 컨텍스트 한계에 도달했을 때 실행하는 요약 프롬프트를 대체합니다. Jev 패스를 사용하여 각 도구 호출의 관련성을 점수 매기고 불필요한 부분을 삭제합니다.

누가 운영하나? Tamara Tran이 질문을 던지고 같은 날 오후에 해결책을 배포했습니다. 좋아요 5K, 조회수 554.4K.

https://x.com/tamarajtran/status/2100694549362553153

Alex Volkov는 이를 Claude 플러그인으로 실행하고 수치를 공개했습니다: 세션을 거의 100만 토큰에서 86K 토큰으로 줄이는 데 1초가 걸렸습니다. 좋아요 1.9K, 북마크 3.5K.

https://x.com/altryne/status/2100739055923425589

왜 선정되었나? Diogo의 답변이 이 기술의 방향성을 알려주는 단서가 되기 때문입니다. 좋아요 304개.

https://x.com/CompleteSkeptic/status/2100702845779775675

하네스(harness)가 요약을 하는 대신 1초 만에 점수를 매기고 버릴 수 있다면, 컨텍스트 윈도우는 더 이상 설계의 제약 조건이 아니게 됩니다. 이것이 숨겨진 다크호스(picker)입니다. Browser Use는 영상 측면에서 더 낫지만, 컴팩션은 오늘날 모든 코딩 에이전트 사용자가 체감하는 핵심 기능입니다.

Alex의 정확한 설치 명령어인 아래 내용을 Claude Code에 붙여넣으세요:

text
1Install, and configure: https://github.com/tamaratran/fast-jev-compaction

3. 🛡️ 하네스로부터 분리된 안전성 리뷰어(Safety Reviewer)

무엇인가? 모든 코딩 하네스는 자동 모드(auto mode)가 명령어를 실행하기 전에 "이 명령어를 실행해도 되는가?"라고 묻는 분류기를 실행합니다. 이번 주 전까지는 이 분류기가 제품의 폐쇄된(closed) 부분에 존재했습니다.

누가 운영하나? Vercel이 프로덕션 환경에서 사용합니다. Guillermo Rauch: fx의 기본 모드는 자동 모드이며, 안전성 리뷰어가 모든 명령어를 분석합니다. Jev는 현재 이를 수행 중인 모델보다 p95 기준 최대 18배 빠르고 정확도가 높습니다. 좋아요 3.7K, 조회수 392.4K.

https://x.com/rauchg/status/2100307962262872105

https://x.com/fazxes/status/2100300097695232164

왜 선정되었나? p95 수치가 첨부된 프로덕션 마이그레이션이기 때문이며, LangChain이 다음 날 오픈 버전인 \AutoModeMiddleware\를 출시했기 때문입니다. Rob Shocks의 분석(조회수 231,655회, 좋아요 3,526개)은 10분 안에 스토리를 파악하려는 동료에게 보내기에 최적의 자료입니다.

LangChain 버전, 그들의 포스트에서 그대로 인용:

python
1from langchain.agents import create_agent
2from langchain_typesafe.experimental.middleware import (
3 AutoModeMiddleware,
4)
5
6guardrail = AutoModeMiddleware(tools=["bash"])
7
8agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])

4. 🚦 시스템 프롬프트가 아닌 미들웨어로서의 모델 라우팅

무엇인가? 모델 함대(fleet) 앞에 Jev를 배치하여 각 요청을 처리할 브레인을 선택하게 하고, 확률을 에이전트 상태(agent state)에 남겨 선택 과정을 감사(audit)할 수 있게 합니다.

누가 운영하나? LangChain이 Sydney Runkle의 "Building a Harness with Jev"에서 사용했습니다. 좋아요 232개, 조회수 31.1K, 그리고 지금까지 공개된 것 중 가장 깔끔한 연결 방법(how-to-wire-it) 가이드입니다.

https://x.com/sydneyrunkle/status/2100754364545761643

왜 선정되었나? 모델 라우팅은 전체 데이터셋(corpus)에서 이 모델이 수행하는 작업 중 가장 많이 인용되는 용도입니다. 또한 이 기사 상단에 있는 '$2로 5,000건 요청' 포스트의 5가지 워크로드 중 하나이기도 합니다. LangChain은 이를 시스템 프롬프트의 한 문단에서 읽을 수 있는 11줄의 코드로 변환했습니다.

python
1from langchain.agents import create_agent
2from langchain_typesafe.experimental.middleware import (
3 ModelChoice,
4 ModelRouterMiddleware,
5)
6
7router = ModelRouterMiddleware(
8 choices={
9 "fast": ModelChoice(
10 model="openai:luna",
11 criteria="Direct lookups, extraction, and localized changes.",
12 ),
13 "powerful": ModelChoice(
14 model="openai:sol",
15 criteria="Architecture and high-stakes decisions.",
16 ),
17 },
18 instructions="Choose the least costly model that can complete the task.",
19)
20
21agent = create_agent("openai:gpt-5.6-luna", middleware=[router])

\pip install langchain-typesafe\로 설치하고 \TYPESAFE_API_KEY\를 설정하세요.

5. 🔎 RAG 정밀도: 평소처럼 검색하고, 맞지 않는 것은 삭제하라

무엇인가? 리트리버(retriever)는 그대로 두세요. Jev를 사용하여 반환된 모든 청크(chunk)에 대해 하나의 예/아니오 질문을 실행하고, 통과하지 못한 것을 드롭(drop)하세요.

누가 운영하나? Kush Bhuwalka가 한 문장으로 정리했습니다: 검색된 모든 청크에 Jev를 실행하고 관련 없는 것을 삭제하세요. 좋아요 416개.

https://x.com/kushbhuwalka/status/2100731050075050485

왜 선정되었나? 정밀도(Precision)는 RAG의 미해결 과제였는데, 해결책이 항상 청크당 추가 LLM 호출이었기 때문에 검색 시점에 감당할 수 없었기 때문입니다. 무료 출력 토큰과 서브초(sub-second) 지연 시간 덕분에, 청크당 판정은 청크를 생성한 임베딩 조회(embedding lookup)보다 저렴합니다. 저는 문서화된 API를 바탕으로 Kush가 설명한 형태에 맞춰 직접 코드를 작성했습니다:

python
1from typesafe_sdk import Noul, TypeSafeClient
2
3client = TypeSafeClient()
4
5kept = []
6for chunk in retrieved_chunks:
7 verdict = client.system_one(
8 state={"question": user_question, "chunk": chunk.text},
9 questions={
10 "relevant": Noul(
11 instructions="The chunk contains information needed to answer the question",
12 ),
13 },
14 )
15 if verdict.answers["relevant"].noul > 0.5:
16 kept.append(chunk)

6. 🎮 실시간 루프: Minecraft, Doom, 그리고 마음을 읽는 런처

무엇인가? 초당 여러 번 실행되는 루프 내부에서의 의사결정. 최첨단 모델은 참여조차 불가능한 영역입니다.

누가 운영하나? Wuyang Zhou는 Jev와 GPT-6 Astra가 Minecraft에서 함께 플레이하도록 했습니다. Jev는 빠른 반응을 담당하고 Astra는 사전 계획을 수립하며, 동시에 여러 좀비와 싸웁니다. 좋아요 374개, 조회수 51.4K.

https://x.com/wuyang_zhou/status/2100727660875808913

Nader Dabit은 키 입력 오라클(oracle)을 구축했습니다: "방금 다운로드한 pdf"라고 입력하면, 모든 키 입력마다 약 100밀리초 이내에 최신 PDF가 완전한 신뢰도로 최상위 검색 결과가 됩니다. 좋아요 264개.

왜 선정되었나? TypeSafe 자체의 출시 데모는 Doom 게임이며, 모델에게 초당 약 10번 행동을 묻습니다. 두 개의 독립적인 해설자가 동일한 비용을 산출했습니다:

Jev는 초당 약 10번의 결정을 내리며 실시간으로 플레이하고 있고, 이는 시간당 약 $7의 비용으로 환산됩니다.

시간당 7달러로 초당 10번의 결정을 내리는 것은 LLM과는 차원이 다릅니다. 그리고 Minecraft 사례처럼 빠른 모델이 반응하고 느린 모델이 계획하는 분업 패턴은 이 목록의 모든 실시간 선택 항목이 공유하는 특징입니다.

7. 📬 배치 스케일의 이메일 트리아지(Triage)

무엇인가? Jev를 받은 편지함 내보내기 파일에 연결하여 모든 메시지를 병렬로 분류, 점수 매기기 및 플래그 지정하세요.

누가 운영하나? YouTube의 vogel 채널(조회수 60,996회, 좋아요 526개)은 8개의 워커를 사용하여 1,500개의 내보낸 이메일을 100개씩 배치로 처리했습니다. LangChain의 블로그 글은 Ryan Vogel을 주목해야 할 3개 프로젝트 중 하나로 지목했습니다. Syntax(조회수 33,933회, 좋아요 1,052개)는 동일한 기능을 구축했으며, 질문에서 API 호출까지 300밀리초가 걸리는 홈 오토메이션 데모도 추가했습니다.

왜 선정되었나? 데이터셋 내에서 가장 많이 복제된 데모이며, 처리량(throughput) 계산이 핵심 포인트이기 때문입니다.

잔액이 $5밖에 남지 않았다는 사실은 이 모델이 얼마나 저렴한지를 잘 보여줍니다.

  • vogel, YouTube, 조회수 60,996회

이것은 TypeSafe의 공식 퀵스타트(quickstart)를 그대로 가져온 것이며, 이미 이메일 트리아지 파이프라인으로 구성되어 있습니다:

bash
1pip install typesafe-sdk
python
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
2
3client = TypeSafeClient()
4
5response = client.system_one(
6 state="Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
7 questions={
8 "department": Choice(
9 instructions="Which team should handle this",
10 criteria={
11 "billing": "Payment or subscription issues",
12 "technical": "Bugs or integration problems",
13 "sales": "Pricing or account questions",
14 },
15 ),
16 "frustration": Score(
17 instructions="How frustrated the customer appears",
18 criteria=[
19 "Calm, just stating facts",
20 "Frustrated but civil",
21 "Very angry, strong language",
22 ],
23 ),
24 "is_urgent": Noul(
25 instructions="The message conveys urgency or time-sensitivity",
26 ),
27 },
28)
29
30print(response.answers["department"].choice)
31print(response.answers["frustration"].score)
32print(response.answers["is_urgent"].noul)

8. 🗂️ 문서에 대한 맵-리듀스(Map-reduce): 4분의 1센트로 777번의 판단

무엇인가? 하나의 질문 세트, 모든 문서, 모두 동시에. 최첨단 모델로는 경제적 불가능했고, 고전적 분류기로는 평범했던 워크로드입니다.

누가 운영하나? Every의 평가(evals) 책임자인 Mike Taylor가 지금까지 공개된 것 중 가장 깔끔한 테스트를 진행했습니다: 그의 기사 27개와 AI 스타일의 유사 기사 10개, 각각 21개의 질문을 단일 요청으로 처리했습니다. 0.7초 미만, 약 4분의 1센트 비용으로 777번의 판단 완료. 그의 11개 실험 전체에서 1센트 미만으로 1,709번의 판단을 수행했습니다. AI Daily Brief(조회수 10,000회)는 당일 이 수치를 보도했습니다.

왜 선정되었나? TypeSafe는 이를 자사 유즈케이스 맵(use-case map)의 첫 번째 카테고리 중 하나인 "Big Data에 대한 AI Map Reduce"로 명시하고 있습니다. 무료 출력 토큰은 행 단위(row-per-row)로 실행하는 모든 것의 연산을 변화시킵니다. 문서에서 가져온 원시(raw) HTTP 형식은 여기 담기에도 충분히 작습니다:

json
1{
2 "model": "jev-latest",
3 "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
4 "questions": {
5 "is_urgent": {
6 "type": "noul",
7 "instructions": "The message conveys urgency or time-sensitivity"
8 }
9 }
10}

이것은 \{"is_urgent": {"type": "noul", "noul": 0.999}}\를 반환합니다. \questions\ 객체 내의 20개 질문은 1개 질문과 거의 동일한 비용이 들므로, 행별로 알고 싶은 모든 것을 단일 호출로 물어보세요.

9. 🧪 브라우저 내 Jev, 그리고 클론들

무엇인가? 의존성(dependency) 없이 형태(shape)만 원하는 사람들이 로컬 모델 위에 재구현한 인터페이스입니다.

누가 운영하나? Shopify의 Kshetrajna Raghavan은 Reflex를 구축했습니다. WebGPU에서 구조화된 결정을 확률과 함께 실행하는 Qwen 모델로, 완전히 브라우저 내에서 작동합니다. Tobi Lütke가 이를 공유하며 화제가 되었습니다: 좋아요 206개, 조회수 38.5K.

https://x.com/tobi/status/2100742327459303882

역공학(reverse-engineered)된 jevlike는 출시 이틀 후 Hacker News 메인 페이지에서 157포인트를 획득했으며, 로컬 LLM 위에서 동일한 인터페이스를 제공하는 mini-jev가 하루 뒤 뒤를 이었습니다. 커뮤니티 카탈로그인 awesome-jev-by-typesafe는 제가 데이터를 수집할 당시 409개의 스타(star)를 기록하고 있었습니다.

왜 선정되었나? 72시간 내에 세 개의 독립적인 클론이 등장했다는 것은 이번 조사에서 인터페이스 자체가 진정한 발명품인지에 대한 가장 강력한 신호입니다. 또한 네트워크를 통해 전송할 수 없는 데이터를 위한 오프라인 탈출구(escape hatch)를 제공합니다. 이는 중요한데, 실제 서비스는 API 전용이며 미국 호스팅이기 때문입니다. 지금 새 탭에서 Reflex를 시도해 보세요.

📖 TypeSafe가 권장하는 사용법

문서와 창업자의 답변에서 추출한 네 가지 규칙:

  • 호출당 여러 질문을 하세요. 이들은 병렬로 평가되며, 문서에 따르면 추가 질문은 응답 시간에 거의 영향을 미치지 않습니다. 위에서 인상 깊었던 선택 사항들은 모두 하나의 상태에 대해 여러 가지를 묻고 있었습니다.
  • 신뢰도에 임계값(threshold)을 설정하세요. 문서에서는 0.3~0.5 미만의 값을 행동보다는 사람에게 물어볼 신호로 취급하라고 조언합니다. 이는 라벨만 주는 분류기와, 라벨과 사용 허가를 함께 주는 의사결정 시스템의 차이점입니다.
  • 후보를 제공하세요, 창작을 요구하지 마세요. Browser Use는 DOM에서 액션 공간을 구성하고 Jev가 선택합니다. RAG는 검색하고 Jev가 필터링합니다. 런처는 순위를 매기고 Jev가 재순위 매깁니다. Choice는 최대 255개의 옵션을 지원하므로, 엣지 케이스(edge cases)를 위해 "other"(기타) 옵션을 추가하세요.
  • 채점(grading)을 정확하게 하세요, 그렇지 않으면 다른 모든 것이 무의미합니다. 한 주 동안 이를 깨뜨리려고 시도한 한 빌더는 이렇게 단언했습니다: "채점을 제대로 하지 못하면 작동하지 않는다." 옵션 세트와 질문의 표현 방식이 진짜 작업이며, 호출 자체는 사소합니다.

시도해 볼 수 있는 곳: 이미 여러분이 사용하는 게이트웨이 뒤에 있습니다. Vercel AI Gateway는 48시간 내에 통합되었으며, 좋아요 2,341개로 이는 스텔스 발표 다음으로 큰 회사의 두 번째 인기 포스트입니다.

https://x.com/typesafeai/status/2100376436272173088

같은 주에 Cloudflare AI Gateway(좋아요 749개)와 OpenRouter 베타(좋아요 387개)도 등장했습니다. 직접 접근은 Bearer 토큰을 사용하여 \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\로 가능합니다.

⚖️ 솔직한 주의 사항(Caveat)

Hacker News의 출시 스레드 "Introducing System One Models and Jev"(1,863포인트, 490개 댓글)는 대부분 마케팅 문구 중 하나에 집중했습니다:

또한 '환각(hallucinate)할 수 없다'는 말은 틀린 것 같습니다. 물론 잘못된 타입을 출력할 수는 없지만, 여전히 완전히 잘못된 유효한 값(valid value)을 출력할 수 있으니까요.

  • jacobgold, Hacker News 출시 스레드, 1,863포인트

Diogo는 이에 반박하지 않았습니다. 한 댓글러가 이것이 LLM이 아니라 분류 모델이라고 지적하자, 그는 그 설명이 "매우 정확하다!"라고 칭찬하며, instruction-tuned(지시 조정)보다는 zero-shot(영샷)이라고 말하는 것이 더 적절할 것이라고 덧붙였습니다. 이것이 정직한 프레임워크이며, 출시일 열풍이 '새로운 종류의 지능'이라 부르던 것보다 훨씬 겸손한 정의입니다: 보정된(calibrated) 확률과 실제 API를 갖춘 매우 훌륭한 zero-shot 분류기.

Reddit의 가장 큰 Jev 스레드는 누가 먼저 만들었느냐에 관한 것입니다. r/LocalLLaMA의 "나는 1년 전에 Jev 아키텍처를 문자 그대로 구축했고 모델, 데이터셋, 논문까지 모두 오픈소스로 공개했다"(업보트 1,568개, 댓글 164개)는 업계 전반의 분위기를 요약하는 답변을 이끌어냈습니다:

하지만 그게 다음 빅 히트작이라고 주장하면서 게시했나요? 초보적인 실수네요.

동일 스레드에서 351개의 업보트를 받은 위로의 말: 그 선행 연구 덕분에 아무도 일반적인 아이디어를 특허 내고 독점할 수 없게 되었다는 점입니다.

Every의 Mike Taylor는 결함이 심어진 12개의 지문을 Jev와 Fable 5.1(high effort 모드)에 통과시켰습니다. Jev는 지문당 중앙값 0.35초(Fable은 8.83초)로, 약 25배 빠르고 약 580배 저렴했습니다. 또한 7개의 결함 중 6개를 발견했습니다. Fable은 7개 모두를 발견했습니다. 그의 결론: 조기 경보 시스템으로서 유용하다는 것인데, 대안이 '전혀 검사하지 않는 것'이기 때문입니다. gpt-6-astra 대비 연구 루프에 대한 두 번째, 더 작은 비교는 엔드투엔드(end-to-end) 기준으로 약 7배 차이가 났으며, 중앙값 결정 시간은 213ms vs 2,436ms였고, 두 경로 모두 3개 중 3개 정답이었습니다. 이는 현실적이고 유용하지만 200배와는 거리가 멉니다. AISeeKing이 차트에서 읽어낸 TypeSafe 자체의 4개 워크플로우 평균 참조 답변 일치율은 67.8%입니다.

열광 피로(Hype fatigue)도 실재합니다. "솔직히 이건 게임 체인저가 될 수 있다고 믿는다"로 시작한 75,750회 조회된 해설 영상의 상위 댓글(좋아요 262개)은 "역대 가장 싫어하는 문장일지도 모르겠다"였습니다.

이번 조사 전체에서 가장 날카로운 반응은 완전한 해설 영상을 끝까지 보고도 빈손으로 나온 시청자였습니다:

이 영상을 전부 봤는데도 JEV가 무엇이고 무엇을 하는지 여전히 모르겠습니다.

바로 이 댓글 때문에 이 기사가 존재합니다. 이를 해소하는 규칙은 수년간 이런 방식으로 구축해 온 한 개발자에게서 나왔으며, 스티커에 들어갈 만큼 짧습니다: AI는 실행하고, 코드가 결정한다.

🔍 이 항목들을 선정한 방법

X, YouTube, Hacker News, Reddit, TikTok, Instagram, Digg, GitHub, arXiv를 대상으로 /last30days 도구를 11회 실행하여 총 716개 항목을 확보했습니다. 모든 원본 파일을 완독한 후, 실질적인 반응(traction)이 있는 모든 게시물을 열어 라이브 페이지와 수치를 대조했습니다. 출시 이틀 된 제품에 대한 가장 큰 게시물들이 키워드 검색이 예상한 곳에 있지 않았기 때문입니다. 출처와 실제 수치가 명시된 39개의 후보 워크플로우 중 9개를 유지했습니다. 특정 저자나 채널에 의존하는 선택 사항은 두 개를 넘지 않도록 했습니다. 모든 참여 지표(engagement figure)는 데이터 수집 시점에 X 또는 YouTube가 표시한 대로이며, 그들이 반올림한 방식 그대로 적용했습니다.

코드에 대해: 4개의 페이로드는 원문 그대로입니다. 이메일 트리아지 블록은 문서에 있는 TypeSafe의 공식 퀵스타트이며, 원시 JSON 형식도 동일한 문서에서 가져왔습니다. 두 개의 미들웨어 블록은 LangChain의 포스트에서 복사했습니다. Alex Volkov의 컴팩션 설치 명령어는 그의 정확한 표현입니다. RAG 필터는 문서화된 API를 바탕으로 Kush가 설명한 형태에 맞춰 제가 직접 작성했으며, 누군가가 프로덕션에서 실행해 본 것이 아니라 뼈대가 좋은 초안임을 명시합니다.

임베드(embeds)는 주목을 끈 게시물에만 한정했습니다. 수백 개의 좋아요 미만인 모든 것은 인라인 링크로 처리했는데, 작은 포스트를 인용 카드(quote card)로 크게 부풀리면 증거처럼 보이기 때문입니다.

🔑 선택된 사례들의 공통 패턴

  • 빠른 모델은 반응하고, 느린 모델은 계획한다. Minecraft, 출시 스레드의 위키백과 경쟁, Browser Use 그리고 압축(compaction) 모두 동일한 분할 방식을 따르고 있다.
  • 후보군을 제공하라. 성공한 사례들은 Jev에게 옵션 생성을 요청하지 않는다. 대신 코드, DOM, 리트리버, 도구 추적 로그, 런처 인덱스 등을 통해 옵션 세트를 구축하고, 그중에서 선택하도록 한다.
  • 무료 출력 토큰이 속도 수치보다 더 중요한 역할을 한다. 여기서 언급되는 모든 행 단위 및 청크 단위 작업 부하는 가격 덕분에 가능해졌다.
  • 신뢰도 점수 자체가 제품이다. 임계값으로 삼을 수 있는 보정된 숫자가 없다면 이는 단순한 분류기일 뿐이다. 하지만 그런 숫자가 있다면, 언제 멈춰야 할지 아는 의사결정 계층이 된다.
  • 발명은 가중치가 아니라 인터페이스다. 72시간 안에 작동하는 클론 3개가 등장했고, 가장 큰 Reddit 스레드는 1년 전에 아키텍처를 공개했던 사람의 것이다.
  • 학술적인 버전이 먼저 등장했다. arXiv의 TabAgent는 라우팅, 게이팅 및 검증 호출을 분류기로 대체해야 한다는 동일한 주장을 하고 있지만, 실제 제품은 없다.
  • 커뮤니티에서는 이미 적절한 이름을 붙였다. 사람들이 무엇을 출시하고 있는지 정리하던 한 빌더가 "AI if statement"라는 표현을 사용했는데, 지금까지 이 모델에 대해 쓰인 말 중 가장 유용한 세 단어다.

🧵 내가 이 모델을 활용한다면

어려운 사고와 작문에는 대형 모델을 유지하라. 루프 내의 모든 저렴한 판단 작업에는 이 모델을 배치하고, 신뢰도 점수를 기준으로 임계값을 설정하며, 0.5 미만인 경우 더 큰 모델이나 인간에게 에스컬레이션하라. 압축 플러그인은 오늘 당장 설치하라. 오늘 밤이면 그 효과를 체감할 수 있을 테니까.

📊 모든 에이전트의 보고 내용

Reddit 113개 스레드 / 24,425개의 업보트 / 4,159개의 댓글; X 314개 게시물 / 30,192개의 좋아요 / 1,538개의 리포스트, 추가로 라이브 페이지와 대조하여 수동으로 확인한 13개 게시물; YouTube 75개 영상 / 4,545,636회 조회수; TikTok 36개 영상 / 171,040회 조회수; Instagram 14개 릴스 / 10,778개의 좋아요; Hacker News 133개 스토리 / 25,312 포인트 / 11,852개의 댓글; GitHub 6개 저장소 / 842개의 스타; Digg 7개 클러스터 / 119개 게시물; arXiv 18편의 논문. 2026-09-17에 /last30days 실행 11회를 통해 수집되었으며, 중복 제거 전 각 실행 결과의 총합을 집계한 수치임.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기