우리가 AI 가 작성하는 쇼로 방향을 틀었을 때, 수많은 사람들이 이것이 Pocket FM 의 종말이 될 거라고 말했습니다. 6 개월이라는 긴 시간 동안 저도 거의 그 말에 동의하게 되었습니다. 하지만 곧 우리의 생태계는 폭발적으로 성장했고, 이는 AI 글쓰기에도 불구하고 일어난 일이 아니라 바로 그 덕분에 가능했습니다. 2 년도 채 되지 않는 시간 안에, 우리의 AI 는 작가들이 Pocket 에서 1 억 달러 규모의 IP 를 포함한 161 개의 블록버스터를 탄생시키는 데 기여했습니다.
LLM 이 글쓰기에 형편없었다는 사실은 오히려 우리가 자체 커스텀 모델과 하니스(harness)를 구축하도록 만들었습니다. 맨바닥에서 시작하는 일은 때때로 사기를 꺾어놓기도 했습니다. 엄청난 시행착오가 필요했고, 플랫폼에 있는 55 만 명의 작가와 1 억 명 이상의 사용자가 만들어낸 황금 같은 데이터셋이 필수적이었습니다.
아무것도 없는 상태에서 어떻게 정교하게 조율된 글쓰기 모델로 발전했는지, 왜 Pocket FM 이 완벽한 테스트 환경인지, 그리고 Sherpa 가 블록버스터를 써낼 수 있게 만든 비결이 무엇인지 자세히 설명해 드리겠습니다.
ChatGPT 가 출시된 이후, 모두가 그것이 너무 'AI 스럽다'고 지적해 왔습니다. LLM 에게 길이에 상관없이 무언가를 쓰라고 요청하면 어김없이 대시(—)가 등장하고, 짧고 강렬한 문장들이 끼어들며, 결과물은 지루하고 단조로운 하나의 덩어리처럼 읽힙니다.
LLM 은 근본적으로 논리적 추론, 수학 문제 해결, 코딩 지원, 백과사전식 지식 검색을 위해 설계되었습니다. 학습 과정 어디에서도 독자가 기꺼이 읽고 싶어 할 만한 글을 쓰는 법은 배우지 못합니다. 이건 모델의 잘못이 아닙니다.
강화학습은 결과물이 명확한 성공 신호와 연결될 때 가장 잘 작동하며, 무엇이 통했는지를 바탕으로 모델을 훈련시킵니다. 코딩에서는 코드가 요구한 대로 작동하거나, 아니면 아예 작동하지 않습니다. 답이 명확하죠.
하지만 글을 쓸 때는 그게 좋은 글인지 알 길이 없습니다. 독자가 첫 문장을 읽고 이탈했는지 끝까지 읽었는지조차 모릅니다. 더 심각한 건, 특정 책이나 기사에 대해 10 명에게 물어보면 10 가지 다른 대답이 나온다는 점입니다.
콘텐츠 제작과 유통을 모두 직접 통제한다는 점은 Pocket FM 을 매우 독특한 위치에 놓이게 합니다. 우리는 사용량을 분 단위로 모니터링합니다. 사람들이 언제 청취를 멈추는지, 다음 에피소드를 들으러 다시 돌아오는지, 그리고 오랫동안 머물러 있는지 정확히 파악합니다. 이보다 더 나은 신호는 없습니다. 사용자가 이탈하게 만드는 요인은 Sherpa 가 피하도록 학습하고, 사용자를 특정 쇼에 몰입하게 만드는 요소는 새로운 쇼에 적극 활용합니다.

Pocket FM 의 평균 사용자는 하루 150 분 이상을 청취하는데, 이는 YouTube 의 거의 3 배, Netflix 보다 약 50% 많은 수치입니다. 저는 지금이 극도로 흥미롭고 몰입감 넘치며 초개인화된 콘텐츠라는 새로운 물결의 아주 초기 단계라고 생각합니다. 데이터가 쌓일수록 이 흐름은 더욱 강력해질 것입니다.
왜 AI 가 쓴 글은 AI 티가 날까
도스토옙스키가 위대한 작가였던 이유는 인물들의 행동과 독백 속에 모순과 감정을 고스란히 담아냈기 때문입니다. 오스카 와일드와 피츠제럴드는 재치 넘치는 문장을 너무나 아름답게 장식하여 독자가 페이지를 넘기지 않을 수 없게 만들었습니다. 코난 도일은 마지막 순간까지 독자에게서 정보를 숨기는 탁월한 능력을 갖추고 있었습니다.
범용 LLM 은 이와 정반대로 작동하도록 설계되었으며, 이를 개선할 방법도 마땅치 않습니다. 이들은 답을 곧바로 제시하고, 중립적인 언어로 글을 쓰며, 전달력을 높이겠다며 각종 수사적 장치를 남발합니다. 마찬가지로, 훌륭한 AI 어시스턴트는 사용자를 올바른 결론으로 빠르게 인도하도록 훈련되어 있습니다. 이러한 근본적인 설계 방식이 이들이 쓰는 글 전반에 배어 있고, 그래서 글쓰기에 서툰 것입니다.
창작 글쓰기에는 긴장감, 감정, 갈등의 생성과 느린 해소, 한 줄짜리 대사로 다 담을 수 없는 입체적인 캐릭터성, 그리고 완급 조절이 필요합니다. 독자는 계속 빠져들게 만드는 단서를 받으면서도 잘못된 결론으로 이끌려야 합니다.
더 오래 생각하는 추론 모델조차 일반적으로 문제를 해결하는 데 집중할 뿐, 독자가 그 해답에 도달하는 과정에서 느끼는 경험에는 보상을 받지 못합니다. 미스터리를 푸는 것과 미스터리를 쓰는 것은 완전히 다른 영역입니다.
기존 모델을 수정하려는 시도는 실패로 돌아갔습니다
처음에는 이미 존재하는 것을 활용해 볼 수 있다고 생각했습니다. 시중에 나와 있는 모델을 적용하고, 영혼 없는 스토리텔링을 고쳐보겠다는 희망으로 미세 조정을 시도했습니다.
점점 더 강력한 모델에 직접 프롬프트를 입력해 보고, 이야기가 전개됨에 따라 롤링 요약(rolling summary)을 유지하며, 리트리벌(retrieval)과 지식 그래프를 활용해 질문에 답하는 다양한 실험을 진행했습니다.
직접 프롬프트를 입력하는 방식으로는 100 화에 도달할 즈음이면 10~20 개의 설정 오류가 발생합니다. 롤링 요약은 결국 중요한 디테일을 허공으로 날려버려 이후 이야기의 완성도를 떨어뜨립니다. 컨텍스트 윈도우를 늘리면 도움이 되긴 하지만, 모델은 여전히 긴 맥락 속에서 정보를 정확하게 활용하는 데 어려움을 겪습니다.
최종 결과물 외에, 질문 처리 능력은 모델이 자신이 쓴 내용을 얼마나 이해하고 있는지 측정하는 최고의 척도입니다. 초기에 우리는 어떤 모델에 아무리 공을 들여도 여러 에피소드의 세부 정보가 필요한 다중 홉(multi-hop) 서사학적 질문에 답하지 못한다는 사실을 깨달았습니다. 이는 당시 기술 수준의 한계를 여실히 보여주었습니다.
우리는 이 방식이 지속 불가능하다고 판단하고 자체 기술을 구축하기로 결정했습니다... 작가가 스토리텔링에서 가장 험난한 구간을 통과하도록 안내한다는 의미에서 Sherpa 라는 이름을 붙였습니다.
Sherpa 가 당신이 듣고 싶은 이야기를 써내는 기술적 이유
Sherpa 는 장편 연재 창작 글쓰기를 위한 모델 하니스입니다. 세 가지 구성 요소로 이루어져 있으며, 이 소개글 뒤에 각각을 더 자세히 설명하겠습니다.
- 플래너(planner)는 각 아크와 장면이 무엇을 달성해야 하는지, 그리고 캐릭터의 성장과 관계 변화를 결정합니다.
- 내러티브 월드 모델(Narrative World Model)은 지금까지 일어난 일, 각 캐릭터가 알고 있는 정보, 그리고 이야기가 아직 독자에게 갚아야 할 복선들을 구조화된 형태로 기록합니다.
- 산문 엔진(prose engine)은 해당 계획과 상태를 바탕으로 초안을 작성하고, 크리틱(critic) 모델이 캐릭터의 행동, 연속성, 장면의 품질을 검증합니다. 이후 작가의 수정과 청취자의 반응이 다음 반복 작업을 개선하는 데 활용됩니다.
결과는 매우 고무적입니다. Sherpa 와 경쟁 모델들이 백지상태에서 각각 이야기를 썼을 때, 블라인드 쌍대 비교 평가에서 경쟁 모델에 따라 65.6% 에서 97.1% 의 비율로 Sherpa 가 선호되었습니다. Sherpa 의 강화학습과 Pocket 의 방대해지는 데이터셋을 고려하면, 이 격차가 계속 벌어지지 않을 이유가 없습니다.

메모리 - 내러티브 월드 모델(NWM)
언어 모델은 호출 간에 메모리를 공유하지 않으므로, 이야기에 대해 아는 모든 것이 프롬프트 안에 담겨야 합니다. 컨텍스트 윈도우를 늘린다고 해결되지 않습니다. 모델은 긴 프롬프트 중간에 묻힌 정보를 고르지 않게 활용하기 때문입니다. 원시 텍스트 기반의 리트리벌 역시 해결책이 아닙니다. 검색은 물건이 어디에 있었는지는 찾아줄 수 있어도, 지금 어디에 있는지는 알려주지 못합니다.
Sherpa 로 에피소드가 확정되면, 모델은 이를 뒷받침하는 구절과 연결된 구조화된 레코드를 추출합니다. 필드는 소설에 맞게 설계되었습니다. 캐릭터가 현재 아는 것과 아직 모르는 것, 사건이 실제로 발생한 시점과 청취자가 알게 되는 시점, 어떤 복선이 결실을 기다리고 있는지 등입니다. 모든 사실은 그것이 확립된 챕터부터 변경되는 챕터까지 유효합니다. 작가가 이전 챕터를 수정하면, 그에 의존했던 모든 내용이 다시 구축됩니다.
질문에 답하기 위해 NWM 은 정확한 단어와 의미를 동시에 사용해 그래프를 검색하고, 각 결과의 직접적인 연결 요소를 끌어와 모델에 작고 집중된 정보 패킷을 전달합니다.
에피소드를 인식하는 이 리트리벌 방식은 관련된 설정만 선별해 노출하므로, 미래 스토리의 유출 없이 다중 홉 추론을 가능하게 합니다. 내부 60 개 항목 벤치마크에서 Sherpa NWM 은 실행당 $0.7793 의 비용으로 86.7%(52/60) 의 정확도를 달성했습니다. 이는 opus 5.x 급 모델을 사용하는 Claude Code 의 메모리 하니스와 동일한 정확도이면서 비용은 약 21 배 저렴합니다($16.2172 대비). 또한 산문 전용 리트리벌보다 20% 포인트 높은 성능(66.7% → 86.7%)을 보이면서도 비용은 훨씬 적게 들었습니다.

산문 엔진: 너무 어려워 자체 모델을 구축해야 했습니다
강화학습에는 보상 신호가 필요한데, 산문에는 명확한 기준이 없습니다. 어떤 문단이 노벨상급인지 그저 빈자리 채우기용인지 판별하는 테스트는 존재하지 않습니다.
Sherpa 는 글쓰기 작업의 각 부분을 서로 다른 모델에 분배합니다. 각 캐릭터는 하나의 에이전트로, 우리가 직접 포스트 트레이닝한 커스텀 모델 위에서 작동합니다. 이들은 자신의 페르소나, 이야기의 현재 목표, 최근 사건, 자신과 관련된 세계관의 요소를 바탕으로 다음 행동을 제안합니다. 별도의 크리틱 모델이 모든 제안을 검토하고, 모호하거나 개연성이 없거나 캐릭터에 맞지 않거나 반복적이거나 이야기를 진전시키지 못하는 내용은 반려합니다. 그런 다음 세 번째 모델인 내레이터가 장면에 맞는 제안을 선택해 다음 문단으로 작성합니다. 최종적으로 지면에 오른 행동만이 이야기의 메모리에 추가됩니다.
여기에 더해, 우리는 연재 소설에 맞게 설계된 보상 함수를 사용하여 독자적인 산문 모델을 훈련시키고 있습니다. 지나치게 현학적인 문체, 반복, 과잉 설명에는 페널티를 부여하고, 자연스러운 대화, 목소리, 긴장감에는 보상을 제공합니다.
산문을 평가하는 신호는 다음과 같습니다.
- 확립된 사건이나 캐릭터의 지식과 모순되는가?
- 행동이 개연성이 있고 캐릭터에 부합하며 장면을 진전시키는가?
- 작가들이 대안보다 이 대화, 목소리, 호흡을 선호하는가?
- 청취자가 에피소드를 끝까지 듣고 다음 편을 위해 돌아오는가?
이러한 신호들은 서로 다른 시간 축에서 작동합니다. 문장은 훌륭하게 들리지만 설정을 깰 수 있고, 절정은 다음 회차 시청률을 높이지만 전체 아크를 약화시킬 수도 있습니다. '좋은 글'이라는 개념이 매우 주관적이기 때문에, Sherpa 는 잔류율을 단일 점수로 취급하는 대신 이러한 다양한 신호를 종합적으로 최적화해야 합니다.
Sherpa 의 산문 엔진은 이미 내부 소설 벤치마크에서 평가한 대부분의 오픈소스 및 상용 모델을 능가하고 있으며, Sonnet 5 대비 69%, Gemini 3.1 Pro 대비 94% 의 산문 선호도 점수를 기록했습니다. 각 막대는 제시 순서를 교차 적용하여 평가했을 때 해당 모델 대비 Sherpa 의 글이 선호된 비율을 나타내며, 50% 는 동률을 의미합니다. 이는 진행 중인 포스트 트레이닝의 초기 결과이며, 훈련이 계속됨에 따라 더 큰 향상이 기대됩니다.

계층형 스토리 플래너
스토리 구조는 쇼 전체의 속성이지만, 언어 모델은 오직 다음 조각만을 생성합니다. 다음 단어 예측 방식으로는 5 화에 심어둔 복선이 60 화에서 회수되어야 한다는 사실이나, 이번 챕터에 목표, 갈등, 결과가 필요하다는 점을 알지 못합니다. 최첨단 모델이 작성한 100 페이지 분량의 이야기에서, 단 5 개 챕터만 샘플링한 AI 편집기가 52 개의 구조적 문제를 발견했습니다. 매끄럽지 못한 전개와 불필요한 챕터들이었습니다.
Sherpa 의 플래너는 전체 서사에서 출발해 아크와 에피소드로 내려가며, 각 장면에 역할을 부여합니다. 여기에는 무엇을 미해결 상태로 남겨두어야 하는지도 포함되므로, 20 화가 스포일러 없이 80 화의 반전을 준비할 수 있습니다. 모든 복선은 회수될 때까지 열린 약속으로서 스토리 메모리에 저장됩니다. 목표 생성기는 이야기가 정체되지 않도록 돕습니다. 목표가 달성되거나 막히면, 이전 목표와 겹치지 않는 새로운 목표를 설정합니다. 동일한 100 페이지 테스트에서 구조적 문제는 52 개에서 31 개로 줄어들었고, 목표 업데이트 기능만 제거해도 챕터 단위 평가 점수가 거의 절반 가까이 향상되었습니다.

향후 몇 년 내에 Sherpa 가 작가들이 수십억 달러 가치의 IP 를 창조하도록 도울 수 있는 모든 기반이 마련되었습니다. 더 많은 크리에이터와 사용자가 플랫폼에 합류할수록 Sherpa 는 계속해서 발전합니다.
앞으로 해야 할 일이 많고 아직 해결되지 않은 문제들도 많습니다. Sherpa 를 완벽하게 다듬는 것도 그중 하나이고, 작가들이 이를 최대한 활용할 수 있도록 환경을 조성하는 것 역시 마찬가지입니다.
저는 Pocket FM 이 하고 있는 일에 대해 정말 큰 기대감을 품고 있습니다. 우리는 몇 년 전이라면 수백만 달러의 예산이 필요했을 이야기를 통해 크리에이터들이 생계를 꾸릴 수 있도록 돕고 있습니다.
1 조 달러 규모의 기회가 될 이 여정은 아직 시작에 불과합니다.





