오늘은 "토큰 맥싱(Token Maxing)"—AI 토큰 사용을 극대화하는 단계—이 순환을 마치고, AI의 ROI에 의문을 제기하는 "토큰 관리(Token Management)"로 트렌드가 전환되고 있는 상황에 대해 논의해 보겠습니다. 토큰 관리는 이제 인력 계획이나 마케팅 투자 결정만큼 중요한 경영 과제가 되었습니다.
해외에서는 이 "토큰 관리" 개념이 종종 "토큰 최적화(Token Optimization)"라는 더 기술적인 용어로 논의됩니다. 명확성을 위해 여기서는 토큰 관리라는 용어를 사용하겠지만, 토큰 최적화와 동의어로 간주해 주시기 바랍니다.
토큰 맥싱과 그 반작용

지난 1년 동안 생성형 AI의 사용은 "토큰 맥싱"이라고 할 수 있는 단계에 있었습니다. 작업에 토큰을 마구 쏟아붓고, 가장 강력한 모델을 반복적으로 사용하며, 컨텍스트를 한계까지 입력하는 방식이었습니다. AI 공급업체들도 사용량 확대를 성공 지표로 삼아 정액제 구독을 통해 사실상 보조금을 지급했습니다. 사용자 측에서는 비용 걱정 없이 가장 강력한 모델을 사용하는 것이 경쟁 우위로 여겨졌습니다.
하지만 2026년에 접어들면서 이러한 구조에 대한 명확한 반작용이 나타나기 시작했습니다.
Uber가 상징적인 사례입니다. 이 회사는 엔지니어들이 사용량을 두고 경쟁하도록 내부적으로 Claude Code 리더보드를 구축했고, 그 결과 2026년 AI 코딩 예산을 단 4개월 만에 소진했습니다. Uber의 COO 앤드류 맥도날드는 팟캐스트에서 이렇게 말했습니다.
"이제부터는 인건비와 함께 토큰 소비와 그에 따른 비용에 대해 논의해야 합니다. 고객에게 도달하는 기능이 지출한 만큼 증가한다는 직선을 그릴 수 없다면, 이러한 트레이드오프를 정당화하기 어렵습니다."
AI를 판매하는 측에서도 비슷한 우려가 제기되고 있습니다. 마이크로소프트의 사티아 나델라는 2026년 3월 모건 스탠리 TMT 컨퍼런스에서 이렇게 말했습니다.
"왜 우리는 이렇게 많은 토큰을 사용하고 있을까요? 많은 경우 토큰 효율성 측면에서 최악의 방식으로 사용하고 있습니다. 앞으로 1년 동안 모두가 노력할 것은 AI를 효율적으로 만들기 위한 도구 사용과 소프트웨어입니다."
실제로 마이크로소프트는 내부에 도입했던 직접 Claude Code 라이선스를 대폭 축소했습니다.
앞으로 AI는 '마음껏 사용'할 수 있는 도구가 아니라, 인건비나 마케팅 비용처럼 ROI가 철저히 검증되어야 하는 대상이 될 것입니다. 경영진의 관심사는 '얼마나 많은 토큰을 사용했는가'에서 '그 토큰이 무엇을 만들어냈고, 다음에는 어디에 할당할 것인가'로 이동할 것입니다.
대규모 토큰 사용은 경쟁의 전제 조건
다소 부정적으로 들릴 수 있지만, AI의 진화가 매우 강력하다는 전제가 있습니다. 개발 분야에서는 코딩 에이전트를 사용하지 않을 선택지는 없습니다. 일정 수준의 토큰 비용을 감당할 수 없는 기업은 사실상 경쟁에서 뒤처지게 됩니다. 게다가 그 '일정 수준'의 토큰 비용 장벽은 상당히 높습니다. 투자 능력 없이는 가속화할 수 없다는 냉혹한 현실을 직시해야 합니다.
실제로 엔지니어가 소비하는 토큰 비용이 급여의 수십 퍼센트, 심지어 절반에 달하는 경우도 드물지 않습니다. 이제 '엔지니어 한 명을 고용하는 비용'을 단순히 '급여'가 아닌 '급여 + AI 토큰 비용'의 패키지로 생각해야 할 필요성이 대두되고 있습니다. 경영진에게 이는 완전히 새로운 비용 항목의 등장을 의미합니다.
토큰 맥싱은 의미 없는 움직임이 아니었습니다. AI를 전력으로 사용함으로써, 어디서 가속하고 어디서 더 통제해야 하는지에 대한 학습이 빠르게 진행되었다고 생각합니다. 앞으로는 토큰 관리(Token Management)를 통해 밟아야 할 곳은 밟고, 제어해야 할 곳은 제어할 수 있는 기업이 두각을 나타낼 것입니다.
토큰 관리는 그 자체로 경영 과제가 되었습니다. 토큰 맥싱은 기업의 구조적 전환을 위한 중요한 첫걸음이었습니다.
저희 회사에서는 단순히 토큰을 사용하기 위해 사용하는 단계는 끝났고, 어떻게 성과를 창출할 것인지에 대한 단계에 접어들었습니다. LayerX의 'Compass'(경영 원칙)에는 "AI를 성장 동력으로 만들라" 와 "사용되지 않을 것을 만들지 마라. AI 구축 함정에 빠지지 마라" 와 같은 지침이 있습니다.

https://speakerdeck.com/layerx/compass_202209?slide=34 에서 발췌

https://speakerdeck.com/layerx/compass_202209?slide=36 에서 발췌
이러한 지침의 결과로, 우리는 내부적으로 토큰을 최적화했습니다. 사용해야 할 곳에 사용하고 최적화해야 할 곳은 최적화했지만, LayerX에서 토큰 맥싱을 하던 시절과 비교해 사용된 토큰의 양은 크게 변하지 않았습니다. 일정 수준 이상의 대규모 토큰 사용은 경쟁의 전제 조건이 되었다고 느낍니다.
코딩 에이전트는 단지 '선례'일 뿐
여기서 중요한 점은 이러한 폭발적인 토큰 소비가 코딩이라는 전문 분야에만 국한되지 않는다는 것입니다.
현재 코딩 외의 모든 종류의 비즈니스 운영이 코딩 에이전트와 동일한 방식으로 해결되고 있습니다. 영업을 위한 신호 수집 및 제안서 작성, 고객 지원 문의, 자동 경비 보고 및 승인, 법률 계약 검토, 마케팅 광고 운영, 인사 채용 심사 등이 하나둘씩 자율 실행 에이전트로 재설계되고 있습니다.
자율 에이전트는 이전의 '한 번 질문, 한 번 답변' 방식으로 인간이 사용하던 것과 비교할 수 없을 정도로 많은 양의 토큰을 소비합니다. 에이전트가 더 많은 작업을 수행함에 따라 모든 AI 사용은 현재 코딩 에이전트에서 볼 수 있는 것과 동일한 패턴으로 수렴될 것입니다. 코딩 에이전트는 우연히 그 패턴에 도달한 첫 번째 선례였을 뿐입니다.

현재는 '엔지니어 전용 문제'처럼 보이는 AI 토큰 비용 관리 과제는 곧 회사 전체의 경영 문제가 될 것입니다. 이는 앞으로 몇 년 안에 회사의 모든 비즈니스 영역이 동일한 토큰 소비 프로필을 가지게 될 것이기 때문입니다.
토큰 비용은 시한폭탄

여기서 인식해야 할 또 다른 사실이 있습니다. 현재 우리가 지불하고 있는 AI 구독료는 실제 비용보다 현저히 낮습니다.
현재 파운데이션 모델 제공업체들은 AI 구독을 손해 보면서 제공하는 것이 일반적이며, 우리가 지불하는 정액 요금과 실제 발생 비용 사이에는 큰 차이가 있습니다. 동일한 사용량을 API 종량제 가격으로 다시 계산하면 비용이 수십 배, 수백 배로 뛰어오릅니다. 구독 형식은 사용자에게 실제 비용을 보이지 않게 만듭니다.
문제는 파운데이션 모델 회사들이 언제든지 이 실제 비용 차이를 드러낼 수 있다는 점입니다. 보조금이 지원되는 부분이 정액제에서 토큰 기반 과금, 상위 요금제 안내, 또는 가격 인상의 형태로 고객에게 전가되기 시작하는 순간, 'ID당 월 수만 엔, 100명 직원 회사 기준 연간 수천만 엔'이라는 인식이 단기간에 '회사 전체 연간 수억~수십억 엔' 수준으로 뛰어오를 수 있습니다. 구독료에 숨겨진 실제 비용 차이가 시한폭탄의 위력을 발휘하는 것입니다.
가장 먼저 필요한 것은 폭발이 표면화되기 전에 회사 내부에서 무슨 일이 일어나고 있는지 가시화하는 것입니다.
(자세한 내용은 이 기사를 참조하세요: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
첫 번째, 가시화
이 문제를 위해 가장 먼저 필요한 것은 매우 기본적인 것입니다. '누가 어떤 모델을 사용하여 몇 개의 토큰을 사용하고 있는지'를 보이게 만드는 것. 그것뿐입니다.
사람에 대해서는 이미 인사 평가, 목표 관리, 급여 시스템, 조직 설계와 같은 방대한 관리 기반이 마련되어 있습니다. 마케팅 비용의 경우 CAC와 회수 기간을 측정하면서 최적화하는 것이 당연합니다. 조달에는 전문 팀과 워크플로우가 있습니다.
그러나 AI의 경우, 이러한 가장 기본적인 가시화조차 아직 이루어지지 않았습니다. CEO와 IT 부서에게 '지금 누가 AI에 얼마를 지출하고 있는지'를 알 수 없다는 사실은 이미 큰 스트레스 요인입니다. 대시보드에 숫자를 올리는 것만으로도 가치가 창출됩니다.
저희가 현재 제공하고 있는 'AI Token Advisor'는 바로 이러한 격차를 해소하기 위해 설계된 제품입니다. 누가 어떤 작업에 어떤 모델을 사용했고, 몇 개의 토큰을 사용했는지를 시각화하는 간단한 도구입니다. (Bakuraku 사용자는 1개의 ID를 무료로 사용할 수 있습니다!)

https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/ 에서 발췌
하지만 가시화는 입구에 불과합니다. 진정으로 중요한 것은 그 너머에서 필연적으로 제기되는 질문입니다.
"그 작업에 정말 그 모델이 필요했을까?"
가시화가 진행되면 항상 다음 질문이 제기됩니다. "그 작업에 정말 그 모델이 필요했을까?"
예를 들어, "오늘 날씨가 어때?"와 같은 질문에 최상위 추론 모델(2026년 5월 기준 최신 모델인 Claude Opus 4.8 또는 GPT-5.5 등)을 사용하는 것은 명백히 과합니다. 가장 가벼운 모델로도 충분하며, 추론 모델일 필요조차 없을 수 있습니다. 마찬가지로, 일상적인 이메일 작성과 같은 성숙된 작업에 고가의 모델을 계속 사용하는 사례가 회사 내에 광범위하게 존재합니다.
경향은 사람마다 다릅니다. AI 사용에 익숙하지 않은 사람들은 일단 가장 강력한 모델을 선택하는 경향이 있습니다. 반대로 AI를 깊이 사용하는 사람들은 작업의 성격에 따라 모델을 전환합니다. 이러한 차이는 비용과 품질 측면 모두에서 조직이 무시하기에는 너무 커집니다.
여기서 중요한 것은 AI에 대한 모든 입력이 궁극적으로 '프롬프트' 형태로 변환된다는 사실입니다. 채팅 질문과 에이전트에 전달되는 컨텍스트는 모두 내부적으로 모델에 프롬프트로 입력됩니다. 즉, 프롬프트를 보면 그 사람이 AI에게 무엇을 시키고 있는지 대부분 알 수 있습니다.
이 프롬프트를 기반으로 작업과 모델 간의 불일치를 감지하고 "이 작업에는 더 가벼운 모델로 충분합니다"와 같은 가이드를 제공할 수 있습니다. 더 나아가, 사람이 매번 모델을 선택하는 대신 시스템이 자동으로 최적의 모델을 할당하게 될 것입니다. 우리는 그러한 세상을 향해 나아가고 있습니다.

에이전트 시대에는 이것이 더욱 중요해집니다. 에이전트는 자율적으로 실행되기 때문에 인간이 매번 "지금 Opus를 사용하는 것이 사치일까?"라고 생각할 여유가 없습니다. 처음부터 작업의 성격에 따른 최적의 모델 선택을 시스템에 맡기는 것 외에는 선택지가 없을 것입니다.
Bakuraku에서 제공하는 서비스는 사용자가 의식하지 않아도 최적의 모델을 선택하는 백엔드 구현을 포함한 관리형 서비스로 제공될 것입니다. AI Token Advisor는 단지 입구에 불과합니다.
요약
AI 토큰 비용은 이미 '그냥 돈을 쏟아붓자'는 방식으로 처리할 수 있는 규모를 넘어섰습니다. 일부 기업의 경우 인건비나 마케팅 비용에 버금가는 지출 항목이 되고 있습니다.
마케팅 비용은 CAC로 엄격하게 관리되며, 아무도 "CAC는 신경 쓰지 말고 광고를 마구 돌리자"고 말하지 않습니다. 인건비도 마찬가지입니다. 급여, 채용, 배치는 모두 관리됩니다. 아무 급여나 주고 사람을 고용하지 않습니다.
이와 동일한 수준에서 AI 비용도 경영의 범위 안으로 들어오게 될 것입니다. 그때 가장 먼저 필요한 것은 '얼마나 지출되고 있는지'를 가시화하는 것입니다. 그리고 다음으로는 '작업과 사람에 적절한 모델이 선택되고 있는지'를 확인하는 것입니다.
화려해 보이지 않을 수 있지만, 이 두 가지를 마스터하는 것이 앞으로 몇 년간 중요한 경영 과제가 될 것입니다.
이러한 미래를 함께 구현하고 싶은 분들을 위해, LayerX는 AI Builder를 적극 채용 중입니다!

적극 채용 중입니다! https://jobs.layerx.co.jp/





