이것은 제가 양즈린(杨植麟)과 처음 가진 인터뷰로, 2024년 초에 진행되어 2024년 3월 1일 — 바로 Kimi 창립 1주년이 되는 날 — 에 게재되었습니다. 당시 Kimi는 직원이 80명에 불과했고, 약간 낡은 첫 사무실에서 일하고 있었습니다. 입구에는 로고조차 없었고, 문 앞에는 흰 피아노 한 대가 조용히 지키고 서 있었을 뿐이었습니다.
이 기사는 당시 중국 테크 커뮤니티에서 상당한 화제를 불러일으켰습니다.
그 당시 저는 여전히 인쇄 매체 기자였기 때문에, 이 인터뷰는 텍스트와 오디오 팟캐스트로만 존재합니다.
보시다시피, 이 기사에서 표현된 많은 견해들은 이후에 현실로 입증되었습니다.
불과 2년 전의 이 글을 다시 읽어보면, 세상이 얼마나 극적으로 변했는지에 감탄하지 않을 수 없습니다!
(이 번역은 Kimi K3가 생성했습니다.)
양즈린: "모두가 당신이 평범하다고 생각한다면 — 당신의 꿈이 누구나 가질 수 있는 꿈이라면 — 그것은 인류 전체의 꿈의 총합에 아무것도 더하지 않습니다."
글: 샤오쥔 장(张小军)
단 1년 전, AI 과학자 양즈린은 실리콘밸리에서 정밀한 계산을 했습니다. 그는 AGI를 목표로 하는 파운데이션 모델 스타트업을 시작하기로 결정한다면, 향후 몇 달 안에 1억 달러 이상을 모금해야 한다는 사실을 깨달았습니다.
하지만 그것은 게임에 참가하기 위한 티켓에 불과했습니다. 1년 후, 그 금액은 13배로 늘어났습니다.
파운데이션 모델 회사들에게 경쟁은 과학적 대결이라기보다는, 무엇보다도 먼저 자금의 치열한 싸움입니다. 투자자들이 자금줄을 단단히 쥐고 있는 상황에서, 더 많은 돈을 모으고, 더 많은 GPU를 사고, 더 많은 인재를 확보하는 데 있어 경쟁사보다 앞서 나가야 합니다.
"재능의 집중과 자본의 집중이 필요합니다."라고 2023년 3월 1일에 설립된 파운데이션 모델 회사 Moonshot AI의 창립자이자 CEO인 양즈린은 말합니다.
지난 1년 동안, 중국의 파운데이션 모델 회사들은 긴장되고 위축된 생존의 경계선 위에서 살아온 것처럼 보였습니다. 표면적으로는, 각 회사가 막대한 현금을 보유하고 있습니다. 하지만 한편으로는, 갓 모금한 돈을 OpenAI를 따라잡기 위해 — 먼저 GPT-3.5를 따라잡고, GPT-4에 도달하기도 전에 Sora가 등장합니다 — 매우 비용이 많이 드는 연구에 즉시 쏟아부어야 합니다. 다른 한편으로는, 실행 가능한 실제 사용 사례를 찾기 위해 끊임없이 경쟁하여, 자신들이 회사이지 자본만을 소모하는 연구소가 아님을 스스로 입증해야 합니다. 그리고 그것만으로는 충분하지 않습니다: 이 벤처들 각각에게 IPO든 인수합병이든, 출구는 여전히 불투명합니다.
중국 파운데이션 모델 회사들의 창립자 중에서 양즈린은 1992년생으로 가장 어립니다. 업계는 그를 확고한 AGI 신봉자이자 드문 기술적 카리스마를 지닌 창립자로 묘사합니다. 그의 학문적 및 전문적 기록의 상당 부분은 범용 AI와 관련되어 있으며, 그의 논문은 22,000회 이상 인용되었습니다.
2023년 중반, 중국의 테크 커뮤니티는 파운데이션 모델에 대한 열광에서 급격히 냉각기로 전환되었고, 실제 세계 배치를 가속화하는 것이 실용주의적인 주류 흐름이 되었습니다. 이는 필연적으로 파운데이션 모델 CEO들을 이상과 현실 사이에서 격렬하게 갈등하게 만들었습니다. 모든 사람이 PMF(제품-시장 적합성)를 외치고 상업화를 외치는 중국 AI 생태계에서, AI 연구자 출신인 이 창립자는 특별히 서두르지 않습니다.
80명의 직원을 보유한 Moonshot AI는 중국의 주요 파운데이션 모델 회사들 중에서 인원이 가장 적습니다. 경쟁사들과 달리, 양즈린은 더 안전한 B2B 비즈니스나 헬스케어, 게임과 같은 수직 분야에 진출하는 대신, 단 하나의 소비자 제품인 AI 어시스턴트 Kimi를 만들었습니다. Kimi는 최대 20만 자의 중국어 입력을 받아들일 수 있습니다. Kimi는 또한 양즈린의 영어 이름이기도 합니다.
양즈린은 자신의 회사를 과학, 공학, 비즈니스를 결합한 시스템으로 보는 것을 선호합니다. 이렇게 상상해 볼 수 있습니다: 인간 세계 위에, 그는 한 손으로는 실험을 진행하고, 다른 한 손으로는 최첨단 기술을 현실 세계로 가져와 사람들과의 상호작용을 통해 응용 분야를 발견하고 그 응용 프로그램을 소비자 손에 전달하는 AI 연구실 벤치를 세우고 있습니다. 이상적으로는, 전자는 수백억, 수천억 달러의 자본을 소모하고, 후자는 그 돈을 수백 배, 수천 배로 벌어들입니다. 어떻게 듣든, 그것은 줄타기를 하는 것처럼 짜릿하고 위험하게 들립니다.
"AI는 앞으로 1~2년 안에 어떤 PMF를 찾을 수 있느냐의 문제가 아니라, 앞으로 10~20년 동안 어떻게 세상을 바꿀 것인가의 문제입니다."라고 그는 말합니다.
이러한 추상적이고 이상주의적인 사고는 그를 대신하여 땀을 흘리게 만듭니다: 젊은 AI 과학자가 현실주의 중국에서 생존할 공간을 개척할 수 있을까요?
2024년 2월, Moonshot AI는 시장 흐름을 거스르며 대규모 자금 조달 라운드를 마감했습니다. 알려진 바에 따르면, 이 회사는 알리바바가 주도하고 Monolith Management, 샤오홍슈 등이 참여하여 15억 달러의 투자 전 가치 평가로 10억 달러 이상의 시리즈 B를 유치했습니다. 거래 완료 후, Moonshot AI의 투자 후 가치 평가는 약 25억 달러로, 이 단계에서 중국 파운데이션 모델 경쟁에서 가장 가치가 높은 유니콘이 되었습니다. (회사는 이 문제에 대해 응답하거나 논평하기를 거부했습니다.)
이 세 번째 자금 조달 라운드가 진행되는 동안, 우리는 양즈린과 함께 앉아 그의 첫 1년 간의 창업 여정 — 중국 파운데이션 모델 회사들이 출발선에서부터 앞서 나간 1년의 축소판 — 에 대해 이야기했습니다.
그의 회사는 파운데이션 모델 회사들이 밀집한 베이징의 소후 네트워크 플라자에 자리 잡지 않았습니다. 총 자금 조달액이 약 90억 위안에 달하는 회사치고는, 량쯔신쭤 빌딩에 있는 이 사무실은 조잡하고 낡아 보입니다. 입구에는 회사 로고조차 없고, 문 앞에는 흰 피아노 한 대만이 조용히 지키고 서 있습니다.
회의실은 구석에 있습니다. 작은 창문들 때문에 내부는 어둡고, 히터가 윙윙거리며 겨울 추위를 막아주는 따뜻한 공기를 내보냅니다. 어슴푸레한 빛 속에서, 양즈린은 지난 1년이 자신에게 어떻게 느껴졌는지 묘사합니다: "눈 덮인 산맥이 펼쳐진 길을 운전하는 것과 조금 비슷합니다. 그 안에 무엇이 있는지 모릅니다. 그저 한 걸음 한 걸음 앞으로 걸어갈 뿐입니다."
다음은 양즈린과의 전체 인터뷰입니다. (가독성을 위해 작성자가 일부 텍스트를 편집했습니다.)

이 사진은 2024년 초, 베이징에 있는 Kimi의 첫 사무실에서 촬영되었습니다. 그들은 현재 이 장소를 떠났습니다. 입구에는 로고가 없었고 — 흰 피아노 한 대만이 조용히 문 옆에 서 있었습니다.
**
1부
시작에 서서
"파도를 타야 합니다"
**
샤오쥔 장: 요즘 어떻게 지내세요?
양즈린: 바쁩니다 — 할 일이 많아요. 하지만 여전히 흥분됩니다. 우리는 산업의 아주 초기 단계에 서 있고, 상상할 수 있는 공간이 엄청납니다.
샤오쥔 장: 아까 들어오면서 회사 입구에 순백색 피아노가 있는 것을 보았습니다.
양즈린: 그 위에 Pink Floyd 앨범도 하나 놓여 있어요. 누가 거기 놓았는지 전혀 모릅니다 — 며칠 전에 갑자기 발견했는데 아직 물어볼 기회가 없었어요. (Pink Floyd는 앨범 The Dark Side of the Moon을 발매한 영국 록 밴드입니다.)
샤오쥔 장: 2022년 11월 ChatGPT가 출시된 날, 무엇을 하고 계셨나요?
양즈린: 저는 이미 이에 대비하고 있었습니다 — 사람을 모으고, 팀을 만들고, 새로운 아이디어를 교환하고 있었어요. ChatGPT를 보는 것은 정말 짜릿했습니다. 3~5년 전, 심지어 2021년에도, 그것은 상상할 수 없는 일이었습니다. 그런 종류의 고차원적 추론 능력은 달성하기가 매우 어려웠습니다.
시장에서 많은 변수들이 바뀌려고 한다는 것을 느꼈습니다: 한쪽에는 자본, 다른 쪽에는 인재 — AI의 핵심 생산 요소들이요. 그 변수들이 제자리를 찾는다면, 이것을 하기 위한 제대로 된 회사, 즉 AGI를 위해 구축된 조직이 0에서 1로 갈 수 있게 될 것입니다. 그것은 큰 깨달음이었습니다. 독립적인 회사가 더 말이 되었지만, 원할 때 바로 할 수 있는 것은 아니었습니다. ChatGPT가 변수들에 충격을 주고 생산 요소들을 함께 모이게 했습니다. 파도를 타야 합니다.
샤오쥔 장: AGI 회사를 설립하기로 결정한 후, 어떤 준비를 하셨나요? 자본과 인재라는 두 가지 생산 요소를 어떻게 모으셨나요?
양즈린: 순탄치 않은 과정이었습니다. ChatGPT가 확산되는 데는 시간이 걸렸습니다. 어떤 사람들은 일찍 알게 되었고, 어떤 사람들은 늦게 알게 되었으며, 처음에는 의심하다가 충격을 받고 신자가 된 사람들도 있습니다. 사람과 자금을 찾는 것은 시점과 밀접하게 연결되어 있었습니다.
우리는 2023년 2월에 첫 번째 자금 조달 라운드에 집중하기 시작했습니다. 만약 4월로 미뤘다면, 기본적으로 기회가 없었을 것입니다. 하지만 2022년 12월이나 2023년 1월에 하는 것도 효과가 없었을 것입니다 — 팬데믹이 아직 진행 중이었고, 사람들이 그것을 제대로 인지하지 못하고 있었거든요. 그래서 실제 기회의 창은 단 한 달이었습니다.
미국에 있던 어느 날 밤, 저는 정밀한 계산을 했습니다. 계산을 마쳤을 때, 저는 향후 몇 달 안에 최소 1억 달러를 모금해야 한다는 결론을 내렸습니다. 시장의 많은 사람들은 아직 모금을 시작하지 않았고, 많은 사람들이 그 정도 금액을 모금할 수 있다고 믿지 않았습니다. 하지만 그것은 가능한 것으로 판명되었습니다 — 심지어 그 이상도요.
인재 시장도 움직이기 시작했습니다. ChatGPT에 영감을 받아, 많은 사람들이 2023년 3월이나 4월에 이런 깨달음을 얻었습니다: 이것이 앞으로 10년 동안 할 가치가 있는 유일한 일이다. 적시에 적절한 사람들에게 연락해야 합니다. 1~2년 전만 해도 인재들이 이렇게 집중되지 않았을 것입니다. 그 당시에는 더 많은 사람들이 전통적인 AI나 AI 관련 비즈니스를 하고 있었습니다 — 그 어느 것도 범용 AI가 아니었죠.
샤오쥔 장: 요약하자면: 2월은 자금 조달의 창이었고, 3월과 4월은 채용의 창이었다는 말씀이신가요?
양즈린: 대략 그렇습니다.
샤오쥔 장: 미국에서의 그날 밤 — 이 계산을 하실 때 어디에 계셨나요? 정확히 어떻게 계산하셨나요?
양즈린: 2022년 말부터 2023년 초까지, 저는 한두 달 동안 미국에 머물며 사람들을 만나고 있었습니다. 제가 살고 있던 곳에서 계산했어요. 필요한 FLOPs, 훈련 비용, 추론 비용, 사용자 수를 계산했습니다.
샤오쥔 장: 그 순간, 실리콘밸리의 지배적인 분위기는 어땠나요?
양즈린: (ChatGPT라는) 제품이 테크 써클에 집중된 많은 초기 사용자들을 확보하기 시작했습니다. 우리 자신도 그 써클 안에 있었기 때문에 더 예민하게 느꼈습니다. 실리콘밸리의 대기업에서는 사람들이 6개월마다 성과 평가를 작성해야 하는데, 많은 사람들이 ChatGPT를 사용하여 작성하기 시작했습니다. 평소에는 글쓰기가 그다지 전문적이지 않았던 어떤 사람들은 ChatGPT로 작성된 평가를 제출했고, 모든 사람의 글이 매우 엄숙해졌습니다.
움직임이 감지되고 있었습니다. 많은 사람들이 다음 직업이나 창업에 대해 생각하고 있었습니다. 나중에 저희와 이야기했던 꽤 많은 친구들이 스타트업을 창업했습니다. 그리고 강한 FOMO(Fear Of Missing Out) — 뒤쳐질 것에 대한 두려움 — 가 있었습니다. 아무도 잠을 잘 수 없었습니다. 자정이든, 새벽 1시든, 2시든, 연락하면 사람들은 항상 거기에 있었습니다. 약간 불안하고, 약간 FOMO를 느끼면서도 매우 흥분해 있었습니다.
샤오쥔 장: 1억 달러를 모금해야 한다고 계산하셨던 그날 밤—몇 시까지 깨어 계셨나요?
양즈린: 괜찮았어요 — 계산 자체는 오래 걸리지 않았습니다. 하지만 그 후에는 너무 많은 사람들에게 말할 수 없었습니다. 만약 말했다면, 아무도 그것이 가능하다고 믿지 않았을 것입니다.
2부
기술적 계보
"끝없는 조각 작업에서 벗어나기"
샤오쥔 장: 벤처 캐피탈 업계에서 당신에 대해 이야기할 때, "창립자는 뛰어나고, 기술적 카리스마가 있으며, 팀은 기술 스타로 가득 차 있다"고 말합니다. 파운데이션 모델 벤처에 대해 논의하기 전에, 먼저 학문적 배경부터 시작하고 싶습니다. 학부는 칭화대에서 컴퓨터 과학을 전공하셨고, 카네기 멜론 대학 컴퓨터 과학 학교에서 박사 학위를 받으셨습니다. AI가 항상 당신의 주요 관심 분야였나요?
양즈린: 저는 1992년에 태어나 2011년에 학부를 시작했습니다. 2학년 때부터 지금까지 — 10년 이상 — 이 분야에 몸담고 있습니다. 처음에는 더 다양하게 탐색하며 여기저기 둘러보았고, 그래프와 멀티모달리티 관련 작업을 좀 했습니다. 2017년에 언어 모델로 집중하게 되었습니다. 그 당시 저는 언어 모델이 비교적 중요한 문제라고 느꼈고, 나중에는 그것이 유일하게 중요한 문제라고 느끼게 되었습니다.
샤오쥔 장: 2017년, AI 업계는 일반적으로 언어 모델을 어떻게 이해했으며, 그 이해는 어떻게 발전했나요?
양즈린: 그 당시에는 음성 인식 결과를 순위 매기는 데 사용되는 모델이었습니다. (웃음.) 음성 구간이 인식된 후, 많은 후보 결과가 나오면 언어 모델을 사용하여 어떤 결과가 가장 높은 확률을 가지는지 보고 가장 가능성 높은 결과를 출력했습니다. 그 응용 분야는 매우 제한적이었습니다.
하지만 이것이 근본적인 문제라는 것을 깨닫게 됩니다. 왜냐하면 당신은 세상의 확률을 모델링하고 있기 때문입니다. 언어는 제한적이지만, 그것은 세상의 투영입니다. 이론적으로 가능한 모든 토큰의 공간인 토큰 공간을 충분히 크게 만들면, 일반적인 세계 모델을 구축할 수 있습니다. 세상의 모든 것이 어떻게 발생하고 발전하는지에 확률을 할당할 수 있습니다. 모든 문제는 확률을 추정하는 방법으로 축소될 수 있습니다.
샤오쥔 장: 당신의 학문적 멘토들은 매우 저명합니다: 박사 과정 지도 교수는 Apple의 AI 책임자 Ruslan Salakhutdinov와 Google AI의 최고 과학자 William W. Cohen입니다. 두 분 모두 산업과 학계에 걸쳐 있습니다.
양즈린: 이전 몇 년 동안은 산업과 학계가 더 많이 결합되었지만, 추세는 지금 바뀌고 있습니다: 더 가치 있는 혁신은 산업에서 일어날 것입니다. 그것은 발전의 불가피한 법칙입니다. 탐색적 연구에서 시작하여 점차 더 성숙한 산업화 과정으로 전환됩니다. 이는 산업화 중에 연구가 불필요하다는 것을 의미하지 않습니다 — 단지 순수 연구만으로는 가치 있는 혁신을 만들어내기 어려울 것이라는 뜻입니다.
샤오쥔 장: 이 저명한 멘토들로부터 무엇을 배웠나요?
양즈린: 저는 Google에서 가장 많은 것을 배웠습니다. 오랫동안 인턴으로 있었습니다. 2018년 말에 Transformer 기반 언어 모델 작업을 시작했습니다. 제가 가장 크게 배운 것은 끝없는 '조각 작업' — 표면적인 세부 사항에 대한 집착적인 개선 — 에서 벗어나는 것이었습니다. 그것은 매우 중요했습니다.
큰 방향이 무엇인지, 큰 기울기가 무엇인지 봐야 합니다. 당신 앞에 열 개의 길이 있을 때, 보통 사람들은 이 특정 길에서 앞에 있는 보행자에게 어떻게 브레이크를 밟을지 — 단기적인 세부 사항 — 에 대해 걱정합니다. 하지만 열 개의 길 중에서 어느 길을 택할 것인지가 가장 중요합니다.
이 분야는 이전에 정확히 그런 문제가 있었습니다. 예를 들어, 백만 또는 이백만 개의 토큰으로만 구성된 데이터셋에서, 어떻게 혼란도를 낮출지, 어떻게 손실을 낮출지, 어떻게 정확도를 높일지 살펴보고 끝없는 조각 작업에 빠지곤 했습니다. 사람들은 많은 기괴한 아키텍처를 발명했습니다; 이것들은 조각 작업의 트릭이었습니다. 조각 작업 후에는 그런 종류의 데이터셋에서 더 나은 성능을 보일 수 있지만, 문제의 본질을 놓치게 됩니다.
본질은 이 분야에 무엇이 부족한지 분석하는 것입니다. 첫 번째 원리는 무엇인가? 왜 스케일링 법칙이 첫 번째 원리 역할을 할 수 있는가? 두 가지 조건을 만족하는 구조만 찾으면 됩니다: 첫째, 충분히 일반적이어야 합니다; 둘째, 확장 가능해야 합니다. 일반적이라는 것은 이 프레임워크 내에서 모든 문제를 모델링할 수 있다는 뜻입니다; 확장 가능하다는 것은 충분한 컴퓨팅 파워를 투입하기만 하면 계속해서 좋아진다는 뜻입니다.
이것이 제가 Google에서 배운 사고 방식입니다: 어떤 것이 더 근본적인 것으로 설명될 수 있다면, 상위 레이어에서 과도하게 조각 작업을 해서는 안 됩니다. 제가 강력히 동의하는 중요한 원칙이 있습니다: 규모로 문제를 해결할 수 있다면, 새로운 알고리즘으로 해결하지 마십시오. 새로운 알고리즘의 가장 큰 가치는 어떻게 더 잘 확장할 수 있게 해주는가에 있습니다. 조각 작업에서 벗어나면, 훨씬 더 많은 것을 볼 수 있습니다.
샤오쥔 장: Google도 그 당시 스케일링 법칙을 따르고 있었나요? 첫 번째 원리 사고 방식을 어떻게 구현했나요?
양즈린: 그러한 아이디어들이 이미 많이 존재했지만, Google은 그것들을 특히 잘 구현하지는 못했습니다. 이런 사고 방식은 가지고 있었지만, 진정한 '문샷'으로 조직화할 수는 없었습니다. 오히려 이렇습니다: 여기 다섯 명은 제 첫 번째 원리를 추구하고, 저기 다섯 명은 그들의 첫 번째 원리를 추구하는 식이었습니다. 하향식(top-down) 접근 방식은 없었습니다.
샤오쥔 장: 박사 과정 동안, 튜링상 수상자 Yann LeCun 및 Yoshua Bengio와 공동으로 논문을 발표하셨고 — 그 논문들의 제1 저자였습니다. 어떻게 그 협업이 이루어졌나요? 제 말은: 그분들은 튜링상 수상자이셨고 당신의 지도 교수도 아니셨는데 — 무엇으로 그들을 끌어들일 수 있었나요?
양즈린: 학계는 매우 개방적입니다. 좋은 아이디어와 의미 있는 문제만 있다면 괜찮습니다. 두 개의 두뇌, 또는 n개의 두뇌가 만들어내는 것은 하나의 두뇌가 만들어내는 것보다 더 많습니다. 이것은 AGI를 개발할 때도 적용됩니다. AI의 중요한 전략 중 하나는 '앙상블링(ensembling)'입니다 — 여러 다른 모델이나 방법을 사용하고 그 예측을 결합하여 더 나은 성능을 얻는 것입니다. 그것은 본질적으로 같은 일을 하는 것입니다: 다양한 관점을 가질 때, 많은 새로운 것들을 촉발할 수 있습니다. 협업은 엄청난 이점이 있습니다.
샤오쥔 장: 먼저 아이디어를 가지고 그들에게 관심이 있는지 물어보셨나요?
양즈린: 대략 그렇습니다.
샤오쥔 장: 연구 분야의 거물들을 설득하는 것과 자금 조달 분야의 자본 거물들을 설득하는 것 중 어느 것이 더 어렵나요? 공통점은 무엇인가요?
양즈린: "설득한다"는 좋은 표현이 아닙니다 — 그 뒤에 있는 본질은 협력입니다. 협력은 양측이 모두 이긴다는 것을 의미합니다. 왜냐하면 상호 이익이 협력의 전제 조건이기 때문입니다. 따라서 실제로 차이는 없습니다: 다른 사람들에게 독특한 가치를 제공해야 합니다.
샤오쥔 장: 어떻게 그들의 신뢰를 얻었나요? 당신의 재능은 무엇이라고 생각하나요?
양즈린: 특별한 재능은 없습니다 — 그저 열심히 일하는 것뿐입니다.
3부
오래된 시스템은 더 이상 작동하지 않습니다
"AGI는 새로운 종류의 조직을 필요로 합니다"
**
샤오쥔 장: 방금 "더 가치 있는 혁신은 산업에서 일어날 것"이라고 말씀하셨는데 — 여기에는 스타트업과 거대 기업들의 AI 연구소도 포함되나요?
양즈린: 연구소는 역사 속으로 사라졌습니다. Google Brain은 한때 업계에서 가장 큰 AI 연구소였지만, 그것은 대기업 내부에 내장된 연구 조직이었습니다. 그런 종류의 조직은 새로운 아이디어를 탐구할 수는 있지만, 훌륭한 시스템을 만들어내기는 매우 어렵습니다 — Transformer를 만들어낼 수는 있었지만, ChatGPT를 만들어낼 수는 없었습니다.
현재 개발 방식이 진화하는 방식은 엄청난 시스템을 구축하는 것이며, 이는 새로운 알고리즘, 견고한 엔지니어링, 그리고 심지어 많은 제품 및 상업화 작업을 필요로 합니다. 2000년대 초반과 같습니다: 연구소에서 정보 검색을 연구할 수는 없었습니다; 그것은 실제 세계에 존재해야 했고, 거대한 시스템, 사용자가 있는 제품 — Google처럼 — 이어야 했습니다. 따라서 연구 및 교육 시스템은 그 기능을 주로 인재 양성 쪽으로 전환할 것입니다.
샤오쥔 장: 이러한 새로운 형태의 시스템을 어떻게 설명하시겠습니까? OpenAI가 그 원형인가요?
양즈린: 그것은 오늘날 이러한 종류의 조직 중 가장 성숙한 형태이며, 여전히 점진적으로 진화하고 있습니다.
샤오쥔 장: 그렇다면 인류의 위대한 과학적 목표를 위해 설립된 조직으로 이해할 수 있나요?
양즈린: 강조하고 싶습니다: 그것은 순수한 과학이 아닙니다 — 과학, 공학, 비즈니스의 결합입니다. 그것은 상업 조직, 즉 회사여야 하며, 연구소가 아니어야 합니다. 하지만 이 회사는 0에서 1로 구축됩니다. 왜냐하면 AGI는 새로운 종류의 조직을 필요로 하기 때문입니다. 첫째, 생산 방식이 인터넷 시대와 다릅니다; 둘째, 순수 연구에서 연구, 엔지니어링, 제품 및 비즈니스의 결합으로 전환합니다.
핵심적으로, 그것은 문샷 프로그램이어야 하며, 많은 양의 하향식 계획을 포함해야 합니다 — 하지만 그 계획 내에는 혁신을 위한 공간이 있습니다. 왜냐하면 모든 기술이 미리 결정되어 있는 것은 아니기 때문입니다. 하향식 프레임워크 내에 상향식 요소가 존재합니다. 그러한 조직은 이전에 존재하지 않았지만, 조직은 기술에 적응해야 합니다. 왜냐하면 기술이 생산 방식을 결정하기 때문입니다; 만약 일치하지 않으면, 효과적으로 생산할 수 없습니다. 우리는 그것이 매우 likely 0부터 다시 설계되어야 할 것이라고 믿습니다.
샤오쥔 장: 작년 OpenAI 이사회 쿠데타 동안, Sam Altman을 위한 한 가지 옵션은 Microsoft에 합류하여 새로운 Microsoft AI 팀을 이끄는 것이었습니다. 그것과 OpenAI의 CEO가 되는 것의 본질적인 차이점은 무엇인가요?
양즈린: 오래된 문화 내에서 새로운 조직을 성장시켜야 할 것입니다 — 그리고 그것은 극히 어렵습니다.
샤오쥔 장: 당신은 "중국의 OpenAI"를 구축하고 싶습니까 — 그렇게 말할 수 있나요?
양즈린: 정확하지 않습니다. 우리는 어떤 중국의 버전이 되고 싶지 않으며, 반드시 OpenAI가 되고 싶은 것도 아닙니다.
첫째, 진정한 AGI는 분명히 글로벌할 것입니다. 시장 보호 메커니즘 때문에 특정 지역 시장에 갇힌 AGI 회사는 적어도 장기적으로는 존재하지 않습니다. 세계화, AGI, 그리고 매우 큰 사용자 기반을 가진 제품: 이 세 가지는 궁극적으로 필수 조건입니다.
둘째, OpenAI여야 할까요? 2017~2018년을 보면, OpenAI의 평판은 끔찍했습니다. 우리 업계 사람들이 일자리를 찾을 때, 일반적으로 Google 같은 곳을 고려했습니다. OpenAI의 최고 과학자 Ilya Sutskever와 이야기했던 많은 사람들은 그 사람이 미쳤거나 자기 과신이 너무 심하다고 생각했습니다 — OpenAI는 미치광이거나 사기꾼 집단이었습니다. 하지만 그들은 매우 일찍 헌신했고, 비합의(non-consensus)를 찾았으며, AI에서 현재 유일하게 작동하는 첫 번째 원리인 다음 토큰 예측을 통한 스케일링을 찾았습니다.
저는 OpenAI보다 더 위대한 회사가 나올 것이라고 믿습니다. 진정으로 위대한 회사는 기술적 이상주의와 훌륭한 제품을 결합하고, 사용자와 함께 창조할 수 있습니다 — AGI는 궁극적으로 모든 사용자와의 협업을 통해 생산될 것입니다. 따라서 기술만의 문제가 아닙니다; 실용주의와 현실 세계에 대한 추구도 필요합니다 — 궁극적으로는 이 둘의 완벽한 결합이 필요합니다.
그럼에도 불구하고, 우리는 OpenAI의 기술적 이상주의로부터 배워야 합니다. 모두가 당신이 평범하다고 생각한다면 — 당신의 꿈이 누구나 가질 수 있는 꿈이라면 — 그것은 인류 전체의 꿈의 총합에 아무것도 더하지 않습니다.
4부
문샷의 첫걸음은 '긴 컨텍스트' — 두 번째는 무엇인가?
"다음에 두 가지 큰 이정표가 다가오고 있습니다"
**
샤오쥔 장: 회사를 시작하기로 결정한 그 순간으로 돌아가서 — 중국에 돌아오자마자 첫 번째 자금 조달 라운드를 시작했나요?
양즈린: (작년) 2월에 미국에서 시작되었고, 일부는 원격으로 진행되었습니다. 결국에는 국내 투자자들이 대부분을 차지했습니다.
샤오쥔 장: 첫 번째 라운드에서 1억 달러를 모금했나요?
양즈린: 첫 번째 라운드는 그 정도는 아니었고, 이후 라운드에서 그 금액을 초과했습니다. 우리는 2023년에 두 번의 라운드를 완료하여 총 약 20억 위안을 모금했습니다.
이것이 지금 세 번째 라운드입니다. 공식적으로 자금 조달을 발표하지 않았기 때문에 현재로서는 논평할 수 없습니다.
샤오쥔 장: 어떤 사람들은 2023년 하반기 이후로는 아무도 파운데이션 모델 회사에 투자하려 하지 않는다고 말합니다. 그들의 말이 틀렸나요?
양즈린: 여전히 있습니다. 실제로 시장의 정서 변화를 볼 수 있지만, 아무도 투자하지 않는다는 것은 아닙니다 — 적어도 지금으로서는, 시장에 상당히 많은 투자 관심이 있습니다.
샤오쥔 장: 자본과 인력 외에도, 2023년에 내린 다른 주요 결정들은 무엇인가요?
양즈린: 무엇을 할지 결정하는 것입니다. 그것이 우리 같은 회사의 장점입니다 — 최고 의사 결정 수준에서 기술적 비전을 가지고 있다는 점이요.
우리는 긴 컨텍스트(long context)를 다룹니다. 그것은 미래에 대한 판단을 필요로 합니다: 무엇이 근본적인지, 그리고 다음에 상황이 어디로 향할지 알아야 합니다. 다시 말하지만, 그것은 첫 번째 원리, 즉 '조각 작업 제거' 과정입니다. 조각 작업에 집중하면, OpenAI가 이미 한 일만 보고 그것을 어떻게 재현할지 궁리할 수밖에 없습니다.
Kimi에서 무손실 장문 압축을 수행하는 것이 제품에 독특한 경험을 제공한다는 것을 알게 될 것입니다. 영어 논문을 읽을 때, 그것은 당신이 그것들을 놀랍도록 잘 이해하도록 도와줍니다. 오늘날 Claude나 GPT-4를 사용한다고 해서 반드시 더 잘할 수 있는 것은 아닙니다; 이것은 사전에 기반을 다지는 것이 필요했습니다. 우리는 6개월 넘게 작업했습니다. 그것은 오늘날 긴 컨텍스트 트렌드를 발견하고, 급히 두 팀을 구성하여 최대 속도로 개발하는 것과는 매우 다릅니다.
물론, 마라톤은 이제 막 시작되었을 뿐입니다. 더 많은 차별화가 올 것이며, 그러기 위해서는 '합의되지 않았지만 사실인 것'이 무엇인지 사전에 예측해야 합니다.
Zhang Xiaojun: 이 결정은 몇 월에 내려졌나요?
Yang Zhilin: 2월이나 3월이었어요. 회사가 설립되자마자 결정되었습니다.
Zhang Xiaojun: 왜 긴 컨텍스트가 첫 번째 단계인가요?
Yang Zhilin: 근본적이기 때문입니다. 그것은 새로운 컴퓨터의 메모리입니다.
기존 컴퓨터의 메모리는 지난 수십 년 동안 몇 자릿수 성장했으며, 새로운 컴퓨터에서도 같은 일이 일어날 것입니다. 이는 오늘날의 많은 문제를 해결할 수 있습니다. 예를 들어, 현재의 멀티모달 아키텍처는 여전히 토크나이저가 필요하지만, 무손실 압축된 긴 컨텍스트가 있으면 토크나이저가 필요 없습니다. 원시 입력을 직접 넣을 수 있기 때문입니다. 더 나아가, 이는 새로운 컴퓨팅 패러다임을 더 범용적으로 만드는 기초입니다.
기존 컴퓨터는 모든 것을 0과 1로 표현할 수 있었고, 모든 것을 디지털화할 수 있었습니다. 하지만 오늘날의 새로운 컴퓨터는 아직 그렇지 못합니다. 컨텍스트가 충분하지 않아 그렇게 범용적이지 않습니다. 범용적인 세계 모델이 되려면 긴 컨텍스트가 필요합니다.
둘째, 개인화를 가능하게 합니다. AI의 핵심 가치는 개인화된 상호 작용입니다. 가치는 궁극적으로 개인화에 있으며, AGI는 이전 세대의 추천 엔진보다 더 개인화될 것입니다.
하지만 개인화는 파인튜닝을 통해 이루어지는 것이 아니라, 매우 긴 컨텍스트를 지원함으로써 이루어집니다. 기계와의 전체 상호 작용 기록이 컨텍스트가 되고, 그 컨텍스트가 개인화 과정을 정의합니다. 이는 복제할 수 없으며, 더 직접적인 대화, 즉 정보를 생성하는 대화를 가능하게 합니다.
Zhang Xiaojun: 이를 확장할 여지는 얼마나 되나요?
Yang Zhilin: 엄청납니다. 한편으로는 윈도우 자체를 확장하는 것도 아직 갈 길이 멉니다. 몇 자릿수 더 확장해야 합니다.
다른 한편으로는 윈도우만 확장해서는 안 되고, 숫자만 봐서도 안 됩니다. 오늘날 윈도우가 수백만 토큰이든 수십억 토큰이든 그 자체로는 의미가 없습니다. 그 윈도우 내에서 가능한 추론 능력, 원본 정보에 대한 충실도, 그리고 명령 수행 능력을 봐야 합니다. 단일 지표를 쫓아서는 안 되며, 지표와 역량을 결합해야 합니다.
이 두 차원이 계속 개선된다면, 엄청난 일을 할 수 있습니다. 수만 단어 길이의 명령을 따를 수 있고, 그 명령 자체가 여러 에이전트를 정의할 수 있습니다. 매우 개인화된 방식으로 말이죠.
Zhang Xiaojun: 긴 컨텍스트 뒤에 있는 기술과 GPT-4를 따라잡는 기술은 서로 재사용 가능한가요? 같은 것인가요?
Yang Zhilin: 그렇지 않다고 생각합니다. 오히려 새로운 차원을 추가하는 것에 가깝습니다. GPT-4가 가지지 못한 차원 말이죠.
Zhang Xiaojun: 많은 사람들이 중국의 주요 파운데이션 모델 회사들이 모두 거의 같은 일을 하고 있다고 말합니다. 2023년에는 GPT-3.5를, 2024년에는 GPT-4를 쫓고 있다고요. 동의하시나요?
Yang Zhilin: 일반적인 역량을 향상시키는 것은 분명 중요한 이정표가 있으므로, 그 말은 어느 정도 맞습니다. 후발 주자로서 필연적으로 따라잡는 과정을 거치게 됩니다. 하지만 그것은 일면적인 시각이기도 합니다. 일반적인 역량 외에도 독특한 역량을 개발하고 특정 방향에서 최고 수준에 도달할 수 있는 공간이 많이 있습니다. 긴 컨텍스트가 그중 하나입니다. DALL-E 3의 이미지 생성 성능은 Midjourney V6에 완전히 뒤쳐집니다. 따라서 두 가지 측면 모두에서 작업해야 합니다.
Zhang Xiaojun: 일반 역량과 새로운 차원에 투자하는 시간과 자원의 비율은 어떻게 되나요?
Yang Zhilin: 두 가지는 결합되어야 합니다. 새로운 차원은 일반 역량과 별개로 존재할 수 없기 때문에 직접적인 비율을 말하기는 어렵습니다. 하지만 새로운 차원을 제대로 구현하려면 충분한 투자가 필요합니다.
Zhang Xiaojun: 이 모든 새로운 차원들이 Kimi를 통해 구현되나요?
Yang Zhilin: Kimi는 확실히 우리에게 매우 중요한 제품이며, 다른 시도들도 있을 것입니다.
Zhang Xiaojun: Shixiang의 창립자 Li Guangmi가 중국 파운데이션 모델 회사들의 기술적 차별성이 오늘날에도 여전히 높지 않다고 말한 것에 대해 어떻게 생각하시나요?
Yang Zhilin: 괜찮다고 생각합니다. 우리는 이미 오늘날 상당한 차별화를 만들어냈습니다. 시간 문제일 뿐입니다. 올해에는 더 많은 차원을 보게 될 것입니다. 작년에는 모두가 뼈대를 세우고 시스템을 먼저 가동하는 데 집중하고 있었습니다.
Zhang Xiaojun: 첫 번째 단계가 긴 컨텍스트라면, 두 번째 단계는 무엇인가요?
Yang Zhilin: 앞으로 두 가지 큰 이정표가 있을 것입니다. 첫째, 진정한 통합 세계 모델입니다. 모든 다른 모달리티를 통합하고, 진정으로 확장 가능하고 범용적인 아키텍처입니다.
둘째, 인간의 데이터 입력 없이 AI가 계속 진화할 수 있도록 하는 것입니다.
Zhang Xiaojun: 이 두 이정표에 도달하는 데 얼마나 걸릴까요?
Yang Zhilin: 2~3년, 아마도 더 빠를 수도 있습니다.
Zhang Xiaojun: 그럼 3년 후면 우리는 오늘날과는 완전히 다른 세상을 보고 있겠네요.
Yang Zhilin: 현재 개발 속도라면 그렇습니다. 기술은 이제 막 싹트고 빠르게 성장하는 단계에 있습니다.
Zhang Xiaojun: 3년 후에는 어떤 것들이 존재할 거라고 상상하시나요?
Yang Zhilin: 어느 정도의 AGI가 존재할 것입니다. 오늘날 우리가 하는 많은 일들을 AI도 할 수 있을 것입니다. 심지어 우리보다 더 잘할 수도 있습니다. 하지만 핵심은 우리가 그것을 어떻게 사용하느냐입니다.
Zhang Xiaojun: 그리고 Moonshot AI라는 회사로서 당신의 두 번째 단계는 무엇인가요?
Yang Zhilin: 우리는 그 두 가지 일을 할 것입니다. 나머지 모든 문제들은 이 두 가지 요소에서 파생됩니다. 사람들이 오늘날 이야기하는 추론과 에이전트는 이 두 가지 문제를 해결하는 과정의 부산물입니다. 약간의 추가 작업이 필요하지만, 근본적인 장애물은 없습니다.
Zhang Xiaojun: GPT-4를 따라잡는 데 모든 것을 쏟아부을 건가요?
Yang Zhilin: GPT-4는 AGI로 가는 길에 필요한 정거장입니다. 핵심은 단순히 GPT-4와 같아지는 것에 만족하지 않는 것입니다. 첫째, 지금 진정한 '합의되지 않은 것'이 무엇인지 물어봐야 합니다. GPT-4 너머에 무엇이 있는가? GPT-5와 GPT-6는 어떤 모습이어야 하는가? 둘째, 그 안에서 당신이 가진 독특한 역량이 무엇인지 봐야 하며, 그것이 더 중요합니다.
Zhang Xiaojun: 다른 파운데이션 모델 회사들은





