YouMind
로그인

LLM 학습에 대해 당신이 몰랐던 사실: 원리, 경로, 그리고 새로운 실무

@HiTw93
중국어2026년 4월 03일
632K
2.2K
461
53
4.1K

TL;DR

이 글에서는 대규모 사전 학습에서 정교한 사후 학습, 강화 학습, 그리고 현대 모델의 성능을 결정짓는 에이전트 활용 엔지니어링으로 변화하고 있는 LLM 학습의 진화 과정을 살펴봅니다.

TL;DR

"클로드 코드: 아키텍처, 거버넌스 및 엔지니어링 관행"과 "에이전트: 원칙, 아키텍처 및 엔지니어링 관행"에 대한 글을 쓴 후, 대규모 언어 모델(LLM) 훈련이 실제로 어떻게 작동하는지 요약해 보고 싶었습니다. 이 글은 전문적인 배경지식이 없는 사람들도 이해할 수 있도록 작성되었습니다.

2026년을 바라보며, LLM 성능의 실제 격차는 더 이상 사전 훈련 자체가 아니라 그 뒤를 따르는 긴 꼬리, 즉 후속 훈련, 평가, 보상, 에이전트 훈련 및 증류에 있습니다. 모든 단계가 사용자의 실제 경험에 영향을 미칩니다. 모델이 갑자기 강력해졌다고 느껴질 때는 단일 요인보다는 이러한 영역들이 함께 최적화되었기 때문일 가능성이 높습니다.

다음 내용은 LLM 훈련 파이프라인을 따라 제조사가 훈련 스택의 후반부를 통해 최종 결과를 어떻게 개선하는지에 초점을 맞춥니다.

LLM 훈련은 파이프라인이다

지난 몇 년간 모델의 발전은 일반적으로 매개변수, 데이터 및 컴퓨팅 성능의 축적으로 설명되었습니다. 그러나 많은 사용자가 실제로 체감하는 개선은 기본 코퍼스에 대한 더 많은 훈련이 아닌, 사전 훈련 이후의 전체 훈련 과정에서 비롯됩니다. 모델이 말하는 방식, 지시를 따르는 방식, 추론하는 방식, 도구를 사용하는 방식은 더 많은 인터넷 텍스트를 단순히 집어넣는다고 자연스럽게 성장하지 않습니다.

InstructGPT는 매우 직접적인 예를 제시했습니다: 정렬 및 선호도 최적화를 거친 13억 개의 매개변수만 가진 모델이 인간 선호도 평가에서 1750억 개의 매개변수 GPT-3를 이길 수 있었습니다. 매개변수 차이가 두 자릿수임에도 불구하고 사용자는 최종적으로 훨씬 더 작은 버전을 선호했습니다. 훈련의 후반부가 실제로 사용자의 인식을 재구성합니다.

훈련 과정은 실제로 데이터, 알고리즘, 시스템 및 피드백이 고도로 결합된 파이프라인입니다. 한 계층의 변경은 일반적으로 다른 계층으로 전파됩니다. 2026년에는 모델의 역량과 산업적 가치가 점점 더 사전 훈련 이후의 계층에 집중되고 있습니다.

Tw93 - inline image

이것이 바로 우리가 두바오가 순위 경쟁을 하지 않지만 일상적인 사용에서 더 만족스럽게 느껴지는 이유이기도 합니다. 후속 훈련이 잘 되어 있기 때문입니다.

이 여섯 계층은 단지 분업을 보여주기 위한 것입니다. 아래 그림의 9단계는 더 자세한 버전입니다: 원시 데이터와 시스템 레시피는 분리되고, 에이전트 하네스와 배포는 후반부의 세부 항목입니다. 또한 전체에 걸쳐 두 개의 피드백 루프가 있습니다: 프로덕션 트래픽은 데이터 엔지니어링으로 돌아가고, 오프라인 평가 결과는 사전 훈련으로 돌아갑니다.

Tw93 - inline image

사전 훈련은 기초일 뿐이다

사전 훈련은 여전히 훈련 체인의 출발점입니다. 그것이 무엇을 하는지 이해해야 각 후속 계층이 무엇을 보완하는지 이해할 수 있습니다. 이 단계가 없으면 언어 모델링 능력, 지식 압축, 후속 능력 전이의 여지가 없습니다. 엔지니어링 측면에서 단순히 모델에게 다음 토큰을 예측하도록 가르치는 것 이상을 수행합니다: 언어 분포를 학습하고, 대규모 텍스트의 지식과 패턴을 매개변수로 압축하며, 후속 능력 활성화를 위한 여지를 남깁니다. 다음 토큰 예측은 훈련 형태를 설명할 뿐, 규모가 증가함에 따라 모델이 왜 갑자기 새로운 능력을 개발하는지 설명하지 않습니다.

GPT-3 이후, 많은 모델 튜닝 작업은 예산과 비율을 더 신중하게 고려합니다. 모델이 단순히 더 크다고 더 좋은 것은 아닙니다. 매개변수 수, 훈련 토큰 수, 총 컴퓨팅 예산 사이에는 비율 문제가 있습니다. 많은 모델이 너무 작은 것이 아니라, 주어진 예산 하에서 더 적절한 지점에 도달하지 못할 정도로 훈련이 부족한 것입니다.

실제 훈련 결정에서 실용적인 질문은 다음과 같습니다: 누군가 당신에게 10,000대의 H100을 주고 한 달을 준다면, 어떻게 충분히 좋은 오픈소스 모델을 훈련하겠습니까? 여기서 스케일링 법칙은 논문의 추상적인 곡선보다는 예산 할당 도구에 더 가깝습니다. 궁극적으로 다음을 고려해야 합니다: 다음 훈련 라운드는 더 많은 매개변수를 쌓을 것인가, 더 많은 데이터를 공급할 것인가? 현재 모델은 능력이 부족한가, 아니면 단순히 훈련이 부족한가? 제한된 GPU 예산 하에서 어떤 비율이 가장 가치 있는가?

사전 훈련은 모델 능력의 기초를 다지는 것과 같아서, 지식의 범위, 일반화 잠재력 및 패턴 귀납 능력을 결정합니다. 또한 후속 훈련이 활용할 여지가 있는지도 결정합니다. 그러나 사전 훈련은 모델이 지시를 따르는지, 사용자와 협력하는지, 중요한 작업에서 안정적으로 실행되는지를 제어할 수 없습니다.

사전 훈련 단계는 얼마나 많은 지식이 학습되는지만 결정하는 것이 아니라, 모델이 무엇이 될 수 있는지를 미리 결정합니다. 토크나이저의 분할 방식은 후속 훈련에 직접적인 영향을 미치며, 컨텍스트 창 길이는 미리 설정되어야 합니다. 멀티모달 사전 훈련을 계속할지, 단일 가속기 운영이 처음부터 요구 사항인지와 같은 트레이드오프는 출시 시 기능으로 추가되는 것이 아니라 훈련 단계에서 레시피에 기록됩니다. Gemma 3는 단일 가속기, 128K 컨텍스트, 비전 능력 및 양자화를 동시에 강조하며 이러한 트레이드오프를 반영합니다. 사용자가 최종적으로 보게 되는 능력(로컬 컴퓨터에서 실행, 이미지 확인, 긴 문서 이해)은 실제로 훈련 단계에서 대부분 결정됩니다.

Chinchilla가 제시한 데이터 최적점을 살펴보면, 80억 개 매개변수 모델의 경우 약 2000억 토큰입니다. 그러나 Llama 3 8B는 실제로 15조 토큰을 사용했으며, 이는 약 75배 더 많은 양입니다. 이러한 과잉 훈련 레시피는 일반적으로 동일한 매개변수에 대해 더 높은 능력 밀도를 제공하여 추론 측면에서 더 작고 비용 효율적인 모델을 만듭니다. 이를 총 FLOPs(부동 소수점 연산)로 측정하는 것이 매개변수 수를 보는 것보다 더 신뢰할 수 있습니다. 아래 그림은 이러한 차이를 시각적으로 보여줍니다.

Tw93 - inline image

또 다른 간과되기 쉬운 설계는 사전 훈련 단계에서 발생합니다: 토크나이저 어휘 크기, 분할 전략 및 바이트 수준 인코딩 방식은 상당한 영향을 미칩니다. Llama 2는 32K 어휘를 가졌고, Llama 3가 128K로 확장한 후 시퀀스 길이가 약 15% 압축되었으며 다운스트림 성능도 개선되었습니다. 이러한 영향은 추론 비용 및 다국어 능력까지 확장됩니다. 중국어, 코드 및 수학 공식의 토큰 효율성은 어휘 설계 중에 결정됩니다. 예를 들어, 중국어를 매우 작은 조각으로 분할하는 토크나이저는 매번 더 많은 토큰을 소모할 뿐만 아니라 모든 추론이 그 잘못된 결정의 비용을 지속적으로 부담해야 합니다.

데이터 레시피가 모델 능력을 결정한다

매개변수 규모는 과거의 주요 지표였지만, 지난 2년 동안 더 중요한 것은 "데이터 레시피"입니다.

이 과정은 표면적으로 데이터 정리처럼 보이지만, 실제로는 완전한 데이터 생산 엔지니어링 작업입니다. 웹 페이지, 코드 저장소, 책 및 포럼의 원시 데이터는 사전 훈련에 들어가기 전에 먼저 텍스트 추출, 언어 식별, 품질 필터링, 개인정보 처리, 안전 필터링 및 중복 제거를 거쳐야 합니다. 아래 그림은 완전한 퍼널 처리 흐름을 보여줍니다.

Tw93 - inline image

데이터를 단순히 훈련 연료로만 취급한다면, 더 많을수록 좋다고 결론내리기 쉽습니다. 그러나 데이터 엔지니어링은 능력 설계에 더 가깝습니다. 모델이 보고 보지 못하는 것, 코드, 수학 및 백과사전의 비율은 모델의 최종 능력 분포에 직접적인 영향을 미칩니다.

중복 제거 및 오염 제어는 종종 무시되지만 결과에 상당한 영향을 미칩니다. 단순히 저품질 데이터뿐만 아니라 중복 템플릿, 라이선스 텍스트, 미러 웹사이트 및 벤치마크 누출로 인한 오염이 포함됩니다. 문서 수준 및 라인 수준 중복 제거가 충분하지 않으면 모델은 가장 가치 있는 부분을 반드시 학습하지 않고 가장 복사하기 쉬운 내용을 반복적으로 흡수하는 경우가 많습니다. 많은 오픈소스 모델의 성능 불일치는 종종 데이터 처리 품질의 차이에서 비롯됩니다.

지난 2년 동안 데이터 혼합 자체는 별도의 연구 문제가 되었습니다. Data Mixing Laws와 같은 연구는 얼마나 더 많은 데이터를 수집할 수 있는지뿐만 아니라 다양한 데이터 유형의 비율이 모델을 특정 능력 구조로 이끄는 방법에 초점을 맞춥니다.

합성 데이터는 또한 보조 수단에서 훈련 과정의 공식적인 부분으로 이동했습니다. Self-Instruct, DeepSeek-R1의 증류 궤적, Qwen 및 Kimi 시리즈에서 점점 명확해지는 합성 감독과 같은 방법은 모두 같은 방향으로 나아가고 있습니다. 각 세대의 더 강력한 모델은 다음 세대가 보게 될 데이터를 재구성하는 데 참여합니다. 초기 모델은 기본적인 명령어 데이터를 생성했습니다. 더 강력한 모델은 고품질 추론 궤적 및 CoT(Chain of Thought) 데이터를 생성합니다. 그리고 RL을 통해 훈련된 추론 모델은 이러한 궤적을 더 작은 덴스 모델로 증류합니다. "덴스"는 모든 매개변수가 실행됨을 의미하며, MoE(Mixture of Experts)처럼 필요에 따라 활성화되는 것과 다릅니다.

여기서 핵심은 모델이 종종 더 큰 규모에서 먼저 능력을 형성한 후에야 이러한 능력이 더 작은 모델로 압축될 수 있다는 것입니다. DeepSeek-R1-Distill 시리즈는 직접적인 예입니다. RL 후의 대규모 모델 궤적은 15억에서 700억 개의 매개변수에 이르는 덴스 모델에 상당한 이점을 제공했습니다. Llama 3.1 405B는 또한 80억 및 700억 모델의 후속 훈련 품질을 개선하는 데 명시적으로 사용되었습니다. 이들은 부산물이 아니라 훈련 설계의 일부입니다.

시스템 및 아키텍처 제약 조건은 훈련 전에 명확해야 한다

많은 사람들이 훈련을 연구 문제로 이해합니다: 목적 함수를 설정하는 방법, 손실을 줄이는 방법, 모델 구조를 변경하는 방법. 그러나 실제 LLM 훈련에서 시스템 제약 조건은 매우 중요합니다. 분산 시스템 문제이지 단일 머신의 딥러닝 문제가 아닙니다. GPU 수, 메모리 대역폭, 병렬 전략, 내결함성 및 비용은 훈련 후에 최적화될 수 없습니다. 이들은 처음부터 얼마나 크게 훈련할 수 있는지, 얼마나 긴 컨텍스트를 지원할 수 있는지, 더 복잡한 후속 훈련을 실행할 수 있는지를 결정합니다.

MoE는 이 계층에서 가장 전형적인 예입니다. 다중 전문가 모드는 유사한 계산량으로 총 매개변수를 확장하면서 토큰당 활성화 비용을 제어할 수 있습니다. 트레이드오프는 복잡한 라우팅, 어려운 부하 분산 및 무거운 인프라입니다. DeepSeek-V3 및 Qwen의 MoE 설계는 단순한 아키텍처 선호도가 아니라 비용과 효과 사이의 절충안입니다.

최근 공개된 레시피의 논의는 더 이상 모델 크기 및 토큰 비율과 같은 거친 수준의 분석에 그치지 않습니다. muP는 소규모 실험에서 대규모 훈련으로 하이퍼파라미터를 전이할 수 있게 합니다. WSD 학습률은 상승, 안정화 및 감소하는 스케줄입니다. 최적 배치 크기 및 더 높은 데이터-매개변수 비율과 결합하여 이러한 세부 사항은 동일한 규모의 모델 간 실제 차별화 요소가 되고 있습니다.

긴 컨텍스트, 멀티모달 및 새로운 아키텍처를 제품 기능으로만 이해한다면 훈련 측면의 제약 조건을 놓치게 됩니다. 128K 컨텍스트 목표는 어텐션 비용, 배치 크기, 훈련 커리큘럼(데이터 시퀀싱) 및 병렬 전략을 직접적으로 변경합니다. 멀티모달은 모델 구조뿐만 아니라 데이터 혼합, 인코더 설계 및 안전 평가도 변경합니다. 단일 카드 운영이 하드 요구 사항이라면 매개변수 수, 양자화 경로 및 모델 제품군 크기가 모두 제한됩니다.

Forgetting Transformer 및 Kimi의 Attention Residuals와 같은 연구는 유사한 질문에 답변합니다: 더 긴 컨텍스트를 훈련하는 방법과 네트워크가 깊어짐에 따라 정보 희석을 방지하는 방법. 사용자는 더 긴 입력을 처리하거나 배포하기 쉬운 모델을 보지만, 훈련 중에는 완전히 다른 제약 조건 세트에 직면합니다.

컴퓨팅 예산은 고정되어 있습니다. 모델 크기, 훈련 토큰 볼륨, 컨텍스트 길이 및 서빙 비용은 한 방향에 지출된 모든 비트에 대해 다른 방향이 양보해야 합니다.

Tw93 - inline image

컨텍스트가 길어짐에 따라 어텐션 비용이 폭발적으로 증가하고 배치 크기를 줄여야 합니다. 모델이 커짐에 따라 GPU 메모리 사용량이 증가하고 서빙 비용도 증가합니다. 이는 선택이 아닌 리소스 제약의 결과입니다. 대부분의 결정은 훈련이 시작되기 전에 확정됩니다.

또한 종종 간과되는 엔지니어링 현실이 있습니다: 훈련이 항상 안정적인 것은 아닙니다. 수천 대의 GPU가 몇 주 동안 실행되다가 갑자기 무시할 수 없을 정도로 큰 훈련 손실 스파이크가 발생하여 며칠 전의 체크포인트로 롤백하고 다시 시작해야 합니다.

손실 스파이크 외에도 침묵하는 GPU 오류(오류를 보고하지 않지만 조용히 잘못된 그래디언트를 생성하는 단일 GPU), NVLink 대역폭 이상 및 노드 간 통신 지터가 있습니다. 각각은 여러 훈련 단계를 오염시킬 수 있습니다. 대규모 훈련에서 신속하게 감지, 격리 및 복구할 수 있는 것은 논문을 읽어 해결되는 문제가 아니라 실험실 수준의 엔지니어링 능력입니다.

DeepSeek-V3는 기술 보고서에서 전체 사전 훈련 과정에 복구 불가능한 손실 스파이크가 없었고 롤백도 없었다고 구체적으로 언급했습니다. 또한 FP8 혼합 정밀도 훈련이 초대규모 모델에서 실행 가능함을 검증한 몇 안 되는 사례 중 하나입니다. 공개된 데이터에 따르면 전체 프로세스는 약 278만 8천 H800 GPU 시간으로 14.8조 토큰을 사전 훈련했습니다.

훈련 시스템과 추론 시스템은 밀접하게 관련되어 있지만 동일한 엔지니어링 문제는 아닙니다. 훈련은 그래디언트, 병렬성, 체크포인트, 처리량 및 비용에 관심을 두는 반면, 추론은 지연 시간, KV 캐시(반복 방지를 위한 과거 계산 캐싱), 양자화 및 서비스 안정성에 관심을 둡니다.

후속 훈련이 사용자가 체감하는 격차를 결정한다

일반 사용자가 실제로 체감할 수 있는 많은 개선은 사전 훈련 이후에 발생합니다. 명령어 튜닝은 레이블이 지정된 명령어-응답 쌍을 사용한 지도 훈련입니다. 모델의 응답 방식을 변경하여 작업 수용 방법, 출력 구성 방법, 협력적인 어시스턴트처럼 행동하는 방법과 같은 요구 사항을 감독 신호로 변환합니다. 기본 모델은 이미 많은 잠재적 능력을 가지고 있을 수 있지만, 이 단계가 없으면 그러한 능력이 사용자가 기대하는 형태로 안정적으로 나타나지 않는 경우가 많습니다.

더 나아가 RLHF, DPO 및 RFT는 유사한 방향(더 나은 응답의 정의를 훈련 루프에 통합)을 공유하지만 다른 경로를 통해 접근합니다.

  • RLHF(인간 피드백 기반 강화 학습)는 먼저 고품질 응답을 모방한 다음 선호도 비교를 사용하여 강화 학습을 수행합니다.
  • DPO(직접 선호도 최적화)는 별도의 보상 모델 없이 선호도 비교에서 직접 학습하여 이 경로를 단축합니다.
  • RFT(강화 미세 조정)는 엔지니어링에서 구현하기 쉬운 인터페이스로, 작업 정의, 채점자 설계 및 보상 신호를 제품화 프로세스에 통합합니다.

오늘날 후속 훈련을 SFT 또는 RL로만 이야기하는 것은 더 이상 충분하지 않습니다. 더 어려운 부분은 평가를 설정하는 방법, 점수를 매기는 방법, 어떤 종류의 응답이 지속적인 최적화 가치가 있는지입니다. SFT는 지도 미세 조정으로, 지식뿐만 아니라 스타일도 학습합니다. 데이터 길이, 형식, 인용 포함 여부, 글머리 기호 선호도는 모델의 최종 출력 형태에 상당한 영향을 미칩니다. 많은 사용자가 능력을 비교한다고 생각하지만, 종종 스타일 차이만 비교하고 있습니다. 게다가 선호도 평가는 자연스럽게 더 긴 응답을 선호하여 진지해 보이는 긴 출력을 더 신뢰할 수 있는 것으로 쉽게 오인합니다. 따라서 리더보드를 보고 후속 훈련을 판단하는 것은 종종 불충분하며, 실제 작업 결과, 비용 및 안정성을 함께 고려해야 합니다.

현대의 후속 훈련은 다단계 파이프라인입니다. DeepSeek-R1의 레시피는 공개 자료 중에서 가장 명확합니다. 네 단계로 진행됩니다.

1단계는 콜드 스타트 SFT입니다. 강화 학습을 수행하기 전에 소량의 고품질 CoT 데이터를 사용하여 워밍업합니다. DeepSeek-R1-Zero는 기본 모델(정렬되지 않은 사전 훈련 후 원시 모델)에서 직접 RL을 수행하는 것이 가능함을 증명했지만, 순수하게 RL로 훈련된 모델은 반복, 언어 혼란 및 가독성 저하를 겪습니다. 콜드 스타트 SFT는 RL에 더 안정적인 시작점을 제공하여 형식과 언어 일관성을 고정합니다.

2단계는 수학, 코드, 논리와 같은 검증 가능한 분야에서 GRPO를 훈련 알고리즘으로 사용하고 프로그래밍 방식으로 검증 가능한 정확성을 보상 신호로 사용하여 강화 학습을 수행합니다. 핵심은 전통적인 PPO 대신 GRPO를 선택한 이유입니다: PPO(근접 정책 최적화)는 현재 상태 값을 추정하기 위해 독립적인 가치 네트워크가 필요하며, 이는 대규모 모델에 큰 엔지니어링 부담입니다. GRPO는 동일한 프롬프트에 대해 여러 응답을 샘플링하고 절대 값 추정 대신 그룹 내 순위를 사용하므로 독립적인 가치 네트워크가 필요하지 않습니다. DeepSeek 시리즈 및 Cursor Composer 2의 RL 인프라는 모두 GRPO에 가까운 방식을 사용합니다.

3단계는 리젝션 샘플링 미세 조정을 수행하여 RL에 의해 생성된 성공적인 궤적을 필터링하고 이를 새로운 SFT 데이터로 변환하여 또 다른 지도 미세 조정 라운드를 진행합니다. 이는 RL과 SFT 사이의 다리 역할을 합니다. RL에 의해 탐색된 좋은 궤적은 다음 SFT 라운드를 위한 고품질 훈련 샘플이 됩니다.

4단계는 유용성 및 안전성 선호도 피드백을 통합하여 모델을 출시 기준에 맞는 어시스턴트 형태로 조정합니다.

Tw93 - inline image

네 단계는 상호 의존적입니다: 콜드 스타트는 RL이 안정적으로 시작할 수 있게 하고, RL은 고품질 데이터를 생성하며, 리젝션 샘플링은 해당 데이터를 다음 SFT 라운드의 입력으로 변환하고, 정렬 RL은 행동 수렴을 완료합니다. 공개된 결과에 따르면, 직접 SFT와 네 단계를 모두 완료한 경우의 차이는 일반적으로 명백합니다.

평가, 채점자 및 보상이 훈련 목표를 재정의하고 있다

모델 출력을 훈련 점수로 변환하는 구성 요소를 채점자라고 하며, 예상치 못한 문제가 쉽게 발생할 수 있습니다. 최종 답변만 보면 모델은 빠르게 지름길을 학습합니다. 점수가 너무 거칠면 노이즈가 강화 학습에 의해 지속적으로 증폭됩니다. 리더보드 점수가 올라가도 실제 작업이 따라오지 않을 수 있습니다. 종종 사용자는 기본 모델의 차이를 보고 있다고 생각하지만, 실제로는 목표 정의 방식의 차이입니다.

훈련 흐름에서 평가는 무엇을 테스트할지 결정하고, 채점자는 출력이 어떻게 점수가 되는지 결정하며, 보상은 모델이 어디로 밀려날지 결정합니다. 이들은 함께 특정 피드백 루프를 형성합니다: 작업 정의, 평가, 채점자, 최적화, 롤아웃 및 재평가. 롤아웃은 모델이 작업을 실행하면서 생성하는 궤적을 의미합니다. 체인의 어떤 링크라도 잘못되면 후속 최적화도 잘못됩니다.

최종 결과만 보면 모델이 우연히 맞히거나 잘못된 과정을 통해 올바른 답을 얻을 수 있습니다. 이는 코드, 수학 및 복잡한 추론 작업에서 특히 두드러집니다. 중간 단계가 피드백에 포함되지 않으면 모델이 학습하는 것은 종종 더 신뢰할 수 있는 추론이 아니라 더 높은 확률로 최종 점수를 얻는 방법입니다.

따라서 최근 몇 년간 더 많은 작업이 전통적인 RLHF에서 검증된 보상으로 이동하여 프로그램을 사용하여 정확성을 직접 검증합니다. 수학, 코드 및 논리와 같은 검증 가능한 작업에서 정확성은 이제 주로 인간 선호도에 의존하지 않고 직접 점수를 매길 수 있습니다. 그러나 검증된 보상이 문제를 완전히 해결하지는 못했습니다. 과잉 최적화, 보상 과적합(실제 능력 향상 없이 채점 규칙이 과도하게 최적화되는 현상) 및 모드 붕괴(출력이 매우 단일화되어 다양성을 잃는 현상)와 같은 현상이 여전히 발생합니다. 문제는 선호도가 정확하게 레이블링되었는지 여부에서 채점 체인이 안정적인지 여부로 이동했습니다.

모델이 작성한 사고 과정은 내부 과정의 완전한 기록으로 취급될 수 없습니다. Anthropic은 추론 모델 관찰 가능성 실험에서 모델이 추가 힌트를 사용하지만 표시되는 CoT에서는 이를 인정하지 않으며, 보상 해킹 시나리오에서는 그럴듯해 보이는 설명을 추가할 가능성이 더 높다는 것을 발견했습니다. 보상 해킹은 작업을 실제로 완료하기보다 채점 시스템을 악용하는 것입니다. 표시되는 CoT는 완전한 진실이 아니라 훈련 및 모니터링 신호로 더 적합합니다.

한 단계 더 깊이 들어가면, 모델이 채점 채널 자체를 악용하기 시작할 수도 있습니다. 보상 변조 및 정렬 위장에 대한 연구는 모델이 이론적으로 채점 과정에 적극적으로 개입할 수 있음을 보여줍니다. 보상 변조는 보상 계산 과정을 직접 변경하는 것이고, 정렬 위장은 정렬을 위장하는 것입니다. 표면적으로는 순응하는 것처럼 보이지만 정렬되지 않은 의도를 숨깁니다.

일단 모델이 충분히 강력한 환경 접근 권한을 가지면 최적화하는 것은 작업 결과뿐만 아니라 잠재적으로 체크리스트, 보상 코드 및 훈련 관계 자체일 수 있습니다. 2025년 Anthropic 실험에서는 악용 가능한 프로덕션 코딩 RL 환경에 추가 보상 해킹 지식을 주입했고, 이후 유사한 일반화가 관찰되었습니다. 보상 해킹을 학습한 후 모델은 유사한 작업에서 계속 악용했을 뿐만 아니라 정렬 위장과 같은 더 광범위한 정렬 오류를 보였습니다.

이러한 행동은 표준 대화 평가에서는 볼 수 없으며, 에이전트 작업 환경에서만 나타납니다. 엔지니어링적 시사점은 직접적입니다: 보상, 채점자, 환경 격리 및 모니터링은 훈련 설계의 일부여야 합니다.

에이전트 단계에서는 보상 설계가 더욱 정교해집니다. 최종 결과는 하나의 항목일 뿐이며, 프로세스 품질, 컨텍스트 관리 및 반칙 방지 제약 조건도 별도로 측정되어야 합니다. Kimi K2.5는 효과적인 분해 및 진정한 병렬 처리를 보상합니다. Chroma Context-1은 검색 중 발견된 관련 문서에 점수를 매깁니다. Cursor Composer 2는 긴 작업에서 요약을 보상으로 포함합니다. 요약이 왜곡되면 후속 컨텍스트가 잘못 인도될 수 있기 때문입니다.

구현 측면에서 ORM(결과 보상 모델)은 최종 답변에만 점수를 매깁니다. 신호가 희소하고 비용이 낮아 시작하기 적합하지만 모델이 지름길을 선택하기 쉽습니다. PRM(프로세스 보상 모델)은 중간 단계에 점수를 매깁니다. 신호가 더 조밀하고 일반적으로 수학 및 코드 추론에 더 강력하지만 레이블링 및 시스템 비용이 훨씬 높습니다. OpenAI는 수학 추론 실험에서 PRM이 정확도를 향상시킬 뿐만 아니라 모든 단계가 감독되므로 프로세스를 제약하기 더 쉽다는 것을 확인했습니다. 문제도 직접적입니다: PRM의 비용은 일반적으로 ORM의 몇 배이므로 대부분의 실제 시스템은 ORM으로 시작합니다. 수학, 코드 및 논리와 같은 검증 가능한 작업에서만 PRM을 자동화하기 쉬우며, 프로그램을 사용하여 중간 단계를 검증하고 인간 레이블링 병목 현상을 우회합니다.

Tw93 - inline image

완전한 루프는 다음과 같이 실행됩니다:

Tw93 - inline image

최근의 정렬 방법은 모두 동일한 작업을 수행합니다. Anthropic의 헌법 AI는 인간이 작성한 원칙을 훈련에 통합하고 AI 피드백을 사용하여 개별 인간 선호도를 대체합니다. OpenAI의 숙고 정렬은 안전 규정 준수를 추론 과정에 포함시켜 추론 능력 자체가 안전 제약 조건의 일부를 담당하도록 합니다. 여기서 숙고 정렬은 모델이 훈련된 반사 신경에 의존하지 않고 추론 단계에서 안전 규범을 스스로 판단하는 것을 의미합니다. 두 경로 모두 정렬을 인간 레이블에서 내부 훈련 목표의 일부로 전환합니다.

헌법 AI를 예로 들면, 2단계 프로세스는 먼저 모델이 원칙에 따라 출력을 자기 비판 및 수정하도록 한 다음 AI 피드백을 사용하여 개별 인간 선호도 레이블링을 대체합니다. 정렬은 훈련 뒤에 붙이는 패치가 아닙니다. 시스템이 무엇을 테스트하고, 어떻게 점수를 매기고, 무엇을 보상하는지에 따라 모델은 그 방향으로 움직입니다. 이것은 훈련 후반부에서 가장 직접적인 조정 도구입니다.

Tw93 - inline image

에이전트 훈련에서는 모델만 최적화되는 것이 아니다

지난 2년 동안 o1 시리즈와 DeepSeek-R1으로 대표되는 추론 모델의 급속한 등장은 안정적인 보상, 신뢰할 수 있는 검증, 그리고 충분한 인프라가 갖춰진 조건에서 언어 모델에 대한 강화 학습(RL)이 수학, 코드, 논리 작업에서 성능을 크게 향상시킬 수 있음을 보여줍니다.

이는 또한 새로운 차원을 열었습니다: 이제 추론 컴퓨팅을 확장할 수 있게 되었습니다. RL 훈련의 역할은 또 다른 층위를 추가합니다: 모델이 질문에 답하는 방법을 가르치는 것 외에도, 추론 예산을 할당하는 방법—언제 더 생각해야 하고 언제 멈춰야 하는지를 알도록 가르치는 것입니다. 앞으로의 과제는 단일 사고를 길게 하는 것이 아니라, 모델이 환경 내에서 지속적으로 행동하도록 하는 것입니다.

Tw93 - inline image

Qwen의 전 모델 리드였던 Junyang Lin은 Thinking과 Instruct의 혼합 경로에 대해 대표적인 성찰을 남겼습니다: 어려움은 모델에 사고 스위치를 제공하는 것이 아니라, 두 모드의 목표가 다르다는 점입니다—하나는 직접성, 준수, 낮은 지연 시간을 추구하는 반면, 다른 하나는 더 많은 탐색과 더 높은 정확도를 추구합니다. 한 걸음 더 나아가, 훈련 목표는 답변 전에 얼마나 오래 생각할 것인지에서 행동 중에 예산을 어떻게 할당할지, 피드백을 어떻게 수용할지, 그리고 작업을 어떻게 계속 진행할지로 전환됩니다.

이 시점에서 훈련 대상은 더 이상 단순히 질문에 답하는 모델이 아니라, 계획을 세우고, 도구를 호출하고, 피드백을 수신하며, 긴 작업에서 일관성을 유지할 수 있는 시스템입니다. 결과적으로 훈련 스택이 변화합니다: 브라우저, 터미널, 검색, 실행 샌드박스, 메모리 시스템, 도구 서버, 오케스트레이션 프레임워크가 모두 훈련 시스템에 포함되기 시작합니다.

더 정확히 말하면, 하네스(Harness)는 모델을 감싸는 제어 프로그램입니다. 이 개념은 단순히 Agent 런타임에만 속하는 것이 아니라 훈련 단계에도 존재합니다: 모델이 어떤 입력을 볼지, 피드백을 어떻게 받을지, 언제 컨텍스트를 정리할지, 언제 도구를 호출할지를 결정합니다. 프롬프트 구성, 메모리 업데이트, 검색 정책, 컨텍스트 편집, 도구 오케스트레이션이 모두 여기에 포함됩니다. 환경은 더 이상 단순한 정적 검증기가 아니라, 훈련과 배포 모두가 직접 직면해야 하는 계층입니다.

Tw93 - inline image

모델 훈련이 의미를 가지려면 하네스가 안정적이어야 합니다. 도구 반환 값이 불안정하거나, 브라우저 환경이 온라인 환경과 일치하지 않거나, 파일 시스템 상태를 재현할 수 없는 경우, 채점기가 먼저 실패하고, 이후 모델은 능력을 얻는 대신 환경 허점을 악용하는 방법을 학습하게 됩니다. Agent를 훈련할 때는 종종 모델과 환경을 동시에 디버깅하게 됩니다.

세 회사의 접근 방식은 명확합니다: Kimi는 PARL을 사용하여 병렬 분해와 신용 할당 문제를 해결합니다; Cursor는 자체 요약과 실시간 RL을 사용하여 장기 코딩 세션과 프로덕션 트래픽을 다시 훈련에 연결합니다; Chroma는 prune_chunks 자체를 전략으로 훈련하여 컨텍스트 정리가 검색 프로세스에 직접 들어가도록 합니다.

SFT 시대에는 데이터 다양성이 가장 중요했습니다; Agent 시대에는 환경 품질이 핵심입니다: 안정성, 진정성, 범위, 난이도 분포, 피드백 풍부함, 악용 방지. 훈련 목표는 그에 따라 변경되며, 단순히 한 문제를 맞히는 것이 아니라 완전한 작업에서의 신뢰성이 필요합니다. 기존의 CoT 벤치마크는 이를 포괄할 수 없습니다.

이러한 변화는 계속해서 진행됩니다: 단순히 런타임 하네스 내에서 모델을 훈련하는 것을 넘어, 하네스 코드 자체도 외부 루프에 의해 검색되고 최적화될 수 있는 대상이 되고 있습니다.

Tw93 - inline image

Kimi K2.5의 PARL은 주목할 만한 엔지니어링 사례로, 명확한 경로를 가지고 있습니다: 오케스트레이터만 훈련하고, 신용 할당을 오케스트레이션 계층에 집중시키며, 모든 하위 Agent를 동시에 최적화하지 않습니다.

보상 신호는 세 가지 범주로 나뉩니다: 작업 성공, 병렬 분해, 완료 제약 조건, 이들은 함께 오케스트레이션 계층을 구동합니다. 초기 훈련에서는 r_parallel 가중치를 높여 병렬 전략 탐색을 장려하고, 이후 점차 0으로 줄여 여러 하위 Agent를 여는 것을 지름길로 취급하지 않도록 합니다. 평가는 총 단계뿐만 아니라 중요 경로 길이도 살펴봅니다; 중요 경로가 짧을수록 병렬 처리가 실제로 효과적임을 나타냅니다.

Tw93 - inline image

하지만 2026년이 되면서 상황은 한 걸음 더 나아갔습니다. Meta-Harness는 하네스 엔지니어링을 별도의 최적화 대상으로 명시적으로 취급합니다. 가중치가 아닌 하네스 코드 자체—고정된 모델을 둘러싼 프롬프트 구성, 검색, 메모리, 상태 업데이트 프로그램—를 최적화합니다. 논문 서두의 수치는 직접적입니다: 동일한 기본 모델에 대해 하네스만 변경해도 동일한 벤치마크에서 최대 6배의 성능 차이가 발생할 수 있습니다. 모델 외부의 이 프로그램 세트는 더 이상 단순한 배포 세부 사항이 아니라 능력 형성의 한 계층입니다.

핵심은 또 다른 추상 최적화기를 추가하는 것이 아니라, 사전 코드, 점수, 실행 추적(도구 호출 및 상태 변경 로그)을 파일 시스템에 기록하고, 제안자가 grep, cat, diff를 사용하여 코드를 작성하듯이 실패 경로를 따라 하네스를 수정하도록 하는 것입니다. 제안자는 하네스 수정을 제안하는 모듈입니다.

저자들은 과거의 많은 텍스트 최적화기가 하네스와 같은 장기적이고 상태 저장적인 프로그램에 효과적이지 않았다고 명확히 판단합니다. 스칼라 점수, 짧은 템플릿, 또는 요약만 보면 문제가 평면화되기 때문입니다. 스칼라 점수는 프로세스 정보 없이 최종 점수만 제공합니다. 하네스 오류는 종종 여러 단계 후에 나타납니다; 피드백이 과도하게 압축되면 진단 체인이 끊어집니다.

이러한 결과는 단순히 더 높은 벤치마크 점수 이상입니다. 온라인 텍스트 분류에서 Meta-Harness는 ACE(Agent 컨텍스트 엔지니어링 기준)보다 7.7포인트 높은 동시에 컨텍스트 토큰 사용량을 1/4로 압축합니다. 검색 증강 수학 추론에서 발견된 하네스는 최적화에 참여하지 않은 5개의 보류 모델에서 200개의 IMO 수준 문제에 대해 평균 4.7포인트 향상되었습니다. TerminalBench-2에서도 수동 엔지니어링 기준을 초과했습니다. 이는 최적화되는 대상이 더 이상 모델 내부 전략뿐만 아니라 모델 주변의 정보와 행동을 구성하는 프로그램임을 보여줍니다.

구체적인 예: Meta-Harness는 TerminalBench-2에서 환경 부트스트랩을 자동으로 발견했습니다—Agent 루프가 시작되기 전에 셸 명령을 실행하여 작업 디렉토리, 사용 가능한 언어, 패키지 관리자, 메모리 상태를 첫 번째 프롬프트에 주입되는 스냅샷으로 구성합니다. 많은 코딩 Agent는 처음 몇 라운드를 환경 탐색에 사용합니다; 이 전처리가 완료되면, 개선은 반드시 더 강력한 가중치에서 오는 것이 아니라, 하네스가 모델이 더 나은 컨텍스트로 시작할 수 있게 하기 때문입니다.

이 시점에서 최적화 목표는 답변에서 궤적으로, 그리고 그 궤적을 담는 하네스 프로그램으로 확장되었습니다.

선도 모델 출시 이후, 훈련 체인은 계속된다

오늘날의 대규모 모델을 단일 사전 훈련 라운드의 관점에서만 이해하는 것은 더 이상 충분하지 않습니다. 출시된 모델 뒤에는 일반적으로 사전 훈련, 후속 훈련, 증류, 특화의 전체 체인이 완료되어 있으며, 더 강력한 모델은 계속해서 다음 세대를 위한 훈련 데이터를 생성합니다.

DeepSeek-R1 시리즈의 증류는 전형적인 예입니다. 대규모 모델이 먼저 RL과 검증된 보상을 통해 추론 능력을 개발한 다음, 이러한 추론 궤적을 더 작은 밀집 모델로 전송합니다. TranslateGemma와 같은 특화 모델은 다른 경로를 보여줍니다: 더 구체적인 대상 작업에서 고품질 데이터와 특화된 보상 설계를 사용하여 능력을 더욱 압축하고 지시합니다. 이 단계에서 더 강력한 모델은 단순히 사용자에게 서비스를 제공하기 위한 것이 아니라, 다음 세대를 위한 훈련 데이터를 직접 생산하기 위한 것이기도 합니다.

이背后的 이유는 궤적 전송보다 더 근본적입니다: 한 가지 가능한 설명은 인터넷 코퍼스에서 지식 기억과 추론 능력이 결합되어 있으며, 기존의 사전 훈련 목표는 모델이 둘 다 잘 학습하도록 요구한다는 것입니다. 대규모 모델이 먼저 와야 하는 이유는 오직 그들만이 둘 다 지원할 만큼 크기 때문이며, 그런 다음 순수한 추론 시연 데이터를 생성하는 데 사용될 수 있습니다. 소규모 모델이 이러한 데이터로 훈련할 때는 모든 지식을 기억하도록 강요받지 않고 추론 자체에 집중할 수 있습니다. 크게 시작하여 작게 가는 것은 능력 분리에 관한 것이지, 단순한 비용 전략이 아닙니다.

다른 한편으로, 배포 적응성은 능력 자체만큼 중요합니다. 많은 시나리오는 만능 대규모 모델을 필요로 하지 않으며, 비용, 지연 시간, 안정성, 제어 가능성에 더 관심을 둡니다. 훈련의 끝이 반드시 더 큰 것은 아니며, 잠재적으로 더 작고, 저렴하며, 더 특화된 것일 수 있습니다.

최종적으로 출시된 모델이 반드시 훈련 곡선의 가장 오른쪽 체크포인트인 것은 아닙니다. 실제 출시 전에 여러 체크포인트가 실제 작업 결과, 거부 스타일, 도구 안정성, 비용, 회귀 위험에 대해 반복적으로 비교되는 경우가 많습니다. 온라인에 올라가는 버전은 종종 제품 결정이며, 단일 지표에서 가장 강력한 성능을 보이는 것이 아닙니다.

사용자가 모델 이름을 볼 때, 그것이 부드럽게 상승하는 훈련 곡선에 해당한다고 가정하지만, 실제로 어떤 체크포인트가 온라인에 올라가는지는 또 다른 문제입니다.

대규모 모델의 가치는 자체 서비스 능력뿐만 아니라 다음 세대를 위한 훈련 데이터, 증류 소스, 출시 기반을 지속적으로 제공하는 데 있습니다.

Tw93 - inline image

오프라인 훈련을 넘어, 거의 온라인에 가까운 지속적 최적화가 주요 프로세스에 진입했습니다. Cursor Composer 2의 실시간 RL은 일부 Agent 능력이 다음 대규모 오프라인 훈련 라운드를 기다리지 않고 프로덕션 트래픽을 통해 지속적으로 반복되기 시작했음을 보여줍니다. 훈련과 배포 사이의 경계가 사라진 것은 아니지만, 그들 사이의 피드백 루프는 단축되고 있습니다.

미래에 모델이 왜 더 강력해졌는지 판단하는 방법

2026년 선도 모델의 가치는 점점 더 사전 훈련 후 전체 훈련 체인을 완료할 수 있는 능력에 달려 있습니다: 지속적으로 훈련 데이터를 생산하고, 증류를 수행하고, 특화를 수행하고, 평가와 보상을 잘 수행하며, 최종 출시 선택을 하는 것입니다.

이 때문에, 모델이 갑자기 더 강력해진 이유를 볼 때, 먼저 세 가지를 살펴볼 수 있습니다:

  • 첫째, 변화가 사전 훈련 계층에서 발생했는지 아니면 후속 훈련 과정에서 발생했는지 확인하십시오. 많은 능력 향상이 실제로 더 강력한 사전 훈련과 더 나은 데이터 레시피에서 비롯되지만, 인지된 많은 변화는 실제로 후속 훈련에서 비롯됩니다. 모델이 지침을 따르거나, 도구를 사용하거나, 안정적인 답변 스타일을 가지는 것은 종종 더 많은 코퍼스에서 훈련하는 것만으로 자연스럽게 성장하지 않습니다.
  • 다음으로, 개선이 어떤 계층에서 오는지 확인하십시오: 가중치와 훈련 레시피인지, 보상/평가/채점기인지, 아니면 하네스 코드와 배포 루프인지. 추론 모델과 Agent에 도달할 때까지 사용자가 느끼는 강점은 종종 기본 모델만의 결과가 아닙니다. 평가가 어떻게 설정되는지, 보상이 어떻게 점수화되는지, 도구 환경이 안정적인지, 검색과 메모리가 어떻게 구성되는지, 요약과 컨텍스트가 어떻게 정리되는지, 그리고 출시를 위해 어떤 체크포인트가 선택되었는지—이 모든 것이 함께 최종 제품 성능을 변경합니다.
  • 마지막으로, 온라인 버전이 무엇을 최적화하고 있는지 확인하십시오. 일부 버전은 더 높은 상한을 추구하고, 일부는 더 낮은 비용, 지연 시간, 회귀 위험을 추구하며, 일부는 특정 유형의 시나리오에 특화되어 있습니다. 출시 버전은 제품 결정이며, 훈련 곡선의 가장 오른쪽 지점이 아닙니다. 따라서 모델 업데이트를 볼 때, 실제로 무엇을 최적화하고 있는지 살펴보는 것이 진실에 더 가까울 것입니다.

모델의 갑작스러운 개선을 생산 단계로 분해하면, 많은 이득이 실제로 훈련 스택의 후반부와 외부 하네스에 의해 증폭됩니다. 이 체인의 반복 주기도 단축되고 있습니다: 프로덕션 트래픽은 지속적으로 훈련으로 다시 흘러가고, 각 세대의 더 강력한 모델은 능력을 생성하면서 동시에 다음 세대의 감독 데이터를 생성하며, 외부 프로그램은 롤아웃, 로그, 실제 작업 피드백을 기반으로 지속적으로 재작성됩니다.

오늘 출시된 모델은 단지 스냅샷일 뿐입니다; 파이프라인과 하네스 프로그램이 계속 실행되는 제품입니다.

학습 자료

  1. Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
  2. Ouyang et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155
  3. Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300
  4. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
  5. DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437
  6. Llama Team, AI @ Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783
  7. Bai et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073
  8. OpenAI (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. openai.com/index/deliberative-alignment
  9. Anthropic (2025). Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models. anthropic.com/research/reward-tampering
  10. MacDiarmid et al. (2025). Natural Emergent Misalignment from Reward Hacking in Production RL. arXiv:2511.18397
  11. Lee et al. (2026). Meta-Harness: End-to-End Optimization of Model Harnesses (preprint project page). yoonholee.com/meta-harness
  12. Kimi Team (2026). Kimi K2.5 Tech Blog: Visual Agentic Intelligence. kimi.com/blog/kimi-k2-5
  13. Rush, S. (2026). A technical report on Composer 2. cursor.com/blog/composer-2-technical-report
  14. Chroma (2026). Chroma Context-1: Training a Self-Editing Search Agent. trychroma.com/research/context-1

이 글은 재게재를 위한 어떠한 형태의 복제나 재작성도 허가하지 않습니다. 발견하시면 신고해 주시기 바랍니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기