벤치마크의 시대는 끝났다

@MagnaDing
영어2026년 9월 04일
105K
131
5
19
119

TL;DR

AI 에이전트가 단순한 질의응답을 넘어 복잡한 실무를 수행하게 되면서, 기존의 벤치마크는 구시대의 유물이 되었습니다. 저자는 진정한 AGI를 측정하기 위해 결과 중심의 인턴십 모델이 필요하다고 주장합니다.

안녕하세요, AI 애호가 여러분!

OpenAI 가 이번 주에 공식적으로 발표했습니다: AGI 시대에 오신 것을 환영합니다.

GPT-6 Astra 가 출시되었고, OpenAI 는 이를 세대적 도약으로 판매하고 있습니다 — 컴퓨터 사용, 코딩, 연구, 그리고 한때 인간이 내내 지켜봐야 했던 길고 지저분한 작업에서 큰 도약을 이루었습니다.

잠시 마케팅 문구를 그대로 받아들이면, 업계가 조용히 회피해 온 질문이 떠오릅니다: 이걸 어떻게 측정할 것인가?

몇 년 동안 AI 는 벤치마크에 의존해 왔습니다. 모든 출시마다 새로운 모델이 여기서 3%, 저기서 7% 더 낫고, 지난 봄에는 존재하지도 않았던 벤치마크에 따르면 신비롭게도 12% 더 똑똑하다는 표가 함께 제공됩니다. 우리는 순위를 매기고, 색상 코드를 지정하고, 리더보드에 쌓아 올리고, 승자를 선정합니다. 모델이 기본적으로 질문에 답할 때는 잘 작동했습니다. 모델이 일을 시작하는 순간 작동이 중단됩니다.

핵심 문제는 다음과 같습니다: 벤치마크는 그저 문제 은행일 뿐입니다. 모델에 문제를 주고, 답을 생성하면, 정답과 비교합니다. 화려한 컴퓨터 사용 벤치마크조차도 그 밑에는 미리 구축된 환경에서 실행되는 미리 작성된 작업 더미에 불과합니다. 그것은 진정으로 유용합니다. 하지만 에이전트를 실제 머신에 던져 놓고 무언가를 처리하라고 말할 때 일어나는 일과는 전혀 다릅니다.

실생활에는 벤치마크 파일이 함께 제공되지 않습니다. 데스크탑에서 "완료"가 정확히 무엇인지 알려주는 것은 아무것도 없습니다.

실제 컴퓨터는 작업 중에 충돌하는 브라우저, 어제 UI 를 조용히 재설계한 사이트, 세 가지 모순된 버전의 스프레드시트, 아무도 언급하지 않은 권한, 여섯 폴더 깊이 묻힌 PDF, 최악의 요청에서 타임아웃되는 API, 그리고 "이거 좀 처리해 줄래?"라고 말하고 "이거"를 정의하지 않고 걸어 나가는 인간으로 가득합니다.

에이전트는 스스로 알아내야 합니다. 그리고 아무도 제대로 벤치마킹하지 않는 부분: 첫 번째 시도가 실패했을 때 회복해야 합니다. 그것은 정답을 얻는 것과는 완전히 다른 기술입니다.

그렇기 때문에 OpenAI 가 강화 학습 및 컴퓨터 사용 훈련을 위해 수만 대의 소비자용 Mac 을 구매했다는 보고서가 보기보다 더 의미심장합니다. 정확한 숫자는 보고되었지만 감사되지는 않았습니다. 그러나 방향성은 명백합니다. 최첨단 연구소는 모델을 채팅 상자에 가두지 않고 실제 머신에서 작동시키기를 원합니다. 그리고 그것은 조용히 전체 벤치마크 게임을 무너뜨립니다.

두 에이전트, 같은 컴퓨터, 같은 모호한 지시를 상상해 보세요:

이 시장을 조사하고, 유망한 회사 세 곳을 선정하고, 재무 비교를 작성하고, 투자 위원회를 위한 자료를 준비하세요.

그것을 하는 올바른 방법은 하나가 아닙니다. 수백 가지가 있습니다. 한 에이전트는 두 시간 동안 검색합니다. 다른 에이전트는 스크립트를 작성합니다. 세 번째 에이전트는 도중에 더 나은 데이터 소스를 우연히 발견하고 원래 계획을 포기합니다. 네 번째 에이전트는 실수를 하고, 이를 발견하고 수정합니다. 다섯 번째 에이전트는 완전히 잘못된 숫자로 만든 멋진 자료를 건네줍니다.

그렇다면 어느 것이 이겼을까요? 벤치마크 작성자는 답을 미리 작성할 수 없습니다. 답이 없기 때문입니다.

그리고 이것이 진정으로 불편해지는 지점입니다. 에이전트를 평가하는 가장 어려운 부분은 더 이상 답이 맞았는가가 아닐 수 있습니다. 이것이 실제로 유용했는가입니다. 지나친 논쟁처럼 들리지만, 그렇지 않습니다.

컴퓨터 사용 벤치마크의 95%를 통과한 에이전트를 실제 회사에 일주일 동안 투입해 보세요. 잘못된 폴더 구조를 만들고, 라이브 스프레드시트를 덮어쓰고, 죽은 단서를 쫓느라 6시간을 소모하고, 2023년 통계를 자신 있게 인용하고, 물어볼 생각조차 하지 못하는 권한 장벽에 막힙니다. 모든 벤치마크 작업: 완벽합니다. 아무도 그를 두 번째 주에도 고용하지 않을 것입니다.

이제 85%만 득점했지만 — 혼란스러울 때 그것을 인지하고, 막힌 부분을 풀어줄 한 가지 질문을 하고, 무언가 고장 나면 방향을 바꾸고, 실제로 사용할 수 있는 작업을 조용히 완료하는 에이전트를 생각해 보세요. 어느 것이 더 똑똑할까요? 리더보드는 전혀 모릅니다. 솔직히 말해, 우리도 모릅니다.

이것이 제가 독립적인 벤치마크가 벽에 부딪히고 있다고 생각하는 이유입니다. 연구자들이 게을러서가 아닙니다 — 그들은 그 어느 때보다 더 어렵고 현실적인 테스트를 구축하고 있습니다. 문제는 현실이 계속해서 테스트보다 커지고 있다는 것입니다. 벤치마크를 더 길게 만들고, 더 많은 도구, 더 많은 사이트, 더 많은 앱, 더 많은 단계, 더 많은 무작위성을 추가할 수 있습니다. 중요하지 않습니다. 당신은 여전히 규칙이 있는 게임을 만들고 있고, 모델이 게임을 하는 법을 배우는 순간, 당신은 다시 원점으로 돌아갑니다.

그래서 우리는 점수를 받게 될 것입니다. 91.4%. 94.7%. 97.2%. 98.1%. 사람들은 모델 A 가 모델 B 를 이겼는지 논쟁할 것입니다. 누군가 다른 리더보드를 출시할 것입니다. 또 다른 누군가는 리더보드의 리더보드를 출시할 것입니다. 그리고 그 모든 시간 동안, 모델은 실제 컴퓨터에 앉아 그 어떤 숫자로도 설명할 수 없는 일들을 하고 있을 것입니다.

이것이 벤치마크 역설입니다: AI 가 범용 지능에 가까워질수록, 미리 작성된 질문 은행이 그것에 대해 알려주는 바는 줄어듭니다.

그렇다면 무엇이 그것을 대체할까요? 저는 답이 "더 나은 벤치마크"라고 생각하지 않습니다. 저는 그것이 본질적으로 다른 것이라고 생각합니다. 에이전트에게 질문을 주는 것을 멈추고 목표를 주십시오. 깔끔한 샌드박스를 주는 것을 멈추고 지저분한 샌드박스를 주십시오. 예상된 단계를 따랐는지 점수를 매기는 것을 멈추고 결과를 얻었는지 점수를 매기십시오. 동일한 공개 테스트를 반복 실행하는 것을 멈추고 계속 변화하는 환경, 본 적 없는 비공개 작업에 던져 넣으십시오.

그리고 성공했는지만 묻지 마십시오. 얼마나 안정적으로 성공하는지, 비용은 얼마인지, 시간은 얼마나 걸렸는지, 인간의 도움이 얼마나 자주 필요했는지, 얼마나 안전하게 행동했는지, 그리고 작업이 현실과의 접촉에서 살아남았는지 물으십시오.

간단히 말해: 차세대 AI 평가는 시험보다는 인턴십처럼 보여야 합니다.

모델에게 묻지 마십시오:

시험에 통과했나요?

노트북, 계정, 예산, 목표, 그리고 일주일을 주십시오. 그리고 그것이 무엇을 하는지 지켜보십시오. 그것은 당신에게 그 지능에 대해 훨씬 더 많은 것을 알려줄 것입니다 — 그리고 표준화하기에는 악몽이 될 것입니다. 그것이 바로 핵심입니다.

실제 세계의 지능은 지저분하고, 상황에 따라 달라지며, 적응적이고, 개방적입니다. 그것을 고정된 답이 있는 깔끔한 질문 목록으로 평탄화하는 순간, 당신은 지능을 측정하는 것을 멈춥니다. 당신은 시험 응시 능력을 측정하고 있는 것입니다.

그리고 그것이 Astra 가 저에게 다르게 다가오는 이유입니다. OpenAI 는 우리에게 큰 소리로 AGI 시대에 접어들었다고 말하고 있습니다. 좋습니다. 하지만 그것이 사실이라면, 우리는 아마도 AGI 에게 챗봇을 위해 설계된 표준화된 시험을 건네주는 것을 중단해야 합니다.

흥미로운 질문은 더 이상 "점수가 얼마였나요?"가 아닙니다. "컴퓨터를 주고 무언가를 처리하라고 했을 때 어떤 일이 일어나나요?"입니다. 그리고 우리는 아직 좋은 답을 가지고 있지 않다는 것을 곧 알게 될 것 같습니다.

그러니 — AGI 시대에 오신 것을 환영합니다. 그리고 조용히, 동시에: 평가 불가능한 AI 시대에 오신 것을 환영합니다. 벤치마크가 더 나빠진 것이 아닙니다. 우리가 측정하려고 했던 것이 그냥 그 밖으로 걸어 나간 것입니다.

기사 읽기

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기