
벤치마크 — AI 성능 1위, 믿어도 되나?
목차
"이 모델이 벤치마크 1위래." 이 한 문장으로 모델을 고르면 두 가지를 놓칩니다. 그 점수가 시험지를 미리 본 결과일 수 있다는 것, 그리고 그 시험이 내 업무와 상관없을 수 있다는 것. 2026년의 벤치마크 점수는 성적표라기보다 제조사가 고른 홍보 문구에 가깝습니다.
배경 / 왜 지금 이 용어인가
2026년 들어 벤치마크를 둘러싼 신뢰가 눈에 띄게 흔들렸습니다. 대표적인 사건이 SWE-bench Verified 퇴출입니다. 코딩 에이전트 성능의 표준처럼 쓰이던 이 벤치마크를 OpenAI가 더 이상 보고하지 않겠다고 밝혔고, 그 이유로 든 것이 "모델이 정답 패치를 이미 학습한 흔적"이었습니다. OpenAI 발표에 따르면 고난도 과제 138개를 감사한 결과 59.4%가 테스트 설계 자체에 결함이 있었고, 주요 프런티어 모델들이 일부 과제의 정답 패치를 글자 그대로 재현했습니다 (OpenAI, CodeSOTA, 2026).
같은 해 8월에는 업계 표준 기구인 MLCommons가 "벤치마크를 믿어도 되는지 판별하는 7가지 질문"을 공식 문서로 냈습니다 (MLCommons, 2026.08). 벤치마크를 만드는 쪽에서 "벤치마크를 의심하라"는 가이드를 낸 셈입니다.
국내도 다르지 않습니다. 정부가 국가대표 AI 모델을 선발하면서 영미권 번역 문항으로는 한국어 실력을 제대로 잴 수 없다는 지적이 나왔고, 과기정통부와 NIA가 한국어·지시 이행·안전성 세 영역에 각 1만 문항 규모의 독자 벤치마크를 만들기 시작했습니다 (머니투데이, 2026.04).
이 글은 "벤치마크"라는 단어가 실제로 무엇을 재는지, 왜 1위라는 숫자가 흔들리는지, 그리고 그럼에도 어떻게 읽어야 쓸모가 있는지를 정리합니다.
핵심 데이터 & 현황
항목 | 수치 | 출처·시점 |
|---|---|---|
SWE-bench Verified 고난도 138개 과제 중 테스트 설계 결함 | 59.4% | OpenAI 감사, 2026 |
SWE-bench Verified 데이터 누출률 | 10.6% | buildmvpfast 정리, 2026 |
공개 데이터 vs 비공개 데이터에서의 SWE-bench 정확도 | 70% → 15~18% | MLCommons, 2026.08 |
오염 항목 제거 시 GSM8K 정확도 하락 | 약 13점 | Digital Applied 정리, 2026 |
오염이 순위에 미치는 영향 (표준 vs 오염 통제 리더보드 순위 상관) | 0.997 | Xiao & Cheng, arXiv, 2026.07 |
LM Arena 데이터 점유율: Google / OpenAI vs 오픈웨이트 83개 모델 합계 | 19.2% / 20.4% vs 29.7% | The Leaderboard Illusion, 2025.04 |
Meta가 출시 전 비공개로 시험한 Llama 4 변형 수 | 27개 (공개는 1개) | 같은 논문 |
Humanity's Last Exam 최고 점수 | 59.1% | Artificial Analysis, 2026.09 기준 |
ARC-AGI-3 출시 시점 주요 모델 점수 | 1% 미만 (인간은 100%) | ARC-AGI-3 분석, 2026.03 |
해석: 두 가지 상반된 사실이 동시에 성립합니다. 오염은 절대 점수를 크게 부풀리지만(13점, 70%→18%), 모든 모델이 비슷하게 오염돼 있어 순위 자체는 거의 그대로입니다(상관 0.997). 즉 "80점"이라는 숫자는 못 믿어도 "A가 B보다 위"라는 순서는 어느 정도 믿을 수 있습니다. 단, 순위를 흔드는 다른 요인(비공개 시험, 선택적 공개)이 따로 있습니다.
심층 분석
1) 벤치마크는 정확히 무엇인가
벤치마크는 고정된 문제 묶음과 채점 규칙입니다. MMLU는 57개 과목의 객관식 문제, GSM8K는 초등 수학 서술형, SWE-bench는 실제 GitHub 이슈를 고쳐 테스트를 통과시키는 과제, HLE(Humanity's Last Exam)는 각 분야 전문가가 낸 최고난도 문제입니다. 모델에 같은 문제를 주고 정답률을 세면 점수가 나옵니다.
핵심은 "고정"입니다. 문제가 고정돼 있고 대부분 공개돼 있기 때문에 비교가 가능하지만, 바로 그 이유로 문제와 정답이 인터넷에 떠돌다 학습 데이터에 섞여 들어갑니다. 이것을 오염(contamination)이라고 부릅니다. 시험지가 유출된 시험과 같습니다.
이와 별개로 LM Arena 같은 투표형 리더보드가 있습니다. 사람이 두 모델의 답을 보고 더 나은 쪽에 투표하면 체스 레이팅처럼 점수가 쌓입니다. 고정 문제가 없어 오염은 덜하지만, 대신 다른 문제가 있습니다.
2) 왜 "1위"가 흔들리나 — 세 가지 균열
첫째, 오염입니다. 2024년 이전에 공개된 벤치마크는 사실상 전부 어느 정도 오염돼 있습니다. GSM8K에서 오염 항목을 빼면 13점이 떨어지고, SWE-bench는 공개 문제에서 70%였던 정확도가 비공개 문제에서 15~18%로 내려갑니다. OpenAI가 SWE-bench Verified를 포기한 것도 모델이 정답을 "풀지" 않고 "기억해" 냈기 때문입니다.
둘째, 선택적 공개입니다. 2025년 4월 Cohere Labs·AI2·프린스턴·스탠퍼드 등이 낸 논문 "The Leaderboard Illusion"은 LM Arena에서 일부 대형 제조사가 출시 전 수십 개 변형을 비공개로 시험하고 가장 좋은 점수 하나만 공개해 온 관행을 지적했습니다. Meta는 Llama 4 변형 27개를 시험한 뒤 1개만 공개했습니다. 여러 번 던져서 가장 좋은 주사위 눈만 보고하는 방식입니다.
셋째, 측정 조건입니다. 같은 모델 가중치라도 프롬프트 형식, 시도 횟수, 추론 예산(thinking budget)에 따라 점수가 10~20점씩 움직입니다. "Max Effort" 설정에서 59.1%가 나온 모델이 기본 설정에서는 그보다 훨씬 낮을 수 있는데, 리더보드에는 가장 높은 조건의 숫자가 올라갑니다.
3) 그럼 벤치마크는 쓸모없나 — 아니다, 읽는 법이 다를 뿐
흥미로운 반론이 있습니다. 2026년 7월 스탠퍼드·마카오시티대 연구진은 공개 모델 47개와 일부러 오염시킨 모델 74개를 4개 벤치마크에서 비교했는데, 오염을 통제한 리더보드와 통제하지 않은 리더보드의 순위 상관이 0.997이었습니다. 188개 모델·벤치마크 조합 중 특정 모델만 유독 오염된 경우는 3건뿐이었습니다. 모두가 비슷하게 시험지를 봤다면 등수는 크게 안 바뀐다는 뜻입니다.
그래서 실무적 결론은 이렇습니다. 절대 점수("MMLU 90%")는 홍보 문구로 취급하고, 같은 조건에서 잰 상대 순서와 점수 차이의 크기만 참고합니다. 그리고 순서를 흔드는 요인, 즉 비공개 시험과 측정 조건 차이는 리더보드 밖에서 따로 확인해야 합니다.
4) 벤치마크 쪽의 대응 — 살아 있는 시험으로
오염에 대한 답은 두 갈래입니다. 하나는 문제를 계속 갈아 끼우는 방식입니다. LiveBench와 LiveCodeBench는 정기적으로 새 문제를 추가하고, SWE-rebench는 새 GitHub 이슈를 자동으로 수집합니다. OpenAI가 대안으로 권한 SWE-bench Pro도 비공개 분할을 두어 오염을 줄였습니다.
다른 하나는 애초에 외울 수 없는 문제를 내는 방식입니다. 2026년 3월 24일 출시된 ARC-AGI-3는 처음 보는 규칙의 인터랙티브 과제라 출시 시점 주요 모델이 1% 미만이었고, HLE는 전문가 출제 문제로 최고 점수가 아직 59.1%입니다. 이런 벤치마크의 점수가 오를 때는 "정말 능력이 늘었다"고 볼 근거가 상대적으로 강합니다.
국내에서는 번역 벤치마크의 한계가 문제였습니다. 영미권 문항을 옮긴 시험으로는 맞춤법·띄어쓰기·방언·문화 맥락을 잴 수 없어, K-AI 리더보드는 KMMLU-Pro(14개 국가전문자격시험 문항)와 CLIcK(한국 문화·언어 이해) 등 5개 지표를 쓰고, 정부가 올해 말까지 영역별 1만 문항 세트를 추가합니다. 1월 국가대표 AI 선발 평가에서는 종합 1위 LG, 국어 1위 SKT로 항목별 1위가 갈렸는데 (머니투데이, 2026.01), 이것이 "1위"가 한 줄로 요약되지 않는 이유를 잘 보여 줍니다.
실전 — 벤치마크를 제대로 읽는 6가지 원칙
절대 점수보다 격차를 본다. "90점"이 아니라 "2위와 3점 차"인지 "15점 차"인지가 정보입니다. 3점 차이는 측정 조건만 바꿔도 뒤집힙니다.
벤치마크의 나이를 확인한다. 2024년 이전 공개 벤치마크(MMLU, HumanEval, GSM8K)의 점수는 오염을 전제로 읽습니다. 같은 이름의 후속판(MMLU-Pro, LiveCodeBench, SWE-bench Pro)이 있으면 그쪽을 봅니다.
측정 조건을 같이 읽는다. 시도 횟수(pass@1인지 pass@5인지), 추론 예산, 도구 사용 여부가 적혀 있지 않은 점수는 비교 대상에서 뺍니다.
투표형 리더보드는 데이터 점유율까지 본다. LM Arena 순위는 참고하되, 상위권 대형 제조사가 비공개 변형을 시험할 수 있는 구조라는 점을 기억합니다.
내 업무와 닮은 벤치마크만 신뢰 가중치를 준다. 코딩 에이전트를 고르면서 객관식 지식 점수를 볼 이유가 없습니다. MLCommons 7가지 질문의 첫 번째가 "이 벤치마크가 내가 내릴 결정을 재는가"입니다.
최종 판단은 자기 문제 20개로 한다. 실제 업무에서 나온 입력 20개를 모아 후보 모델에 똑같이 돌려 보는 것이 어떤 리더보드보다 정확합니다. 비용도 몇 달러면 충분합니다.
참고 링크
목차
관련 글

오픈소스 AI 모델, 왜 공짜로 풀까 — 수십억 달러짜리 모델을 무료로 내주는 전략의 논리
메타, 알리바바, 심지어 폐쇄 전략의 상징이던 오픈AI까지 최고 성능 모델을 무료로 뿌립니다. 자선이 아닙니다. "보완재를 공짜로 만들어 본진에서 돈을 번다"는 40년 된 실리콘밸리 전략이 AI 시대에 다시 작동하고 있습니다.

파라미터 — 70B, 405B… 이 숫자가 뭔데요?
모델 이름 뒤에 붙은 B는 성적표가 아니라 설치 사양표에 가깝습니다. 이 숫자를 성능 순위로 읽는 순간, 모델 선택은 거의 반드시 틀립니다.

멀티모달 AI란? 글자만 읽던 AI가 눈을 뜬 날 — 원리와 2026 실전 활용법
AI가 이미지를 "볼 수 있게" 된 것은 성능이 좋아져서가 아니라, 입력을 처리하는 구조 자체가 바뀌었기 때문입니다. 그리고 이 변화는 모델의 점수보다 우리가 질문하는 방식을 먼저 바꿨습니다.

프롬프트 — 같은 질문인데 답이 달라지는 이유 (LLM 비결정성과 프롬프트 민감도 실전 대응법)
어제 완벽했던 프롬프트가 오늘은 엉뚱한 답을 내놓습니다. 원인은 대개 둘 중 하나인데, 둘의 처방이 정반대입니다. 하나는 내가 손댈 수 없는 서버 쪽 무작위성이고, 다른 하나는 내가 만든 프롬프트의 문제입니다.