
추론 모델 — 생각하는 AI가 더 비싼 이유
목차
"추론 모델이 더 똑똑해서 비싸다"고 생각하면 절반만 맞습니다. 실제 가격 차이의 상당 부분은 눈에 보이지 않는 '생각 토큰'이 고스란히 출력 요금으로 청구되기 때문에 벌어집니다. 이 구조를 모르고 쓰면 간단한 질문 하나에도 수십 배 청구서를 받을 수 있습니다.
배경 / 왜 지금 이 용어인가
OpenAI의 o1(2024년 9월 출시)을 시작으로 o3, Anthropic Claude의 확장 사고(extended thinking)·적응형 사고(adaptive thinking), Google Gemini의 thinking 모델, 그리고 2025년 1월 공개된 DeepSeek R1까지, 주요 AI 회사들은 일제히 "답하기 전에 먼저 생각하는" 모델을 내놓았습니다. 이런 모델은 수학·코딩·복잡한 추론 문제에서 기존 모델보다 분명한 성능 향상을 보여줬지만, 동시에 사용자들 사이에서 "같은 질문인데 왜 이렇게 비싸졌나"라는 불만도 함께 늘었습니다.
답은 모델이 더 거대해져서가 아니라, 모델이 답을 내놓기 전에 내부적으로 생성하는 '추론 토큰(reasoning token)' 분량이 늘었고, 이 토큰들이 사용자에게는 보이지 않으면서도 과금 대상에는 포함되기 때문입니다.
핵심 데이터 & 현황
| 항목 | OpenAI 추론 모델 | Anthropic Claude | DeepSeek R1 |
|---|---|---|---|
| 추론 토큰 처리 | 응답에 노출되지 않지만 output_tokens 안의 reasoning_tokens로 집계·과금 | thinking 블록이 output_tokens_details.thinking_tokens로 집계·과금 | 사고 과정이 출력에 포함되는 구조, 출력 단가 자체가 낮게 책정 |
| 조절 파라미터 | reasoning effort(저/중/고 등 단계) | budget_tokens(수동) 또는 effort(적응형) | 별도 공개 파라미터 문서 없음 |
| 근거 | OpenAI 공식 Reasoning 가이드 | Anthropic 공식 Extended thinking 문서 | Epoch AI 분석(2025년 1월) |
해석: 세 회사 모두 "생각한 토큰도 출력 토큰 단가로 청구한다"는 원칙은 같습니다. 차이는 그 사고 분량을 개발자가 얼마나 세밀하게 통제할 수 있는지, 그리고 같은 사고 분량에 회사가 어떤 마진을 붙이는지에 있습니다. Epoch AI는 DeepSeek R1의 출력 단가가 OpenAI o1 대비 1/27 수준이라고 분석하면서, 이 차이의 상당 부분이 기술적 효율이 아니라 가격 정책(마진)에서 온다고 짚었습니다.
심층 분석
1) 추론 모델은 정확히 무엇인가
일반 LLM은 질문을 받으면 바로 다음 토큰을 예측해 답을 생성합니다. 추론 모델은 그 전에 "생각 단계"를 거칩니다. 문제를 여러 하위 단계로 쪼개고, 중간 결과를 검증하고, 때로는 여러 풀이 경로를 시도해 본 뒤 최종 답을 내놓습니다. 이 사고 과정 자체가 토큰의 나열이고, OpenAI 공식 문서는 이를 "모델이 프롬프트를 분해하고 여러 접근법을 고려하는 데 쓰는 토큰"이라고 설명합니다. 학습 단계에서도 강화학습으로 "더 길고 정확한 사고 과정"을 만들어내도록 훈련한다는 점이, 모델을 단순히 더 크게 만드는 것과 다른 지점입니다.
2) 흔한 오해 — 왜 "똑똑해서 비싸다"로 읽게 되나
사용자가 보는 것은 최종 답변뿐이라, 가격이 오르면 "모델 성능이 좋아져서"라고 납득하기 쉽습니다. 하지만 실제 청구서에는 눈에 보이지 않는 사고 토큰이 섞여 있습니다. OpenAI 공식 문서 기준으로 추론 토큰은 API 응답 내용에는 나타나지 않지만 컨텍스트 창을 차지하고 출력 토큰 요금으로 과금됩니다. Anthropic도 동일한 원칙을 적용해, thinking 블록에 쓰인 토큰을 출력 토큰 단가로 청구한다고 공식 문서에 명시하고 있습니다. 즉 가격 차이의 일부는 "더 똑똑해서"가 아니라 "눈에 안 보이는 토큰이 더 많이 찍혀서"입니다.
3) 실제로 판단하는 기준
두 회사 모두 사고 분량을 조절하는 손잡이를 제공합니다. OpenAI는 reasoning effort를 낮음·중간·높음 등 단계로 설정해 사고 토큰 생성량 자체를 제한할 수 있게 했고, Anthropic은 budget_tokens로 사고 토큰의 목표치를 직접 지정하거나(수동 모드), 적응형 사고에서는 effort 단계로 모델이 생각할지 말지 자체를 판단하게 둘 수 있습니다. 즉 비용을 판단할 때 볼 지표는 "모델이 똑똑한가"가 아니라 "이 작업에 어느 정도 사고 예산이 필요한가"입니다.
4) 언제 쓸모 있고 언제 무의미한가
다단계 수학 증명, 복잡한 코드 디버깅, 여러 제약 조건을 동시에 만족해야 하는 설계 문제처럼 '생각할 거리'가 실제로 많은 작업에서는 추론 모델의 긴 사고 과정이 정답률을 눈에 띄게 끌어올립니다. 스탠퍼드 연구진의 "s1" 논문(2025년 1월 공개)은 사고 토큰 예산을 강제로 늘리는 것만으로도 추론 성능이 좋아진다는 점을 보여줬습니다. 하지만 사고 분량을 무작정 늘린다고 계속 좋아지는 것은 아닙니다. 사고 과정을 길게 늘인 모델의 거동을 분석한 2026년 연구는, 일정 수준을 넘어서면 성능 개선 폭이 급격히 줄어들고 오히려 모델이 맞던 답을 스스로 뒤집는 "과잉 사고(overthinking)" 현상이 나타난다고 보고했습니다. 단순한 사실 확인이나 짧은 요약처럼 생각할 거리가 적은 작업에 추론 모델을 기본값으로 켜 두면, 성능 향상 없이 비용만 올라가는 경우가 많습니다.
실전 — 추론 모델 비용을 제대로 읽는 4가지 원칙
- 가격표를 볼 때 "모델이 똑똑해져서"가 아니라 "사고 토큰이 출력 토큰으로 얼마나 더 찍히는지"로 해석합니다. OpenAI·Anthropic 모두 공식 문서에 이 과금 원칙을 명시하고 있습니다.
- 사용하는 API에 reasoning effort나
budget_tokens같은 사고량 조절 파라미터가 있다면 기본값을 그대로 쓰지 말고, 작업 난이도에 맞춰 낮춰 봅니다. 간단한 작업에는 낮은 단계만으로도 충분한 경우가 많습니다. - 비용을 추적할 때는 눈에 보이는 응답 길이가 아니라 사용량 응답의
reasoning_tokens/thinking_tokens항목을 직접 확인합니다. 체감 답변 길이와 실제 청구 토큰 수는 다를 수 있습니다. - 같은 '추론 모델' 카테고리 안에서도 회사별 가격 차이가 크다는 점을 기억합니다. 이는 기술 효율 차이만이 아니라 회사가 붙이는 마진의 차이이기도 하므로, 단순히 "더 비싼 쪽이 더 많이 생각한다"로 단정하지 않는 편이 안전합니다.
참고 링크
목차
관련 글

파인튜닝 — AI에게 회사를 가르친다는 오해
파인튜닝을 'AI에게 회사 지식을 통째로 가르치는 것'으로 오해하면 비용만 쓰고 최신 정보 반영은 못하는 모델을 얻습니다. LoRA 원리와 RAG·프롬프트 엔지니어링 중 무엇을 먼저 시도해야 하는지 판단 기준을 정리했습니다.

RAG — 파인튜닝 안 하고도 최신 정보를 아는 법
RAG(검색증강생성)는 모델 자체를 다시 학습시키는 대신 질문이 들어올 때마다 관련 문서를 찾아 프롬프트에 끼워 넣는 절차로, 지식이 자주 바뀌거나 출처 인용이 필요한 업무에서 파인튜닝보다 유리하지만 환각을 완전히 없애주지는 않는다는 점은 여전히 오해하기 쉽습니다.

어텐션 — AI가 문장에서 '중요한 것'을 고르는 법
AI가 긴 문장을 전부 다 기억해서가 아니라 지금 필요한 몇 단어에만 집중해서 이해하는 원리가 어텐션입니다. 컨텍스트가 길어질수록 비용이 커지는 이유와, GQA·MLA 같은 최적화 기법이 실무 응답 속도와 요금에 미치는 영향을 정리했습니다.

API — 남의 AI를 내 서비스에 붙인다는 게 정확히 뭘까
API로 AI를 '붙인다'는 말은 모델 자체를 가져오는 게 아니라 매 요청마다 남의 서버에 접속해 답을 받아오는 것이라는 뜻으로, 토큰 요금 구조·속도 제한·API 키 보안까지 실무에서 판단해야 할 기준을 정리했습니다.