---
title: "추론 모델 — 생각하는 AI가 더 비싼 이유"
url: https://blog.tyrano.dev/%EC%B6%94%EB%A1%A0-%EB%AA%A8%EB%8D%B8-%EC%83%9D%EA%B0%81%ED%95%98%EB%8A%94-ai%EA%B0%80-%EB%8D%94-%EB%B9%84%EC%8B%BC-%EC%9D%B4%EC%9C%A0
lang: ko
site: Tech AI News - 테카이
category: "작동 원리"
tags: ["AI 용어","Reasoning model","LLM","OpenAI","Anthropic","DeepSeek","토큰 비용"]
published: 2026-10-01T00:16:02.238Z
updated: 2026-10-01T00:16:02.238Z
sources:
  - https://developers.openai.com/api/docs/guides/reasoning
  - https://platform.claude.com/docs/en/build-with-claude/extended-thinking
  - https://epoch.ai/gradient-updates/what-went-into-training-deepseek-r1
  - https://arxiv.org/pdf/2501.19393
---

# 추론 모델 — 생각하는 AI가 더 비싼 이유

> "추론 모델이 더 똑똑해서 비싸다"고 생각하면 절반만 맞습니다. 실제 가격 차이의 상당 부분은 눈에 보이지 않는 '생각 토큰'이 고스란히 출력 요금으로 청구되기 때문에 벌어집니다. 이 구조를 모르고 쓰면 간단한 질문 하나에도 수십 배 청구서를 받을 수 있습니다.

---

## 배경 / 왜 지금 이 용어인가

OpenAI의 o1(2024년 9월 출시)을 시작으로 o3, Anthropic Claude의 확장 사고(extended thinking)·적응형 사고(adaptive thinking), Google Gemini의 thinking 모델, 그리고 2025년 1월 공개된 DeepSeek R1까지, 주요 AI 회사들은 일제히 "답하기 전에 먼저 생각하는" 모델을 내놓았습니다. 이런 모델은 수학·코딩·복잡한 추론 문제에서 기존 모델보다 분명한 성능 향상을 보여줬지만, 동시에 사용자들 사이에서 "같은 질문인데 왜 이렇게 비싸졌나"라는 불만도 함께 늘었습니다.

답은 모델이 더 거대해져서가 아니라, 모델이 답을 내놓기 전에 내부적으로 생성하는 '추론 토큰(reasoning token)' 분량이 늘었고, 이 토큰들이 사용자에게는 보이지 않으면서도 과금 대상에는 포함되기 때문입니다.

## 핵심 데이터 & 현황

| 항목 | OpenAI 추론 모델 | Anthropic Claude | DeepSeek R1 |
|---|---|---|---|
| 추론 토큰 처리 | 응답에 노출되지 않지만 `output_tokens` 안의 `reasoning_tokens`로 집계·과금 | `thinking` 블록이 `output_tokens_details.thinking_tokens`로 집계·과금 | 사고 과정이 출력에 포함되는 구조, 출력 단가 자체가 낮게 책정 |
| 조절 파라미터 | reasoning effort(저/중/고 등 단계) | `budget_tokens`(수동) 또는 effort(적응형) | 별도 공개 파라미터 문서 없음 |
| 근거 | OpenAI 공식 Reasoning 가이드 | Anthropic 공식 Extended thinking 문서 | Epoch AI 분석(2025년 1월) |

> 해석: 세 회사 모두 "생각한 토큰도 출력 토큰 단가로 청구한다"는 원칙은 같습니다. 차이는 그 사고 분량을 개발자가 얼마나 세밀하게 통제할 수 있는지, 그리고 같은 사고 분량에 회사가 어떤 마진을 붙이는지에 있습니다. Epoch AI는 DeepSeek R1의 출력 단가가 OpenAI o1 대비 1/27 수준이라고 분석하면서, 이 차이의 상당 부분이 기술적 효율이 아니라 가격 정책(마진)에서 온다고 짚었습니다.

## 심층 분석

### 1) 추론 모델은 정확히 무엇인가

일반 LLM은 질문을 받으면 바로 다음 토큰을 예측해 답을 생성합니다. 추론 모델은 그 전에 "생각 단계"를 거칩니다. 문제를 여러 하위 단계로 쪼개고, 중간 결과를 검증하고, 때로는 여러 풀이 경로를 시도해 본 뒤 최종 답을 내놓습니다. 이 사고 과정 자체가 토큰의 나열이고, OpenAI 공식 문서는 이를 "모델이 프롬프트를 분해하고 여러 접근법을 고려하는 데 쓰는 토큰"이라고 설명합니다. 학습 단계에서도 강화학습으로 "더 길고 정확한 사고 과정"을 만들어내도록 훈련한다는 점이, 모델을 단순히 더 크게 만드는 것과 다른 지점입니다.

### 2) 흔한 오해 — 왜 "똑똑해서 비싸다"로 읽게 되나

사용자가 보는 것은 최종 답변뿐이라, 가격이 오르면 "모델 성능이 좋아져서"라고 납득하기 쉽습니다. 하지만 실제 청구서에는 눈에 보이지 않는 사고 토큰이 섞여 있습니다. OpenAI 공식 문서 기준으로 추론 토큰은 API 응답 내용에는 나타나지 않지만 컨텍스트 창을 차지하고 출력 토큰 요금으로 과금됩니다. Anthropic도 동일한 원칙을 적용해, `thinking` 블록에 쓰인 토큰을 출력 토큰 단가로 청구한다고 공식 문서에 명시하고 있습니다. 즉 가격 차이의 일부는 "더 똑똑해서"가 아니라 "눈에 안 보이는 토큰이 더 많이 찍혀서"입니다.

### 3) 실제로 판단하는 기준

두 회사 모두 사고 분량을 조절하는 손잡이를 제공합니다. OpenAI는 reasoning effort를 낮음·중간·높음 등 단계로 설정해 사고 토큰 생성량 자체를 제한할 수 있게 했고, Anthropic은 `budget_tokens`로 사고 토큰의 목표치를 직접 지정하거나(수동 모드), 적응형 사고에서는 effort 단계로 모델이 생각할지 말지 자체를 판단하게 둘 수 있습니다. 즉 비용을 판단할 때 볼 지표는 "모델이 똑똑한가"가 아니라 "이 작업에 어느 정도 사고 예산이 필요한가"입니다.

### 4) 언제 쓸모 있고 언제 무의미한가

다단계 수학 증명, 복잡한 코드 디버깅, 여러 제약 조건을 동시에 만족해야 하는 설계 문제처럼 '생각할 거리'가 실제로 많은 작업에서는 추론 모델의 긴 사고 과정이 정답률을 눈에 띄게 끌어올립니다. 스탠퍼드 연구진의 "s1" 논문(2025년 1월 공개)은 사고 토큰 예산을 강제로 늘리는 것만으로도 추론 성능이 좋아진다는 점을 보여줬습니다. 하지만 사고 분량을 무작정 늘린다고 계속 좋아지는 것은 아닙니다. 사고 과정을 길게 늘인 모델의 거동을 분석한 2026년 연구는, 일정 수준을 넘어서면 성능 개선 폭이 급격히 줄어들고 오히려 모델이 맞던 답을 스스로 뒤집는 "과잉 사고(overthinking)" 현상이 나타난다고 보고했습니다. 단순한 사실 확인이나 짧은 요약처럼 생각할 거리가 적은 작업에 추론 모델을 기본값으로 켜 두면, 성능 향상 없이 비용만 올라가는 경우가 많습니다.

## 실전 — 추론 모델 비용을 제대로 읽는 4가지 원칙

1. 가격표를 볼 때 "모델이 똑똑해져서"가 아니라 "사고 토큰이 출력 토큰으로 얼마나 더 찍히는지"로 해석합니다. OpenAI·Anthropic 모두 공식 문서에 이 과금 원칙을 명시하고 있습니다.
2. 사용하는 API에 reasoning effort나 `budget_tokens` 같은 사고량 조절 파라미터가 있다면 기본값을 그대로 쓰지 말고, 작업 난이도에 맞춰 낮춰 봅니다. 간단한 작업에는 낮은 단계만으로도 충분한 경우가 많습니다.
3. 비용을 추적할 때는 눈에 보이는 응답 길이가 아니라 사용량 응답의 `reasoning_tokens`/`thinking_tokens` 항목을 직접 확인합니다. 체감 답변 길이와 실제 청구 토큰 수는 다를 수 있습니다.
4. 같은 '추론 모델' 카테고리 안에서도 회사별 가격 차이가 크다는 점을 기억합니다. 이는 기술 효율 차이만이 아니라 회사가 붙이는 마진의 차이이기도 하므로, 단순히 "더 비싼 쪽이 더 많이 생각한다"로 단정하지 않는 편이 안전합니다.

## 코멘트
