
학습 vs 추론 — AI는 언제 똑똑해지는 걸까
목차
"AI 와 대화를 오래 하다 보니 점점 똑똑해지는 것 같다"는 말은 절반만 맞다. 대화가 길어지며 답이 정교해 보이는 건 대부분 학습(training)이 아니라 추론(inference) 단계에서 일어나는 일이고, 이 둘을 구분하지 못하면 "이 모델은 왜 어제 알려준 걸 오늘은 까먹었지" 같은 흔한 오해로 이어진다.
배경 / 왜 지금 이 구분이 중요한가
2022~2023년 생성형 AI 붐은 "더 큰 모델을 더 많은 데이터로 학습시키면 더 똑똑해진다"는 학습 스케일링(pretraining scaling)이 이끌었다. 그런데 OpenAI 의 o1·o3, 이후 여러 회사의 "추론 모델(reasoning model)"이 등장하면서 흐름이 바뀌었다. 모델 크기를 더 키우는 대신, 답을 내놓기 전에 더 오래 생각하게 하는 것만으로 성능이 오른다는 사실이 확인된 것이다. 업계는 이를 세 번째 스케일링 법칙, 테스트-타임 컴퓨트(test-time compute)라 부른다.
2026년 3월 엔비디아 개발자 콘퍼런스 'GTC 2026'에서 젠슨 황 CEO는 "추론의 변곡점이 도래했다"고 선언하며, AI 에이전트 등장으로 필요한 연산량이 챗GPT 초기 대비 100만 배 늘었다고 밝혔다(서울신문, 2026.3.17). 국내에서도 5월 반도체공학회 주최 워크숍에서 "AI 반도체 시장의 중심축이 학습에서 추론 단계로 빠르게 이동하고 있다"는 진단이 나왔다(전자신문, 2026.5.22). 학습과 추론의 차이를 알아야 이런 뉴스가 무슨 얘기를 하는지 이해할 수 있다.
핵심 데이터 & 현황
| 구분 | 학습 (Training) | 추론 (Inference) |
|---|---|---|
| 하는 일 | 데이터를 보고 파라미터(가중치)를 조정 | 고정된 파라미터로 입력에 대한 답을 계산 |
| 연산 방향 | 순전파 + 역전파(정답과 비교해 가중치 수정) | 순전파만 (가중치는 변하지 않음) |
| 실행 시점 | 모델 출시 전, 오프라인에서 몇 주~몇 달 | 사용자가 요청할 때마다, 실시간 |
| 결과물 | 고정된 가중치 파일(체크포인트) | 그때그때의 답변, 저장되지 않음 |
- 인퍼런스 인프라를 다루는 Introl(2025.12) 리포트에 따르면 2026년 추론 연산 수요는 학습 수요의 118배에 달할 것으로 전망되며, 2030년에는 전체 AI 컴퓨트의 약 75%가 추론에 쓰일 것으로 분석된다.
- 스탠퍼드·UC버클리·구글 딥마인드 공동 연구(arXiv 2408.03314, 2024.8)는 FLOPs(연산량)를 동일하게 맞췄을 때, 작은 모델에 테스트-타임 컴퓨트를 더 쓰는 쪽이 파라미터가 14배 큰 모델을 능가할 수 있음을 보였다.
- DeepSeek-R1 계열 추론 모델은 테스트-타임 컴퓨트를 늘려 수학 경시대회 문제(AIME) 정답률을 15.6%에서 71%까지 끌어올렸다는 결과가 보고됐다(Introl 리포트 재인용, 2025.12). 다만 이 방식은 표준 모델 대비 토큰을 10~100배 더 소모한다.
분석: 세 수치가 가리키는 방향은 같다 — AI 산업의 돈과 전력이 "더 큰 모델을 학습시키는 것"에서 "이미 학습된 모델이 답을 낼 때 얼마나 잘 생각하게 할 것인가"로 옮겨가고 있다.
심층 분석
1) 학습과 추론은 정확히 무엇인가
학습을 "공부", 추론을 "시험"에 비유하면 이해가 빠르다. 학습 단계에서는 모델이 방대한 텍스트를 보며 예측이 틀릴 때마다 역전파로 가중치를 조금씩 고친다. 이 과정은 대규모 GPU 클러스터에서 몇 주에서 몇 달이 걸리고, 끝나면 가중치가 파일 형태로 고정(체크포인트)된다. 이후 서비스에 올라간 모델은 그 가중치를 더 이상 바꾸지 않은 채, 들어온 입력에 대해 순전파만 반복해 답을 낸다. 이 실행 단계가 추론이다. 이 비유는 이후 다시 쓰지 않고, 이제부터는 "학습"과 "추론"이라는 정확한 용어로만 설명한다.
2) 흔한 오해 — 왜 그렇게 읽게 되나
대화를 이어갈수록 챗봇이 문맥을 더 잘 파악하고 답도 정교해지니 "대화하면서 똑똑해진다"고 느끼기 쉽다. 하지만 이는 컨텍스트 윈도우 안에 쌓인 이전 대화를 참고할 뿐이며, 창을 벗어나거나 새 세션을 열면 그 기억은 사라진다. 모델 가중치 자체는 전혀 바뀌지 않는다. o1·o3, 클로드의 확장 사고(extended thinking), 제미나이의 딥싱크처럼 "오래 생각하는" 추론 모델의 등장은 오해를 한 겹 더 키웠다. 이 모델들이 답을 내기 전 긴 사고 과정(chain-of-thought)을 거치는 것은 그 순간 새로운 지식을 배우는 게 아니라, 이미 학습된 지식을 추론 단계에서 더 깊게 활용하는 것이다.
3) 실제로 판단하는 기준
가장 간단한 구분법은 "이 모델이 다음번에도 이 내용을 기억하는가"다. 기억한다면 파인튜닝이나 다음 버전 재학습처럼 실제 학습 이벤트가 개입한 것이고, 세션이 끝나면 사라진다면 프롬프트·컨텍스트·사고 과정 등 추론 단계 기법이다. 프롬프트 엔지니어링, 검색 증강 생성(RAG), 여러 번 답을 만들어 투표하는 자기일관성(self-consistency), 에이전트의 다단계 도구 호출은 전부 추론 단계에서 벌어지는 일이며 모델 자체는 그대로다.
4) 언제 쓸모 있고 언제 무의미한가
테스트-타임 컴퓨트, 즉 "오래 생각하기"는 수학·코딩처럼 정답을 검증할 수 있는 문제에서 확실한 효과를 낸다. 반대로 정답이 정해지지 않은 의견·창작 요청이나, 이미 확실히 아는 사실을 묻는 질문에서는 오래 생각한다고 정확도가 오르지 않고 응답 시간과 비용(토큰)만 늘어난다. 실무에서 추론 모델을 쓸지 말지는 "이 질문에 검증 가능한 정답이 있는가"로 먼저 걸러보는 게 낫다.
실전 — 학습과 추론을 헷갈리지 않는 4가지 원칙
- 대화가 정교해지는 것과 모델이 똑똑해지는 것을 구분한다. 컨텍스트 안에서의 참고일 뿐, 세션을 닫으면 사라진다.
- "생각하는 AI"는 재학습이 아니라 추론 기법이다. o1·o3, 확장 사고 모델은 테스트-타임 컴퓨트를 쓰는 것이지, 그 순간 가중치를 바꾸지 않는다.
- 검증 가능한 문제에만 "더 생각하기"를 기대한다. 수학·코딩처럼 답이 맞는지 확인할 수 있는 영역이 아니면 효과가 제한적이다.
- 비용을 볼 때는 학습비와 추론비를 나눠서 본다. 한 번 학습시키는 비용은 고정비에 가깝지만, 추론 비용은 사용량에 비례해 계속 쌓인다 — 산업이 추론 인프라에 투자를 늘리는 이유다.
참고 링크
목차
관련 글

트랜스포머 — 지금 AI 전부의 조상님
GPT, 제미나이, 클로드까지 2026년 주요 AI 모델은 모두 2017년 구글이 발표한 트랜스포머 구조 위에서 작동합니다. 셀프 어텐션의 원리와 디코더 전용·MoE·맘바 하이브리드로 이어지는 변형 과정을 정리했습니다.

어텐션 — AI가 문장에서 '중요한 것'을 고르는 법
AI가 긴 문장을 전부 다 기억해서가 아니라 지금 필요한 몇 단어에만 집중해서 이해하는 원리가 어텐션입니다. 컨텍스트가 길어질수록 비용이 커지는 이유와, GQA·MLA 같은 최적화 기법이 실무 응답 속도와 요금에 미치는 영향을 정리했습니다.

API — 남의 AI를 내 서비스에 붙인다는 게 정확히 뭘까
API로 AI를 '붙인다'는 말은 모델 자체를 가져오는 게 아니라 매 요청마다 남의 서버에 접속해 답을 받아오는 것이라는 뜻으로, 토큰 요금 구조·속도 제한·API 키 보안까지 실무에서 판단해야 할 기준을 정리했습니다.

오픈소스 AI 모델, 왜 공짜로 풀까 — 수십억 달러짜리 모델을 무료로 내주는 전략의 논리
메타, 알리바바, 심지어 폐쇄 전략의 상징이던 오픈AI까지 최고 성능 모델을 무료로 뿌립니다. 자선이 아닙니다. "보완재를 공짜로 만들어 본진에서 돈을 번다"는 40년 된 실리콘밸리 전략이 AI 시대에 다시 작동하고 있습니다.