Tech AI News - 테카이

파인튜닝 — AI에게 회사를 가르친다는 오해

· 5분 읽기

Read this post in English →

파인튜닝을 "AI에게 회사 매뉴얼을 통째로 외우게 하는 것"으로 오해하면, 적지 않은 학습 비용을 치르고도 최신 정보 하나 반영하지 못하는 모델을 떠안게 됩니다.


배경 / 왜 지금 이 용어인가

2026년 5월, OpenAI 는 자사 파인튜닝(fine-tuning) API 와 플랫폼을 단계적으로 종료한다고 밝혔습니다. OpenAI 개발자 문서에 따르면 한 번도 파인튜닝 작업을 실행한 적 없는 조직은 5월 7일부터 새 작업을 시작할 수 없고, 7월 2일부터는 최근 60일간 파인튜닝 모델 추론 이력이 없는 조직도 막힙니다. 2027년 1월 6일이 되면 기존 이용자까지 새 작업을 만들 수 없게 됩니다. OpenAI 는 이유로 "최신 베이스 모델이 지시를 훨씬 잘 따르고, 프롬프트 기반 접근이 더 싸고 빠르다"는 점을 들었습니다.

반면 구글은 Vertex AI 에서 Gemini 모델의 지도 파인튜닝(supervised fine-tuning)을 계속 지원하고, Anthropic 은 자체 API 로는 파인튜닝을 열지 않는 대신 Amazon Bedrock 경유로 Claude 3 Haiku 한 모델만 파인튜닝을 허용하고 있습니다. 사업자마다 태도가 이렇게 갈리는 지금이야말로, "파인튜닝이 정확히 무엇을 하는 기술인지" 를 한 번 짚고 넘어갈 시점입니다.

핵심 데이터 & 현황

사업자파인튜닝 지원 현황 (2026년 9월 기준)비고
OpenAIGPT-4.1·GPT-4.1 mini 등 기존 이용자만, 신규 불가2026.05 단계적 종료 발표, 2027.01 완전 종료
GoogleVertex AI 에서 Gemini 지도 파인튜닝 계속 지원텍스트·이미지·오디오·문서 데이터 지원
Anthropic자체 API 미지원, Bedrock 경유 Claude 3 Haiku 만 가능세이프티·품질 고려로 지원 범위 제한
오픈웨이트 모델(Llama, Gemma 등)LoRA·QLoRA 로 직접 파인튜닝GPU 1장·수십 분 단위로도 가능

해석: "파인튜닝 = 어디서나 쓸 수 있는 표준 기능"이던 흐름과 달리, 2026년은 사업자별로 지원 범위가 갈리고 있습니다. 오히려 자체 호스팅 오픈웨이트 모델 쪽 선택지가 넓어진 모습입니다.

심층 분석

1) 파인튜닝은 정확히 무엇인가

파인튜닝은 이미 학습이 끝난 베이스 모델에 소량의 예시 데이터(주로 입력-출력 쌍)를 추가로 학습시켜, 모델 내부의 가중치(weight, 모델이 갖고 있는 수치 파라미터) 일부를 조정하는 과정입니다. 처음부터 모델을 학습시키는 사전학습(pretraining)과 달리, 이미 언어와 상식을 아는 모델에 "이런 형식으로 답하라", "이런 말투를 써라" 같은 행동 패턴을 덧입히는 작업에 가깝습니다.

2026년 기준 가장 널리 쓰이는 방식은 LoRA(Low-Rank Adaptation)와 그 변형인 QLoRA 입니다. 관련 기술 설명에 따르면 원본 가중치는 그대로 얼려두고 각 레이어 옆에 작은 저차원 행렬 두 개만 새로 학습시키는 방식으로, 전체 파라미터의 0.011% 만 조정하고도 전체 파인튜닝 대비 95100% 수준의 성능을 낸다고 합니다. 4096×4096 크기 레이어라면 랭크(rank) 16 설정만으로 학습해야 할 가중치 수가 100분의 1 수준으로 줄어드는 식입니다.

2) 흔한 오해 — 왜 그렇게 읽게 되나

"파인튜닝시키면 AI가 우리 회사 자료를 다 알게 된다"는 기대는 두 가지가 섞여서 생깁니다. 하나는 "학습"이라는 단어가 주는 인상이고, 다른 하나는 파인튜닝이 실제로 잘하는 일(형식·말투·반복 작업 패턴 학습)과 못하는 일(수시로 바뀌는 사실 정보 반영)을 구분하지 않는 것입니다.

파인튜닝된 모델은 학습 데이터에 없던 최신 사실을 알지 못합니다. 회사 제품 가격이 다음 달 바뀌면, 파인튜닝 모델은 재학습 전까지 옛 가격으로 답합니다. 반면 검색 증강 생성(RAG, Retrieval-Augmented Generation — 질문에 맞는 문서를 실시간으로 찾아 모델에 함께 넣어주는 방식)은 문서만 갱신하면 바로 최신 정보를 반영합니다. "회사를 가르친다"는 표현이 가리키는 일의 상당수는 사실 파인튜닝이 아니라 RAG 의 몫입니다.

3) 실제로 판단하는 기준

업계에서 통용되는 판단 순서는 프롬프트 엔지니어링 → RAG → 파인튜닝 순으로 시도해 보는 것입니다. 관련 가이드는 최소 500건 이상의 정제된 학습 예시가 있고, 프롬프트·RAG 로 해결되지 않는 명확한 정확도 격차가 확인된 뒤에야 파인튜닝을 검토하라고 권합니다. 프롬프트만으로 원하는 형식이 안 나오거나, 최신 정보 검색이 아니라 "항상 이 톤으로", "항상 이 순서로 답하라" 같은 반복적인 행동 패턴이 문제일 때가 파인튜닝을 고려할 시점입니다.

비용 구조도 감안해야 합니다. 비용 가이드에 따르면 오픈웨이트 7B급 모델을 LoRA 로 파인튜닝하면 GPU 비용만으로 수십만 원 선에서 끝나는 경우가 많지만, 70B 이상 모델을 통째로(full fine-tuning) 학습시키면 수천만 원 단위 컴퓨팅 비용이 든다고 합니다. RAG 파이프라인은 반대로 초기 구축비가 더 크고 이후 운영비가 꾸준히 드는 구조입니다.

4) 언제 쓸모 있고 언제 무의미한가

파인튜닝이 유의미한 경우는 ① 출력 형식을 엄격하게 고정해야 할 때(특정 JSON 스키마·법률 문서 양식 등), ② 반복되는 도메인 용어·말투를 매번 프롬프트로 설명하기 번거로울 때, ③ 추론 비용을 줄이기 위해 작은 모델에 특정 작업 능력만 압축해 넣을 때입니다. 반대로 회사 최신 정책·가격·재고처럼 계속 바뀌는 정보를 답하게 하려는 목적이라면 파인튜닝은 무의미하고, RAG 또는 실시간 API 연동이 맞는 방법입니다.

실전 — 파인튜닝을 제대로 읽는 4가지 원칙

  1. "파인튜닝 = 지식 주입"이 아니라 "파인튜닝 = 행동·형식 학습"으로 구분해서 생각합니다. 최신 사실 정보가 필요하면 RAG 를 먼저 봅니다.
  2. 프롬프트 엔지니어링으로 안 되는지, RAG 로 안 되는지부터 검증한 뒤 마지막 단계로 파인튜닝을 검토합니다.
  3. 사업자별 지원 범위가 다릅니다. OpenAI 는 신규 파인튜닝을 사실상 닫는 추세이고, 오픈웨이트 모델과 LoRA 조합은 자체 호스팅 여력이 있는 조직에 더 유연한 선택지입니다.
  4. 파인튜닝을 검토한다면 최소 수백 건 단위의 정제된 학습 예시와, "왜 프롬프트·RAG 로는 안 되는지"에 대한 명확한 근거를 먼저 준비합니다.

참고 링크

  • #AI 용어
  • #파인튜닝
  • #Fine-tuning
  • #LoRA
  • #RAG
  • #LLM
  • #OpenAI
  • #Anthropic
작동 원리

어텐션 — AI가 문장에서 '중요한 것'을 고르는 법

AI가 긴 문장을 전부 다 기억해서가 아니라 지금 필요한 몇 단어에만 집중해서 이해하는 원리가 어텐션입니다. 컨텍스트가 길어질수록 비용이 커지는 이유와, GQA·MLA 같은 최적화 기법이 실무 응답 속도와 요금에 미치는 영향을 정리했습니다.

· 5분

이건 알고 쓰자

AI 할루시네이션이란?

할루시네이션은 AI가 "고장 난" 결과가 아니라, 지금의 학습·평가 방식이 모른다고 말하는 것보다 그럴듯하게 찍는 쪽에 점수를 더 주기 때문에 나타나는 구조적 부작용에 가깝습니다. 원리를 알면 대응법도 달라집니다.

· 9분

작동 원리

학습 vs 추론 — AI는 언제 똑똑해지는 걸까

AI와 대화할수록 똑똑해진다고 느끼지만, 실제로 대화 중 새로 배우는 것은 아니다. 학습(training)과 추론(inference)이 어떻게 다르고, 테스트-타임 컴퓨트가 왜 2026년 AI 업계의 새 화두가 됐는지 데이터로 정리했다.

· 5분