Tech AI News - 테카이

트랜스포머 — 지금 AI 전부의 조상님

· 5분 읽기

Read this post in English →

RNN처럼 한 단어씩 순서대로 읽는 대신, 문장 전체를 한 번에 보고 단어끼리 서로 얼마나 관련 있는지 계산한다 — 2017년 구글이 내놓은 이 아이디어 하나가 지금 나오는 거의 모든 AI 모델의 뼈대가 됐습니다. 이 구조를 모르고는 GPT도, 제미나이도, 클로드도 제대로 설명할 수 없습니다.


배경 / 왜 지금 이 구조인가

2026년 현재 신모델이 나올 때마다 "새로운 아키텍처"라는 표현이 따라붙습니다. 하지만 실제로는 Google Research 공식 블로그가 2017년 소개한 트랜스포머(Transformer) 구조가 여전히 거의 모든 프런티어 모델의 뼈대입니다. futureagi.com에 따르면 GPT-5.6, 클로드 오퍼스 5, 제미나이 3.x, 그록 4.5 등 2026년 주요 모델은 모두 "디코더 전용(decoder-only) 트랜스포머"를 기반으로 하며, 아키텍처 자체의 차이보다 학습 데이터와 후처리 방식의 차이가 성능을 더 크게 가릅니다.

동시에 IBM이 정리한 것처럼 맘바(Mamba) 같은 대안 구조가 "트랜스포머를 대체할 최초의 경쟁력 있는 아키텍처"로 주목받으며 완전히 새로운 방식이 등장한 것처럼 보도되기도 합니다. 그런데 이런 대안들도 대부분 "트랜스포머의 무엇을 어떻게 바꿨는가"로 설명됩니다. 즉 트랜스포머를 모르면 지금 나오는 AI 뉴스의 절반은 기준점 없이 읽게 되는 셈입니다.

핵심 데이터 & 현황

항목내용
최초 발표2017년 6월, 구글 연구진 8명(Vaswani 외), 논문 "Attention Is All You Need"
인용 수25만 회 이상 (위키백과 기준, 2026년, 21세기 발표 논문 중 최다 인용 상위 10위권)
핵심 대체 후보맘바(Mamba, 상태공간모델) — 시퀀스가 길어져도 메모리 사용량이 선형으로만 증가, 동급 트랜스포머 대비 최대 5배 높은 처리량
2026년 현황GPT-5.6·클로드 오퍼스 5·제미나이 3.x 등 프런티어 모델 대부분이 디코더 전용 트랜스포머 + 혼합전문가(MoE) 구조 채택

해석: 8년 넘게 바뀌지 않았다는 것 자체가 이례적입니다. 딥러닝 분야에서 핵심 아키텍처가 이 정도로 오래 살아남은 사례는 많지 않습니다. 동시에 맘바처럼 장문 처리에서 뚜렷한 효율 이점을 보이는 대안이 나온다는 것은, 트랜스포머가 만능은 아니라는 신호이기도 합니다.

심층 분석

1) 트랜스포머 이전엔 뭐가 문제였나

트랜스포머 이전 번역·언어 모델은 RNN(순환 신경망)을 주로 썼습니다. Google Research 블로그는 RNN의 한계를 두 가지로 짚습니다. 첫째, 문장을 왼쪽에서 오른쪽으로 한 단어씩 순서대로 처리하다 보니 멀리 떨어진 단어 사이의 관계를 학습하기 어려웠습니다. "bank"라는 단어가 "강(river)"과 연결되는지 "은행(money)"과 연결되는지 판단하려면 그 사이의 모든 단어를 순서대로 거쳐야 했던 셈입니다. 둘째, 순차 처리 방식이라 GPU·TPU 같은 병렬 연산 하드웨어의 이점을 제대로 살리지 못했습니다. CNN(합성곱 신경망) 기반 모델도 시도됐지만, 먼 거리의 정보를 합치는 데 필요한 연산 단계 수가 거리에 비례해 늘어나는 문제는 비슷했습니다.

2) 셀프 어텐션 — 핵심 아이디어 한 줄

트랜스포머의 핵심은 셀프 어텐션(self-attention)입니다. 비유하자면, 한 단어를 이해할 때 문장 속 다른 모든 단어를 한 번에 훑어보고 "이 단어와 얼마나 관련 있는지" 점수를 매긴 뒤, 그 점수만큼 각 단어의 정보를 섞어서 반영하는 방식입니다. 이후로는 비유 대신 실제 구조로 설명하면, 각 단어는 쿼리(Query)·키(Key)·값(Value) 세 벡터로 변환되고, 한 단어의 쿼리와 다른 모든 단어의 키를 내적(dot product)해 관련도 점수를 구한 뒤 소프트맥스(softmax)로 확률 분포로 바꿉니다. 이 확률로 각 단어의 값(Value) 벡터를 가중합하면, "문맥을 반영한" 새로운 단어 표현이 나옵니다. RNN처럼 단어를 순서대로 거칠 필요 없이 문장 전체를 한 번에 계산하기 때문에 병렬 처리가 가능해지고, 멀리 떨어진 단어 사이의 관계도 한 단계 만에 직접 계산됩니다.

3) 그 외 구성 요소 — 멀티헤드, 포지셔널 인코딩, 피드포워드

셀프 어텐션 하나만으로는 부족한 부분을 보완하는 장치가 세 가지 더 있습니다. 멀티헤드 어텐션(multi-head attention)은 이 관련도 계산을 여러 개(헤드)로 나눠 동시에 수행해, 문법적 관계·의미적 관계 등 서로 다른 종류의 연관성을 각기 다른 헤드가 나눠 포착하게 합니다. 포지셔널 인코딩(positional encoding)은 셀프 어텐션 자체에는 순서 개념이 없기 때문에, 사인·코사인 함수로 만든 위치 정보를 각 단어 벡터에 더해 "몇 번째 단어인지"를 알려주는 장치입니다. 마지막으로 각 어텐션 층 뒤에는 위치마다 동일하게 적용되는 피드포워드 신경망과 잔차 연결(residual connection)·층 정규화(layer normalization)가 붙어 학습을 안정시킵니다. 이 네 가지 — 셀프 어텐션, 멀티헤드, 포지셔널 인코딩, 피드포워드 — 가 표준 트랜스포머 블록을 이룹니다.

4) 그래서 지금 AI들은 이걸 어떻게 바꿔서 쓰나

2017년 원논문은 번역을 위한 인코더-디코더 구조였지만, 지금의 대화형 AI 대부분은 인코더 없이 디코더만 쌓은 "디코더 전용(decoder-only)" 구조를 씁니다. 다음 단어를 예측하는 데만 집중하는 방식이 텍스트 생성에 더 잘 맞기 때문입니다. 여기에 라마·딥시크·미스트랄 같은 오픈웨이트 모델은 혼합전문가(MoE, Mixture-of-Experts) 구조를 공개적으로 채택해, 전체 파라미터 수는 조 단위로 키우면서도 한 번의 연산에는 그중 일부(수백억 단위)만 활성화해 비용을 낮춥니다. GPT·클로드·제미나이 같은 폐쇄형 모델도 MoE를 쓸 것으로 추정되지만 정확한 내부 구조는 공개되지 않았습니다. 한편 맘바처럼 어텐션 없이 상태공간모델(SSM)로 시퀀스를 처리하는 구조도 나왔는데, IBM에 따르면 긴 문맥에서는 메모리 효율이 뛰어나지만 문맥 속에서 즉석으로 배우는 능력(in-context learning)에서는 아직 트랜스포머에 못 미칩니다. 그래서 AI2의 재바(Jamba), IBM의 밤바(Bamba)·그래나이트(Granite) 4.0처럼 트랜스포머 층과 맘바 층을 섞은 하이브리드 구조가 절충안으로 나오고 있습니다.

실전 — 트랜스포머를 제대로 읽는 3가지 원칙

  1. "새 아키텍처"라는 표현을 볼 때마다 어디가 진짜 새로운지 확인합니다. 2026년 주요 모델 대부분은 여전히 트랜스포머의 변형(디코더 전용 + MoE)이며, 완전히 다른 구조(맘바 등)는 아직 하이브리드 형태로만 섞여 들어가는 단계입니다.
  2. 모델 크기(파라미터 수)와 실제 연산량(활성 파라미터 수)을 구분해서 봅니다. MoE 구조에서는 전체 파라미터가 조 단위라도 한 번에 쓰는 파라미터는 훨씬 적을 수 있어, 단순히 "숫자가 크다"만으로 성능이나 비용을 판단하기 어렵습니다.
  3. 긴 문서·긴 대화를 다루는 서비스를 고를 때는 "컨텍스트 길이"만이 아니라 그 길이에서 실제로 빠르고 안정적으로 동작하는지를 함께 봅니다. 트랜스포머는 문맥이 길어질수록 연산량이 제곱으로 늘어나는 구조적 특성이 있어, 이 부분을 보완한 방식(효율화 기법, 하이브리드 구조 등)을 쓰는지가 체감 성능에 영향을 줍니다.

참고 링크

  • #AI
  • #인공지능
  • #트랜스포머
  • #딥러닝
  • #어텐션 메커니즘
  • #LLM
  • #맘바
작동 원리

어텐션 — AI가 문장에서 '중요한 것'을 고르는 법

AI가 긴 문장을 전부 다 기억해서가 아니라 지금 필요한 몇 단어에만 집중해서 이해하는 원리가 어텐션입니다. 컨텍스트가 길어질수록 비용이 커지는 이유와, GQA·MLA 같은 최적화 기법이 실무 응답 속도와 요금에 미치는 영향을 정리했습니다.

· 5분