전체 글 (5) 썸네일형 리스트형 문학적 Transformer - Prologue 이 시리즈의 목적Transformer를 설명하는 자료는 이미 수없이 많습니다.하지만 많은 글과 영상들이 구조적 개요나 수식에만 초점을 맞추다 보니,정작 Transformer가 어떤 사고 흐름을 따라 작동하는지,왜 이런 구조가 되었는지를 명확히 이해하기 어렵습니다.이 시리즈는 그러한 아쉬움에서 시작되었습니다.이 시리즈가 참조한 영상Transformer의 구조와 작동 원리를 입체적으로 이해하기 위해다음 3개의 뛰어난 설명 영상을 함께 참고했습니다:https://www.youtube.com/watch?v=wjZofJX0v4Mhttps://www.youtube.com/watch?v=eMlx5fFNoYchttps://www.youtube.com/watch?v=9-Jl0dxWQs8 이 영상들에서 느낀 직관, 논리 .. 문학적 Transformer - Decoder 전체 구조하나의 Decoder Layer는 다음과 같은 세 단계로 구성된다:Masked Multi-Head Self-Attention (SMA)Cross-Attention (Encoder-Decoder Attention, CA)Feed Forward Network (FFN)각 단계 뒤에는 Residual + LayerNorm이 붙는다.이 구조가 N번 반복되며, 최종 출력은 Linear + Softmax로 확률 분포가 된다.Masked Self-Attention — 과거만 바라보는 자기 성찰Decoder가 지금까지 생성한 단어들만 참조하도록Lower Triangular Mask를 적용한 Attention각 위치의 벡터는 해당 시점까지의 문맥 요약이다.병렬 연산이 가능하지만, 마스크 덕분에 미래 정보는 차단.. 문학적 Transformer - Encoder - Head 다양한 시선의 집합, Multi-Head AttentionTransformer에서 사용되는 Attention 연산은 다음과 같다:$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{T}\right) \cdot V$$이 하나의 연산이 하나의 Head이며, Transformer는 이 연산을 한 번만 하지 않는다.여러 Head, 여러 관점Transformer는 동일한 입력 $X$에 대해 서로 다른 $W_Q$, $W_K$, $W_V$를 적용해 여러 개의 $Q, K, V$ 세트를 병렬로 생성한다:$$Q_i = X \cdot W_{Qi} \K_i = X \cdot W_{Ki} \V_i = X \cdot W_{Vi}$$$$\text{head}_i = \tex.. 문학적 Transformer - Encoder - Attention 핵심 요약Attention은 단어 간 의미 관계를 동적으로 반영하는 구조이다.각 단어는 Query(Q)와 Key(K)라는 시선을 만들어 서로를 평가하고,그 중요도를 softmax(QKᵗ / T)로 정규화한 뒤,Value(V)에서 정보를 받아온다.Temperature는 이 집중의 강도를 조절하며,최종적으로 각 단어는 문맥이 반영된 벡터로 다시 표현된다.Q, K는 어떤 역할을 할까?Transformer의 Attention은 다음과 같은 식으로 정의된다:$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{T}\right) \cdot V$$여기서, 각 단어는 다음과 같은 시선을 갖는다:$$Q = X \cdot W_Q \K = X \cdot W_K$$Q .. 문학적 Transformer - Embedding 문학적 Transformer — 1. 단어는 어떻게 ‘의미’를 가질까?핵심 요약임베딩 벡터는 단순한 숫자 배열이 아니라 고차원 의미 공간에서의 좌표이다.각 차원은 하나의 의미 축이며, 단어 벡터는 그 위에서 의미의 방향을 가진다.벡터 간 연산은 기하학적으로 의미를 보존한다.고차원 공간 덕분에 단어들은 서로 간섭 없이 독립적인 의미를 가질 수 있다.이 공간을 구성하는 것이 바로 Embedding Matrix이며, Transformer의 첫 무대다.의미를 좌표로 바꾸는 수학임베딩 벡터는 단순히 수치화된 단어가 아니다.모델은 학습을 통해 이 벡터 안에 수많은 의미의 방향성을 구성한다.어떤 축은 ‘남성 ↔ 여성’을,또 다른 축은 ‘고귀함 ↔ 평범함’을 나타낸다.즉, 각 차원은 의미의 축이고,단어 벡터는 그 위에.. 이전 1 다음