토니의 연습장
Gated Attention (≠Hybrid Attention) 본문
1. 배경 지식



2. Gated Attention

3. Long-Context 를 위한 Attention

4. Qwen 최신 모델

3. Gated Attention 과 Hybrid Attention 비교
👉 겹치는 부분은 있지만 관점과 목적이 다른 용어
1️⃣ Gated Attention (게이티드 어텐션)
핵심 개념
어텐션 결과를 “얼마나 반영할지”를 게이트(gate)로 조절하는 메커니즘
즉,
- 어텐션은 이미 계산됨
- 그 출력을 그대로 쓰지 않고
- sigmoid / tanh / learned gate로 선별적으로 통과
👉 “어디에 볼까?”보다
👉 **“이 정보, 지금 써도 될까?”**에 초점
구조적 관점
일반적인 형태:
Attention(Q,K,V)=A\text{Attention}(Q,K,V) = A g=σ(Wx+b)g = \sigma(Wx + b) Output=g⊙A\text{Output} = g \odot A
또는 residual과 섞어서:
Output=g⊙A+(1−g)⊙X\text{Output} = g \odot A + (1-g) \odot X
직관적 예시
- 사회 행동 분석에서
→ 현재 행동이 ‘의미 있는 사회적 접촉’일 때만 attention 신호를 강하게 반영 - 멀티모달에서
→ 시각 정보가 신뢰 안 될 때 gate ↓, 텍스트 ↑
대표적 사용 사례
- Multimodal learning
- Gated Multimodal Unit (GMU)
- Visual Question Answering
- Reinforcement Learning
- Neural decoding
- 특정 state에서만 network-level attention 활성화
장점 / 한계
장점
- 노이즈 억제에 매우 강함
- 컨텍스트 의존적 제어 가능
- 해석력 ↑ (gate 값 자체가 의미 있음)
한계
- attention 구조 자체를 바꾸진 않음
- gate 학습 실패 시 underfitting 위험
2️⃣ Hybrid Attention (하이브리드 어텐션)
핵심 개념
서로 다른 종류의 어텐션을 “결합”해서 사용하는 구조적 개념
👉 attention 방식의 조합
대표적인 조합 유형
① Spatial + Channel Attention
- CNN 기반 (예: CBAM)
- “어디 + 무엇” 동시에
② Self-Attention + Cross-Attention
- 멀티모달 트랜스포머
- intra + inter 관계 동시 학습
③ Local + Global Attention
- Long sequence 처리
- 계산량 ↓ + 문맥 유지
④ Soft Attention + Hard Attention
- 연속 + 이산 선택 결합
구조적 관점
예시 (local + global):
Alocal=Attnlocal(Q,K,V)A_{local} = \text{Attn}_{local}(Q,K,V) Aglobal=Attnglobal(Q,K,V)A_{global} = \text{Attn}_{global}(Q,K,V) Output=αAlocal+βAglobal\text{Output} = \alpha A_{local} + \beta A_{global}
(여기서 α, β가 fixed일 수도, 학습될 수도 있음)
직관적 예시
- 행동 onset 근처 → local attention
- 세션 전체 흐름 → global attention
- 둘을 동시에 고려
👉 “다른 관점의 주의 메커니즘을 병렬/계층적으로 사용”
대표적 사용 사례
- Vision Transformers
- Video understanding
- Long-context LLM
- Multiscale neural signal analysis
- fast dynamics + slow dynamics
장점 / 한계
장점
- 표현력 매우 강함
- 다양한 스케일/관계 포착
- SOTA 구조에서 자주 사용
한계
- 계산량 증가
- 구조 복잡 → 디버깅 어려움
- 해석성 ↓ (조합된 결과라서)
3️⃣ 핵심 차이 요약 (한눈에)
| 관점 | 제어 메커니즘 | 구조 설계 |
| 핵심 질문 | “이 attention을 쓸까?” | “어떤 attention들을 쓸까?” |
| 작동 위치 | attention 출력 이후 | attention 계산 단계 |
| 주요 연산 | gate (sigmoid 등) | multiple attention blocks |
| 노이즈 억제 | ⭐⭐⭐⭐ | ⭐⭐ |
| 표현력 확장 | ⭐⭐ | ⭐⭐⭐⭐ |
| 해석 가능성 | 높음 | 낮음 |
| 함께 사용 가능? | ✅ 가능 | ✅ 가능 |
4️⃣ 같이 쓰이는 경우 (중요)
실제로 최신 모델들에서는 둘을 같이 씀:
예:
- Hybrid attention으로 다양한 후보 정보 생성
- Gated attention으로 상황에 맞는 것만 통과
5️⃣ 한 줄로 정리하면
Gated attention은 “얼마나 쓸지”를 조절하는 스위치이고,
Hybrid attention은 “무슨 종류의 주의를 쓸지”를 설계하는 구조
참고)
[노토랩 변형호] Qwen 3 Next 이해하기 Part 2: Attention과 Long Context (Linear Attention, DeltaNet, Mamba2, ) | Notion
채널 수도리무브(@sudoremove)
bustling-pea-9a9.notion.site
[노토랩 변형호] Qwen 3 Next 이해하기 Part 2: Attention과 Long Context (Linear Attention, DeltaNet, Mamba2, ) | Notion
채널 수도리무브(@sudoremove)
bustling-pea-9a9.notion.site
'AI 일반 > 모델, 아키텍처, 구현' 카테고리의 다른 글
| Pretrain, SFT, RL (0) | 2025.11.17 |
|---|---|
| MoE (Mixture of Experts) (0) | 2025.11.15 |
| GPT/Llama 아키텍처 (0) | 2025.09.18 |
| LLM train/eval/generate 간단한 예시 (0) | 2025.09.18 |
| RLHF / DPO (ft. Pretrained -> SFT -> Reward -> Final model) (0) | 2025.09.05 |