| 항목 | k2/k2.6 | k3 | 의미 |
| 전체 파라미터 | 약 1조 | 2.8조 | 저장된 지식, 기능 후보 공간 확대 |
| 전문가수 | 384개 중 8개 선택 | 896개 중 16개 선택 | 계산량 증가를 억제하면서 모델 욕량 확대 |
| 문맥 길이 | 128K→256K(2025.9)→256K 유지 | 1M 토큰 | 대형 코드 저장소, 다수 문서, 장기간 작업 처리 |
| 핵심 attention | 주로 MLA | KDA+Gated MLA | 장문 처리 비용과 기억 효율 개선 |
| 깊이 방향 연결 | 일반 Redisudal | Attention Residual | 이전 층의 정보를 선택적으로 재사용 |
| 독립 Intelligence Index | 44 | 57 | 종합 능력의 실질적 상승 |
KDA 란
KDA는 긴 대화를 전부 KV cache에 쌓지 않고, 새 토큰이 들어올 때마다 작은 숫자 메모리에서 오랜된 관계를 선택적으로 지우고 새로운 관계를 써 넣는 합축형 attention
읽기→지우기→쓰기 3단계
Channel-wise forgetting 란
Channel은 모델 내부에서 정보를 표현 하는 여러 숫자 차원(사람의 메모장으로 비유하면서 서로다른 정보의 서랍)
기존의 단순한 forgetting 방식은 모든 서랍을 비슷한 비율로 지우는 것 => 모든 서랍 정보 10% 약화
KDA의 channel-wise forgetting은 서랍마다 지우는 정보가 다름.
사람 이름 정보 → 2% 약화
현재 문장의 어순 → 80% 약화
주요 주제 → 5% 약화
일시적인 표현 → 95% 약화
KDA의 장점
- 문맥이 길어져도 메모리가 폭발적으로 증가하지 않음
- 긴 문맥에서 토큰 생성 속도를 높일 수 있음
- 오래된 정보를 선택적으로 지울 수 있음
- 새로운 정보로 기존 기억을 수정하기 쉬움
KDA의 한계
- 압축하면서 세부 정보가 손실될 수 있음
- 10만 문장 전의 정확한 표현을 그대로 찾는 데 불리할 수 있음
- 하나의 작은 메모리에 너무 많은 관계를 저장하면 정보가 서로 간섭할 수 있음
- 무엇을 잊어야 할지 잘못 판단하면 중요한 정보도 사라질 수 있음
그래서 Kimi Linear는 KDA만 사용하는 것이 아니라, KDA와 MLA를 3:1 비율로 섞은 하이브리드 구조를 사용합니다.
- KDA 층: 대부분의 정보를 저렴하게 압축
- MLA 층: 필요한 시점에 더 정확한 전체 문맥 검색

레이어(Layer)란: 신경망이 입력을 처리하는 한 단계입니다. 실제 모델은 이런 레이어가 수십~수백 개 쌓여 있고, 정보가 아래(입력에 가까운 얕은 레이어)에서 위(출력에 가까운 깊은 레이어)로 순차 전달됩니다. 그림엔 3개로 축약했을 뿐, 실제론 훨씬 많습니다.
- 굵고 진한 선(3→2) = 강하게 결합
- 가늘고 옅은 선(3→1) = 약하게 결합
좌→우 (KDA): 이건 레이어 깊이가 아니라 토큰이 등장하는 순서, 즉 시간축.문장을 왼쪽에서 오른쪽으로 읽듯 왼쪽=오래된 토큰, 오른쪽=최근 토큰. 원이 오른쪽으로 갈수록 진해지는 건 "최근 토큰일수록 강하게 반영되고 오래된 토큰은 점점 잊힌다"는 channel-wise forgetting을 표현.
Attention Residuals
일반 residual connection은 모든 층의 출력을 동일 비중으로 계속 누적해, 깊어질수록 특정 층의 중요한 정보가 희석될 수 있음. AtteRes는 이전 층의 결과를 모두 똑같이 더하지 않고 현재 입력에 필요한 표현을 Attention
MoE 896개 전문가

50B가 2.8T 전체 파라미터 중 실제 활성화되는 규모라면, 비율은 약 1.79%
Moonshot의 공식 확인이 아닌 외부 추정치이므로 미공개, 비공식 추정 약 50B"로만 취급해
Stable LatentMoE
일반 MoE는 hidden dimension 전체에서 전문가 연산, 통신을 수행하는 반면, LatentMoE는 토큰을 더 작은 Latent dimension으로 압축한 뒤 전문가에게 전달.
4k 사진을 그대로 전달하는 대신 핵심 특징만을 전달하는 것과 비슷. 이를 통해 전문가 수를 384 -> 896 늘리면서도 실제 계산은 16개로 제한.
Per-Head Muon: Attention head
일부 head는 분법 관계 일부는 긴 거리 관계나 코드 구조에 집중. 기존 Muon은 큰 가중치 행렬을 한 덩어리로 최적화하지만, 공식 블로그는 Per-Head Munon이 attention head를 독립적으로 최적화해 대규모에 더 적응적인 학습을 가능하게 한다고 설명.
MLA(Multi-head Latent Attention): 일반 attention은 과거 토큰의 key, value 정보를 비교적 큰 형태로 저장. 반면 Latent 으로 압축 저장. Latent은 원본 정보를 그대로 보관하지 않고, 중요한 특징을 작은 숫자 묶음으로 압축한 내부 표현.
Gated MLA:
MLA가 찾아본 정보 -> gate 얼마나 통과시킬까? -> 다음 층으로 전달되는 정보
'AI' 카테고리의 다른 글
| [ LLM/Transformer Block ] Transformer Block 안을 들여다 보자 (0) | 2026.08.17 |
|---|---|
| [ LLM/Ingerence ] 추론에 대해서 간단히 알아보 (0) | 2026.08.09 |
| [ AI/LLM ] 어떻게 검증할 것인가? (0) | 2026.07.05 |
| [ AI/Medical ] 2025년 12월 2개의 Medical Models과 3개의 프론티어 모델 비교(Feat. GPT-5.2, Gemini 3.1 Pro and Claude Opus 4.6.) (0) | 2026.06.14 |
| [ AI/trasnformer ] QKV와 Attention (0) | 2026.05.23 |