본문 바로가기

AI

[ AI/Kimi ] 중국이 처음 미국을 이겼다.

 

 

 

 

항목 k2/k2.6 k3 의미
전체 파라미터 약 1조 2.8조 저장된 지식, 기능 후보 공간 확대
전문가수 384개 중 8개 선택 896개 중 16개 선택 계산량 증가를 억제하면서 모델 욕량 확대
문맥 길이 128K→256K(2025.9)→256K 유지 1M 토큰 대형 코드 저장소, 다수 문서, 장기간 작업 처리
핵심 attention 주로 MLA KDA+Gated MLA 장문 처리 비용과 기억 효율 개선
깊이 방향 연결 일반 Redisudal Attention Residual 이전 층의 정보를 선택적으로 재사용
독립 Intelligence Index 44 57 종합 능력의 실질적 상승

 

 

KDA 란

KDA는 긴 대화를 전부 KV cache에 쌓지 않고, 새 토큰이 들어올 때마다 작은 숫자 메모리에서 오랜된 관계를 선택적으로 지우고 새로운 관계를 써 넣는 합축형 attention

읽기→지우기→쓰기 3단계

 

Channel-wise forgetting 란

Channel은 모델 내부에서 정보를 표현 하는 여러 숫자 차원(사람의 메모장으로 비유하면서 서로다른 정보의 서랍)

 

기존의 단순한 forgetting 방식은 모든 서랍을 비슷한 비율로 지우는 것 => 모든 서랍 정보 10% 약화

KDA의 channel-wise forgetting은 서랍마다 지우는 정보가 다름.

사람 이름 정보 → 2% 약화
현재 문장의 어순 → 80% 약화
주요 주제 → 5% 약화
일시적인 표현 → 95% 약화

 

 

KDA의 장점

  • 문맥이 길어져도 메모리가 폭발적으로 증가하지 않음
  • 긴 문맥에서 토큰 생성 속도를 높일 수 있음
  • 오래된 정보를 선택적으로 지울 수 있음
  • 새로운 정보로 기존 기억을 수정하기 쉬움

KDA의 한계

  • 압축하면서 세부 정보가 손실될 수 있음
  • 10만 문장 전의 정확한 표현을 그대로 찾는 데 불리할 수 있음
  • 하나의 작은 메모리에 너무 많은 관계를 저장하면 정보가 서로 간섭할 수 있음
  • 무엇을 잊어야 할지 잘못 판단하면 중요한 정보도 사라질 수 있음

그래서 Kimi Linear는 KDA만 사용하는 것이 아니라, KDA와 MLA를 3:1 비율로 섞은 하이브리드 구조를 사용합니다.

  • KDA 층: 대부분의 정보를 저렴하게 압축
  • MLA 층: 필요한 시점에 더 정확한 전체 문맥 검색

 

레이어(Layer)란: 신경망이 입력을 처리하는 한 단계입니다. 실제 모델은 이런 레이어가 수십~수백 개 쌓여 있고, 정보가 아래(입력에 가까운 얕은 레이어)에서 위(출력에 가까운 깊은 레이어)로 순차 전달됩니다. 그림엔 3개로 축약했을 뿐, 실제론 훨씬 많습니다.

 

  • 굵고 진한 선(3→2) = 강하게 결합
  • 가늘고 옅은 선(3→1) = 약하게 결합

 

 

좌→우 (KDA): 이건 레이어 깊이가 아니라 토큰이 등장하는 순서, 즉 시간축.문장을 왼쪽에서 오른쪽으로 읽듯 왼쪽=오래된 토큰, 오른쪽=최근 토큰. 원이 오른쪽으로 갈수록 진해지는 건 "최근 토큰일수록 강하게 반영되고 오래된 토큰은 점점 잊힌다"는 channel-wise forgetting을 표현.

 

Attention Residuals

일반 residual connection은 모든 층의 출력을 동일 비중으로 계속 누적해, 깊어질수록 특정 층의 중요한 정보가 희석될 수 있음. AtteRes는 이전 층의 결과를 모두 똑같이 더하지 않고 현재 입력에 필요한 표현을 Attention

 

 

MoE 896개 전문가

50B가 2.8T 전체 파라미터 중 실제 활성화되는 규모라면, 비율은 약 1.79%

Moonshot의 공식 확인이 아닌 외부 추정치이므로 미공개, 비공식 추정 약 50B"로만 취급해

 

 

Stable LatentMoE

일반 MoE는 hidden dimension 전체에서 전문가 연산, 통신을 수행하는 반면, LatentMoE는 토큰을 더 작은 Latent dimension으로 압축한 뒤 전문가에게 전달.

4k 사진을 그대로 전달하는 대신 핵심 특징만을 전달하는 것과 비슷. 이를 통해 전문가 수를 384 -> 896 늘리면서도 실제 계산은 16개로 제한.

 

Per-Head Muon: Attention head

일부 head는 분법 관계 일부는 긴 거리 관계나 코드 구조에 집중. 기존 Muon은 큰 가중치 행렬을 한 덩어리로 최적화하지만, 공식 블로그는 Per-Head Munon이 attention head를 독립적으로 최적화해 대규모에 더 적응적인 학습을 가능하게 한다고 설명.

 

 

 

 

 

MLA(Multi-head Latent Attention):  일반 attention은 과거 토큰의 key, value 정보를 비교적 큰 형태로 저장. 반면 Latent 으로 압축 저장. Latent은 원본 정보를 그대로 보관하지 않고, 중요한 특징을 작은 숫자 묶음으로 압축한 내부 표현.

Gated MLA:
MLA가 찾아본 정보 -> gate 얼마나 통과시킬까? -> 다음 층으로 전달되는 정보