무슨 일

SemiAnalysis가 DeepSeek식 Engram(학습된 멀티토큰 임베딩 룩업)이 HBM에 전량 올려두지 않고 DRAM·NVMe로 오프로드하기에 유리한 이유를 실험과 함께 정리한 유료 리드입니다. 토큰 ID로 주소가 정해지므로 히든 스테이트에 의존하는 전체 가중치 이동 없이 행 단위 프리페치가 가능합니다.

아키텍처 함의

반복되는 로컬 패턴을 벡터로 바로 꺼내 어텐션·FFN 재구성을 줄입니다. 동일 품질에서 HBM 용량 부담을 낮출 수 있지만, HBM 수요가 사라진다는 뜻은 아닙니다— 제약이 바뀌면 아키텍처가 그 제약 주위로 계속 혁신한다는 쪽입니다. Rubin Ultra HBM이 크게 깎인 로드맵 이후에도 “대역폭 > 용량” 논지가 강해집니다.

실험 스케치

공개 코드로 Engram 설정을 재현해 U자형 스케일링을 확인하고, 게이트 스코어로 어떤 n-gram이 강하게 쓰이는지(이름·코드 조각·보일러플레이트 등)를 프로브했습니다. DeepSeek-V4.1-Flash급 Engram 테이블(~189 GiB)을 mmap으로 SSD에 두고 서빙을 재고, DRAM 오프로드가 HBM 상주보다 파레토에서 나은 구간도 있다고 보고합니다. B300에서 Engram을 DRAM으로 빼면 TP4→TP2로 줄여 통신 오버헤드를 깎는 사례도 있습니다.

SSD vs DRAM

미최적화 SSD 경로는 CPU 왕복·게더링 비용 때문에 워밍 캐시여도 핀드 DRAM보다 약할 수 있습니다. 측정 구간에서 DRAM이 토큰/$·P90 인터랙티비티 모두에서 SSD를 앞섰고, 서버 구성을 싸게 못 바꾸면 값싼 스토리지만으로 추론 단가가 안 떨어진다고 결론짓습니다.

왜 지금

Engram이 추론 경제와 HBM TAM을 어떻게 흔드는지에 대한 가장 구체적 야간 리드입니다. 용량보다 대역폭, 그리고 메모리 계층을 전제로 한 코디자인 경쟁으로 프레임이 이동합니다.