퀄컴 차세대 헥사곤 NPU 공개: 에이전틱 AI 상시 구동 최적화 분석
퀄컴이 에이전틱 인공지능(AI)의 상시 구동을 실현하기 위해 차세대 헥사곤 NPU를 공개하며 모바일 온디바이스 AI 시장의 패러다임 전환을 예고했습니다. 이번 신형 헥사곤은 트랜스포머 연산에 특화된 엘리먼트 가속기와 50% 확장된 공유 메모리, 그리고 전문가 혼합(MoE) 아키텍처를 도입하여 모바일 기기에서의 자율적 추론 능력을 극대화한 것이 특징입니다.

※ AI로 생성된 이미지입니다
1. 하드웨어 아키텍처 혁신: 엘리먼트 가속기와 공유 메모리
신경망처리장치(NPU) 내부 구조의 변화는 생성형 AI 및 에이전틱 AI의 성능을 좌우하는 핵심 요소입니다. 퀄컴은 트랜스포머 알고리즘 처리를 돕는 엘리먼트 가속기(Element Accelerator)를 새롭게 탑재했습니다. 트랜스포머는 데이터 사이의 관계를 파악하는 신경망으로, 대규모 언어 모델(LLM)의 뼈대를 형성합니다.
엘리먼트 가속기는 헥사곤 내부에 존재하는 스칼라, 벡터, 매트릭스 확장 연산기와 긴밀하게 맞물려 작동합니다. 이를 통해 모바일 환경에서 전력 소모를 제어하는 동시에 대형 모델의 연산 속도를 끌어올립니다. 참고자료: [Qualcomm 공식 뉴스룸]
확장된 공유 메모리로 데이터 병목 현상 완화
헥사곤 내부의 공유 메모리 용량이 기존 대비 50% 늘어났습니다. 처리장치 내부에서 대화 맥락과 중간 계산 결과를 직접 보관하므로, 외부 D램과 데이터를 주고받는 횟수가 대폭 줄어듭니다.
“`json
{
“hexagon_npu”: {
“shared_memory”: “+50%”,
“architecture”: “MoE”,
“max_model_size”: “30B”
}
}
“`
데이터 전송 지연이 줄어들면서 AI가 유지하는 대화의 맥락은 한층 길어졌고, 앱 간 작업 전환 속도도 빨라졌다고 전문가들은 평가합니다. D램 접근 빈도가 낮아지면서 전력 효율성 측면에서도 긍정적인 효과를 거두고 있습니다.

※ AI로 생성된 이미지입니다
2. MoE 모델 적용과 데이터 정밀도 지원 확대
기존의 밀집 모델 방식에서 벗어나, 작업 성격에 맞는 특화 모델을 연결하는 전문가 혼합(MoE: Mixture-of-Experts) 아키텍처가 도입되었습니다. 신형 헥사곤은 최대 300억 개(30B) 매개변수를 지닌 MoE 모델을 구동할 수 있으며, 토큰 생성 시에는 약 30억 개(3B)의 매개변수만 활성화하여 연산을 수행합니다.
낸드 캐싱과 정밀도 규격 다변화
낸드 플래시 기반 지능형 관리 기법은 필요한 특화 모델만 실시간으로 D램에 올리고, 자주 쓰이는 하위 파라미터는 캐시 메모리에 남겨둡니다. 이 과정은 메모리 대역폭이 제한된 환경에서도 대형 모델 수준의 성능을 내도록 돕습니다.
지원하는 데이터 정밀도 역시 FP16, INT2, INT4, INT8, FP8 등으로 다양합니다. 특히 INT4 환경에서는 프리필 속도가 최대 50% 빨라졌으며, 디코딩 처리량과 추측 디코딩 성능이 개선되어 1.5초 이내에 답변 출력이 시작되는 반응 속도를 보여줍니다.
결론 및 주의사항
퀄컴의 차세대 헥사곤 NPU는 모바일 기기에서 에이전틱 AI를 상시 구동하기 위한 기술적 토대를 마련했습니다. 다만, 실제 디바이스 탑재 환경이나 구체적인 소프트웨어 최적화 수준에 따라 체감 성능은 달라질 수 있으므로 향후 출시되는 실물 기기의 벤치마크 결과를 지속해서 확인해야 합니다.
더 많은 심층 분석이 궁금하다면 구독하고, 의견은 댓글로 남겨주세요!
