퀄컴 차세대 헥사곤 NPU 공개: 에이전틱 AI 상시 구동 최적화 분석

퀄컴이 에이전틱 인공지능(AI)의 상시 구동을 실현하기 위해 차세대 헥사곤 NPU를 공개하며 모바일 온디바이스 AI 시장의 패러다임 전환을 예고했습니다. 이번 신형 헥사곤은 트랜스포머 연산에 특화된 엘리먼트 가속기와 50% 확장된 공유 메모리, 그리고 전문가 혼합(MoE) 아키텍처를 도입하여 모바일 기기에서의 자율적 추론 능력을 극대화한 것이 특징입니다.

퀄컴 헥사곤 NPU

※ AI로 생성된 이미지입니다

1. 하드웨어 아키텍처 혁신: 엘리먼트 가속기와 공유 메모리

신경망처리장치(NPU) 내부 구조의 변화는 생성형 AI 및 에이전틱 AI의 성능을 좌우하는 핵심 요소입니다. 퀄컴은 트랜스포머 알고리즘 처리를 돕는 엘리먼트 가속기(Element Accelerator)를 새롭게 탑재했습니다. 트랜스포머는 데이터 사이의 관계를 파악하는 신경망으로, 대규모 언어 모델(LLM)의 뼈대를 형성합니다.

엘리먼트 가속기는 헥사곤 내부에 존재하는 스칼라, 벡터, 매트릭스 확장 연산기와 긴밀하게 맞물려 작동합니다. 이를 통해 모바일 환경에서 전력 소모를 제어하는 동시에 대형 모델의 연산 속도를 끌어올립니다. 참고자료: [Qualcomm 공식 뉴스룸]

확장된 공유 메모리로 데이터 병목 현상 완화

헥사곤 내부의 공유 메모리 용량이 기존 대비 50% 늘어났습니다. 처리장치 내부에서 대화 맥락과 중간 계산 결과를 직접 보관하므로, 외부 D램과 데이터를 주고받는 횟수가 대폭 줄어듭니다.

“`json

{

“hexagon_npu”: {

“shared_memory”: “+50%”,

“architecture”: “MoE”,

“max_model_size”: “30B”

}

}

“`

데이터 전송 지연이 줄어들면서 AI가 유지하는 대화의 맥락은 한층 길어졌고, 앱 간 작업 전환 속도도 빨라졌다고 전문가들은 평가합니다. D램 접근 빈도가 낮아지면서 전력 효율성 측면에서도 긍정적인 효과를 거두고 있습니다.

퀄컴 차세대 헥사곤 NPU 공개, 에이전틱 AI 상시 구동 최적화 분석

※ AI로 생성된 이미지입니다

2. MoE 모델 적용과 데이터 정밀도 지원 확대

기존의 밀집 모델 방식에서 벗어나, 작업 성격에 맞는 특화 모델을 연결하는 전문가 혼합(MoE: Mixture-of-Experts) 아키텍처가 도입되었습니다. 신형 헥사곤은 최대 300억 개(30B) 매개변수를 지닌 MoE 모델을 구동할 수 있으며, 토큰 생성 시에는 약 30억 개(3B)의 매개변수만 활성화하여 연산을 수행합니다.

낸드 캐싱과 정밀도 규격 다변화

낸드 플래시 기반 지능형 관리 기법은 필요한 특화 모델만 실시간으로 D램에 올리고, 자주 쓰이는 하위 파라미터는 캐시 메모리에 남겨둡니다. 이 과정은 메모리 대역폭이 제한된 환경에서도 대형 모델 수준의 성능을 내도록 돕습니다.

지원하는 데이터 정밀도 역시 FP16, INT2, INT4, INT8, FP8 등으로 다양합니다. 특히 INT4 환경에서는 프리필 속도가 최대 50% 빨라졌으며, 디코딩 처리량과 추측 디코딩 성능이 개선되어 1.5초 이내에 답변 출력이 시작되는 반응 속도를 보여줍니다.

결론 및 주의사항

퀄컴의 차세대 헥사곤 NPU는 모바일 기기에서 에이전틱 AI를 상시 구동하기 위한 기술적 토대를 마련했습니다. 다만, 실제 디바이스 탑재 환경이나 구체적인 소프트웨어 최적화 수준에 따라 체감 성능은 달라질 수 있으므로 향후 출시되는 실물 기기의 벤치마크 결과를 지속해서 확인해야 합니다.

더 많은 심층 분석이 궁금하다면 구독하고, 의견은 댓글로 남겨주세요!

자주 묻는 질문

신형 헥사곤 NPU가 지원하는 최대 모델 크기는 어느 정도인가요?

최대 300억 개(30B) 매개변수를 가진 MoE 모델 구동을 지원하며, 실제 토큰 생성 시에는 약 3B 규모의 파라미터를 활성화합니다.

엘리먼트 가속기는 어떤 역할을 수행하나요?

트랜스포머 알고리즘 연산에 특화되어 대규모 언어 모델의 연산 속도를 높이고 모바일 전력 효율을 유지하는 역할을 맡습니다.

다른 중앙처리장치와의 협업 구조는 어떻게 이루어지나요?

오라이온(Oryon) 코어 기반 CPU가 AI 작업 흐름을 조율하고 NPU에 데이터를 공급하며, 아드레노 GPU는 뉴럴 퓨전 기능을 통해 그래픽 처리에 AI를 즉각 연계합니다.

Similar Posts

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다