Techday
‘분리형 추론’ 키워드 기사 1
    image

    노타, GPU·NPU 분산 추론으로 AI PC LLM 효율 개선

    노타가 AI PC에서 GPU와 NPU를 함께 활용해 대규모언어모델(LLM) 추론 효율을 높이는 기술을 구현했다. 인텔 루나 레이크 기반 AI PC에서 입력 처리와 답변 생성 단계를 나눠 각각 GPU와 NPU에 배치하는 방식이다. 회사 측은 단일 GPU 실행 대비 토큰당…

    2026.06.04 by 명세환 기자