지식 피드로 돌아가기
뉴스기술·AI

llama.cpp에 삼진(ternary) MoE 아키텍처 'Maple 20B-A1B' 추가

원문 보기 · Reddit r/LocalLLaMA

llama.cpp 프로젝트에 삼진(ternary) 가중치 기반의 MoE(전문가 혼합) 아키텍처 모델 'Maple 20B-A1B'가 추가됐다. 저용량 VRAM 환경에서 대형 모델급 성능을 노리는 시도로 커뮤니티의 관심을 받고 있다.

deepgrove가 공개한 Maple-preview 모델이 llama.cpp에 지원 아키텍처로 추가된 것으로, 전체 20B 파라미터 중 실제 활성화되는 파라미터가 1B 수준인 MoE 구조를 채택했다. 게시자는 이 구조가 VRAM이 적은 환경에서 유리할 수 있다는 기대를 언급했다.

삼진 가중치(ternary weight)는 파라미터 값을 -1, 0, 1 등 극소수 값으로 제한해 메모리 사용량과 연산량을 크게 줄이는 양자화 방식이며, MoE는 입력마다 일부 전문가 서브네트워크만 활성화해 전체 파라미터 대비 실제 연산량을 낮추는 구조다. 두 기법의 결합은 대형 모델을 저사양 하드웨어에서 구동하려는 연구 흐름의 연장선에 있다.

제한된 GPU 자원으로 로컬 AI 인프라를 운영하는 조직이나 개인에게는 하드웨어 투자 없이 더 큰 모델을 시험해볼 수 있는 선택지가 늘어나는 것을 의미한다. 다만 아직 preview 단계이므로 실제 정확도나 안정성은 정식 검증을 거쳐야 한다.

정식 릴리스 시점, 실제 VRAM 요구량, 그리고 기존 MoE·양자화 모델과의 성능 비교 결과를 확인할 필요가 있다.

본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 원문 전체를 옮긴 것이 아니므로 수치·날짜·조문 등 세부 사실은 위 원문 링크에서 확인하세요. 개별 사안에 대한 법률·세무·노무·회계·의료 자문을 대체하지 않습니다.

관련 강의

기술·AI 실무를 강의로 이어서 학습하세요

읽은 주제를 실무 절차로 옮기는 과정은 전문가 강의에서 다룹니다. 분야별 커리큘럼과 수강 현황을 강의 페이지에서 확인할 수 있습니다.

강의 보러 가기