지식 피드로 돌아가기
뉴스기술·AI

러시아 GigaChat, CISPO 훈련 후 온폴리시 증류한 432B-A28B 추론 모델 GigaChat-3.5 공개

원문 보기 · Reddit r/LocalLLaMA

러시아 GigaChat 팀이 CISPO 방식으로 훈련한 전문가 모델들을 온폴리시 증류해 하나로 합친 432B-A28B 규모의 추론 모델 GigaChat-3.5 Reasoning을 공개했다. 긴 문맥 처리에 효율적인 Gated DeltaNet을 적용했고, 자체 평가에서 추론 토큰을 37% 줄이면서도 DeepSeek V4 Flash Preview에 근접한 성능을 보였다고 밝혔다.

GigaChat 팀은 코드, 수학, 일반 대화 등 도메인별 전문가 모델을 CISPO로 각각 훈련한 뒤, 이를 온폴리시 증류(on-policy distillation) 기법으로 단일 모델에 결합했다고 설명한다. 결과물인 GigaChat-3.5 Reasoning은 432B 파라미터 중 28B만 활성화되는 MoE 구조에 긴 문맥 효율을 높이는 Gated DeltaNet을 결합했다.

온폴리시 증류와 CISPO는 최근 추론 특화 대형 모델들이 채택하는 훈련 기법의 흐름과 맞닿아 있다. 여러 전문가를 따로 훈련한 뒤 하나로 합치는 방식은 학습 효율과 각 도메인 성능을 동시에 확보하려는 시도로 볼 수 있다.

실무적으로는 추론 과정에서 토큰 소비를 줄였다는 점이 눈에 띈다. 추론형 모델은 답변 도출 전 긴 사고 과정을 생성하는 경우가 많아 비용·지연시간에 직접 영향을 주는데, 토큰 37% 절감은 API 사용 비용이나 응답 속도 측면에서 실무 적용 시 체감될 수 있는 변화다. 다만 이는 자체 평가 결과이며 제3자 벤치마크는 발췌에 나타나 있지 않다.

가중치가 Hugging Face에 MIT 라이선스로 공개돼 있어 상업적 활용이 상대적으로 자유로운 편으로 보이나, 실제 라이선스 조건 전문과 성능 재현 여부는 원문·저장소 확인이 필요하다.

본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 원문 전체를 옮긴 것이 아니므로 수치·날짜·조문 등 세부 사실은 위 원문 링크에서 확인하세요. 개별 사안에 대한 법률·세무·노무·회계·의료 자문을 대체하지 않습니다.

관련 강의

기술·AI 실무를 강의로 이어서 학습하세요

읽은 주제를 실무 절차로 옮기는 과정은 전문가 강의에서 다룹니다. 분야별 커리큘럼과 수강 현황을 강의 페이지에서 확인할 수 있습니다.

강의 보러 가기