UkisAI, Qwen3.8-27B 경량화해 사고 토큰 58% 감소·속도 1.95배 달성
원문 보기 · Reddit r/LocalLLaMAAI 스타트업 UkisAI가 Qwen3.8-27B 모델을 후처리 학습해 추론(사고) 토큰을 58% 줄이고 속도를 1.95배 높이면서도 정확도 손실은 1% 미만으로 유지한 'Swift-Qwen3.8-27b'를 오픈소스로 공개했다. 추론 비용 절감 기법으로서 실무적 관심을 끌 만한 결과다.
UkisAI는 과도한 추론(overthinking)에 관련된 토큰을 식별해 이를 직접 억제하지 않고 페널티를 부여하는 방식으로 모델을 재학습했다고 밝혔다. 이후 온폴리시 증류(On-Policy Distillation) 기법으로 정확도를 보완해 사고 토큰 58% 감소, 속도 1.95배 향상, 정확도 손실 1% 미만이라는 결과를 얻었다고 설명한다.
최근 LLM 업계에서는 '추론 모델'이 답변 전에 긴 사고 과정을 생성하면서 정확도는 높이지만 응답 시간과 연산 비용이 크게 늘어나는 문제가 지적되어 왔다. 이에 따라 추론 길이를 줄이면서 성능을 유지하는 경량화·효율화 기법이 여러 연구·기업에서 시도되고 있다.
대량의 LLM 추론을 운영하는 조직에서는 동일한 하드웨어로 더 많은 요청을 처리하거나 응답 지연을 줄일 수 있어 인프라 비용 절감에 직접적으로 연결될 수 있는 기법이다. 다만 회사가 자체 발표한 수치이므로 독립적인 재현 검증과 자사 업무 데이터 기준의 벤치마크가 필요하다.
무료 연구용 API 제공 조건, 상업적 라이선스 여부, 그리고 제3자의 독립적 성능 재현 결과를 추가로 확인할 필요가 있다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 원문 전체를 옮긴 것이 아니므로 수치·날짜·조문 등 세부 사실은 위 원문 링크에서 확인하세요. 개별 사안에 대한 법률·세무·노무·회계·의료 자문을 대체하지 않습니다.
기술·AI 실무를 강의로 이어서 학습하세요
읽은 주제를 실무 절차로 옮기는 과정은 전문가 강의에서 다룹니다. 분야별 커리큘럼과 수강 현황을 강의 페이지에서 확인할 수 있습니다.

