Ling-3.0-flash-VL, 124B 파라미터·1M 컨텍스트의 이미지·영상 이해 모델 공개
원문 보기 · Reddit r/LocalLLaMAInclusionAI가 124B 파라미터 규모에 최대 1M 토큰 컨텍스트를 지원하는 이미지·영상 이해 모델 Ling-3.0-flash-VL을 공개했다. 토큰당 활성 파라미터는 5.5B로 효율성을 강조한 구조다.
Reddit r/LocalLLaMA에 게시된 내용에 따르면 Ling-3.0-flash-VL은 기존 언어 모델 Ling-3.0-flash의 추론·장문맥 능력을 이어받으면서 네이티브 이미지·영상 이해 기능을 추가했다. 전체 파라미터는 124B이나 토큰당 활성화되는 파라미터는 5.5B로, MoE(전문가 혼합) 구조를 채택한 것으로 추정되며 최대 1M 토큰 컨텍스트 창을 지원한다.
비전 인코더(ViT)가 이미지·영상에서 특징을 추출하고, 2계층 MLP 프로젝터가 이를 텍스트 표현과 정렬하는 방식은 최근 오픈소스 멀티모달 모델들이 공통적으로 채택하는 구조다. 대형 컨텍스트 창과 결합해 에이전틱 워크플로우나 실제 환경 추론에 시각 정보를 통합하려는 설계 방향이 뚜렷하다.
문서·영상 기반 대량 정보 처리가 필요한 법률·회계 실무에서는 초장문 컨텍스트를 지원하는 멀티모달 모델이 계약서 이미지, 영상 증거자료 등을 한 번에 분석하는 데 활용될 잠재력이 있다. 다만 실제 정확도, 환각 여부, 상업적 라이선스 조건은 별도로 검증해야 한다.
벤치마크 성능, 라이선스 조건, 실제 활성 파라미터 구조(MoE 여부 등) 세부 사항은 발췌만으로는 확인되지 않아 원문 및 기술보고서 확인이 필요하다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 원문 전체를 옮긴 것이 아니므로 수치·날짜·조문 등 세부 사실은 위 원문 링크에서 확인하세요. 개별 사안에 대한 법률·세무·노무·회계·의료 자문을 대체하지 않습니다.
기술·AI 실무를 강의로 이어서 학습하세요
읽은 주제를 실무 절차로 옮기는 과정은 전문가 강의에서 다룹니다. 분야별 커리큘럼과 수강 현황을 강의 페이지에서 확인할 수 있습니다.

