SupraLabs가 1억 파라미터 텍스트-이미지 모델을 공개했다.
- Supra2-IMG는 1억 파라미터 규모의 DiT 텍스트-이미지 모델로 소개됐다.
- 제작 측은 단일 H100에서 10시간 미만 학습과 256×256 이미지 생성을 주장했다.
- 도입 평가는 샘플 외에 라이선스·재현성·데이터 고지·안전성 확인을 포함할 필요가 있다.
발췌에 따르면 SupraLabs는 1억 파라미터 규모의 텍스트-이미지 모델 Supra2-IMG를 공개했다. 제작 측은 이 모델이 단일 H100 GPU에서 10시간 미만으로 처음부터 학습됐고, 256×256 해상도에서 최첨단 수준의 이미지를 생성할 수 있다고 설명했다. 제시된 샘플은 동일한 시드·스텝·CFG 설정으로 생성됐으며 선별된 결과가 아니라고 주장한다.
DiT는 확산모델 계열의 이미지 생성에 활용되는 구조를 가리키는 용어다. 상대적으로 작은 모델과 짧은 학습 시간은 연구·프로토타이핑 환경에서 관심을 끌 수 있지만, 모델 품질은 프롬프트 범위, 데이터 구성, 평가 방식, 안전장치, 추론 조건에 따라 달라질 수 있다.
생성형 AI를 검토하는 개발팀은 파라미터 수나 샘플 이미지뿐 아니라 실제 업무 프롬프트에서의 재현성, 추론 비용, 라이선스, 학습데이터 관련 고지, 유해 콘텐츠 대응 수준을 함께 확인할 필요가 있다. 디자인·마케팅·문서 제작 등에 활용한다면 결과물의 저작권·상표·초상 관련 위험과 사람의 검수 절차도 별도 운영 이슈가 된다.
발췌에는 모델 가중치의 공개 여부, 라이선스, 벤치마크 비교, 학습데이터 및 독립 평가 결과가 제시되지 않는다. ‘최첨단 수준’이라는 성능 평가는 원문 저장소나 기술문서, 제3자 재현 결과를 통해 확인할 필요가 있다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 수치·날짜·조문 등 세부 사실은 원문에서 확인하세요.
Supra2-IMG텍스트-이미지확산모델DiTH100
원문 출처
원문 읽기 Reddit r/LocalLLaMA