Baseten, 허깅페이스·Goodfire AI와 오픈웨이트 모델 안전성 평가 인프라 구축 발표
원문 보기 · Reddit r/LocalLLaMAAI 인프라 기업 Baseten이 허깅페이스, Goodfire AI와 함께 오픈웨이트 모델의 안전성 평가·모니터링 인프라를 구축한다고 발표했다. 안전장치를 제거한 '어블리테이션(abliteration)' 모델이 허깅페이스에 6000개 이상 등록돼 있다는 문제의식이 배경이다.
발췌에 따르면 Baseten이 수요일 자사 연구 조직 Base Labs와 함께 새로운 안전 인프라 표준을 발표했고, 허깅페이스 및 Goodfire AI와 협력해 오픈웨이트 모델을 위한 안전성 평가·모니터링 인프라를 구축한다고 밝혔다. 이는 오픈웨이트 모델의 안전성 논쟁이 커지는 가운데 나온 발표다.
'어블리테이션'은 오픈웨이트 모델에 내장된 안전장치(가드레일)를 제거해 유해하거나 제한된 답변까지 생성하게 만드는 기법으로, 모델 가중치가 공개돼 있다는 오픈웨이트 모델의 특성상 누구나 이런 변형을 만들어 배포할 수 있다는 점이 문제로 지적된다. 발췌에 따르면 허깅페이스에는 이미 6000개 이상의 어블리테이션 모델이 등록돼 있어 문제의 규모가 상당하다는 점이 강조된다.
AI 서비스를 오픈웨이트 모델 기반으로 구축하는 기업의 실무자는 향후 이러한 안전성 평가·모니터링 인프라가 모델 선택이나 배포 심사 기준으로 자리잡을 가능성을 염두에 두고 자사 모델 소싱 정책을 점검할 필요가 있다. 특히 규제기관이나 플랫폼 사업자가 어블리테이션 모델의 유통을 제한하는 방향으로 정책을 강화할 경우, 이를 활용한 서비스의 법적·평판 리스크도 함께 검토해야 한다.
이 인프라가 구체적으로 어떤 평가 기준과 모니터링 방식을 적용하는지, 허깅페이스가 실제로 어블리테이션 모델 등재에 제한을 가할 계획인지는 발췌만으로 확인되지 않으며 원문 확인이 필요하다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 원문 전체를 옮긴 것이 아니므로 수치·날짜·조문 등 세부 사실은 위 원문 링크에서 확인하세요. 개별 사안에 대한 법률·세무·노무·회계·의료 자문을 대체하지 않습니다.
법률 실무를 강의로 이어서 학습하세요
읽은 주제를 실무 절차로 옮기는 과정은 전문가 강의에서 다룹니다. 분야별 커리큘럼과 수강 현황을 강의 페이지에서 확인할 수 있습니다.

