국제법 텍스트용 개체명 인식 데이터셋·벤치마크 IntLawNER를 제안했다.
- IntLawNER는 국제법 성문화 자료를 위한 NER 데이터셋과 벤치마크다.
- ICJ 결정·유엔 안보리 결의·ECtHR 판결에서 2,987개 문장과 8,094개 개체 구간을 주석했다.
- 실무 적용 전에는 주석 기준, 언어·라이선스, 유형별 성능을 원문으로 검증할 필요가 있다.
발췌에 따르면 IntLawNER는 국제법 텍스트를 위한 토큰 수준 개체명 인식(NER) 데이터셋 및 벤치마크다. 국제사법재판소(ICJ) 결정, 유엔 안전보장이사회 결의, 유럽인권재판소(ECtHR) 판결에서 금표준으로 주석된 2,987개 문장과 8,094개 개체 구간을 포함한다고 설명한다. 발췌는 7개 개체 유형이 있다고 밝히지만, 각 유형의 구체적 내용은 제시하지 않는다.
NER는 문서에서 기관명, 인명, 장소, 법규범 또는 사건 관련 표현처럼 의미 있는 명칭 단위를 식별·분류하는 자연어 처리 기법이다. 법률 문서에서는 이러한 구조화가 방대한 원문에서 관련 주체·문서·규범을 찾고, 인용 관계나 사건 정보를 정리하는 기초 단계로 활용될 수 있다. 다만 이 연구가 실제 법률 실무에서의 정확성이나 적용 가능성을 입증했는지는 발췌만으로 확인되지 않는다.
국제법 리서치, 번역, 지식관리, 문서 검토 도구를 구축하거나 평가하는 실무자에게는 도메인 특화 평가 자원이 생긴다는 의미가 있다. 일반 언어 모델 또는 일반 NER 도구의 결과를 국제법 텍스트에 그대로 신뢰하기보다, 해당 분야 자료에서 어떤 개체를 얼마나 안정적으로 식별하는지 검증하는 기준으로 활용할 여지가 있다. 자동 추출 결과는 원문 및 법률전문가 검토를 대체하지 않는다는 전제가 필요하다.
데이터셋의 라이선스, 공개 범위, 언어 구성, 세부 주석 지침, 학습·평가 분할 방식과 기준 모델 성능은 논문 원문에서 확인할 필요가 있다. 특히 판결·결의의 출처별 및 개체 유형별 성능 편차가 있는지 확인해야 실제 도입 가능성을 판단할 수 있다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 수치·날짜·조문 등 세부 사실은 원문에서 확인하세요.
arXiv