오픈소스 Kev 4B와 Jev를 동일 환경에서 비교 평가했다.
- Kev 4B와 Jev의 자체 비교에서 전반적 정확도 차이는 표본상 뚜렷하지 않았다고 제시됐다.
- Jev는 패러프레이즈 탐지와 보정에서 우세하다고 보고됐지만, 독립 검증 여부는 확인되지 않는다.
- 동일 정가라도 입력 토큰 계수 차이는 실제 이용비와 컨텍스트 운영에 영향을 줄 수 있다.
발췌에 따르면 작성자는 Qwen3.5-4B를 기반으로 한 Apache-2.0 파인튜닝 모델인 Kev 4B와 Jev를 같은 엔드포인트에서 나란히 실행했다. 두 모델 출시 이후 공개된 arXiv 논문, Stack Exchange 질문, GitHub 이슈 등 362개 항목을 새 평가 세트로 구성하고, 출처의 답변을 기준 답으로 사용했다고 한다. 과제별 정확도 차이는 모두 2포인트 이내였고, 표본 규모에서는 잡음 범위라는 평가가 제시됐다.
모델 비교에서 동일한 실행 환경과 비교적 최근의 외부 자료를 사용하려는 시도는 모델의 최신성 및 실사용 질의 대응력을 살펴보려는 접근으로 볼 수 있다. 다만 출처 답변이 항상 유일한 정답인지, 질문 형식과 채점 방식이 무엇인지에 따라 결과가 크게 달라질 수 있다. 특히 Reddit 게시물의 자체 평가이므로 독립 검증이나 통계적 유의성은 발췌만으로 확인되지 않는다.
실무자는 단순 정확도 평균 외에 비용 산정 방식과 출력의 신뢰도 표현을 함께 볼 필요가 있다. 발췌에서 Jev는 더 나은 보정과 PAWS 패러프레이즈 탐지 87.0%, Kev의 74.5%라는 결과를 보였지만, 그 결과가 계약서·의무기록·세무 문서처럼 전문 문서의 의미 동일성 판단에 그대로 적용된다고 볼 수는 없다. 또한 같은 정가라고 해도 요청당 약 257개의 추가 입력 토큰을 계산한다는 설명은 사용량 기반 과금 환경에서 실제 비용과 컨텍스트 여유에 영향을 줄 수 있다.
모델 선정 전에는 자체 업무 데이터로 정확성, 누락·환각, 문장 유사성 판단, 응답 지연, 토큰 청구량을 재검증할 필요가 있다. 발췌는 추가 입력 토큰의 산정 기준과 전체 비교표를 제공하지 않으므로, 원문 및 제공자의 과금·토큰 계수 정책을 확인해야 한다. 오픈소스 모델의 경우에는 라이선스뿐 아니라 호스팅 방식, 데이터 전송 경로, 로그 보관 조건도 별도 검토 대상이다.
본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 수치·날짜·조문 등 세부 사실은 원문에서 확인하세요.
Reddit r/LocalLLaMA