기술·AI2026.09.27Reddit r/LocalLLaMA

Nonobench v1.2에서 공개 가중치 모델은 20×20 고난도 문제를 풀지 못했다.

  • 고난도 비노그램에서는 주요 공개 가중치 모델이 한계를 보였다는 비공식 평가 결과가 공유됐다.
  • 긴 답안의 문자 수·형식 오류 자체가 벤치마크 결과에 영향을 줄 수 있다.
  • 정확성이 중요한 실무 적용에서는 모델 답변과 별도의 검증 절차를 함께 설계할 필요가 있다.

게시물은 비노그램 논리 퍼즐을 이용해 다수 LLM을 비교한 Nonobench v1.2 결과를 소개한다. 작성자는 실행별 추론 노력(reasoning effort)을 명시하고 모든 프롬프트와 출력을 공개했다고 설명했으며, 15×15 퍼즐에서는 GPT-6 Astra가 30문제 중 30문제를 맞힌 첫 완벽 실행이었다고 주장했다.

비노그램은 행·열의 숫자 단서를 바탕으로 격자를 채우는 제약충족형 퍼즐이다. 이 유형은 단순한 언어 생성보다 다단계 추론, 상태 유지, 좌표·개수의 정확한 처리와 최종 답안 형식 준수를 함께 요구하므로, LLM의 추론 능력을 측정하는 비공식 벤치마크로 활용될 수 있다. 게시물은 긴 단일 문자열 답안에서 문자 수를 잘못 세는 문제가 여러 모델에서 나타나 하드 모드 답안을 행별 형식으로 바꿨다고도 설명한다.

로컬 모델을 업무 자동화나 분석 보조에 쓰는 개발·운영 담당자에게는 ‘공개 가중치 모델이 특정 논리 과제를 해결한다’는 주장만으로 복잡한 검증 업무를 맡기기 어렵다는 시사점이 있다. 특히 표·숫자·규칙 기반 결과물은 정답 검증기, 구조화된 출력 제약, 사람의 검토 절차를 함께 두는지 점검할 필요가 있다. 모델 비교 시에는 평균 점수뿐 아니라 답안 형식 오류와 재현 가능한 실행 설정도 성능 판단에 포함될 수 있다.

발췌문상 최고 공개 가중치 모델로 DeepSeek V4 Pro의 83%라는 일부 결과만 확인된다. 20×20 문제의 구성, 표본 수, 채점 기준, 추론 예산 및 모델별 설정은 원문과 연결된 공개 자료를 통해 확인하는 것이 필요하다.

본문은 수집한 기사의 제목과 발췌를 바탕으로 AI가 정리한 해설입니다. 수치·날짜·조문 등 세부 사실은 원문에서 확인하세요.

Nonobench비노그램공개 가중치 모델추론 평가출력 검증
원문 출처

Reddit r/LocalLLaMA

원문 읽기

이어서 읽기

기술·AI뉴스2026.09.27

구글이 인도에서 Gemini·AI Mode 기반 Flipkart 구매를 시험한다.

기술·AI인사이트2026.09.27

llama.cpp 프롬프트 조회 초안 작업을 42배 가속했다는 사례가 공유됐다.

기술·AI뉴스2026.09.27

연구자는 OpenAI 에이전트가 UN 통계 사이트를 1만6000회 이상 스캔했다고 밝혔다.

기술·AI뉴스2026.09.27

트럼프 대통령과 앤트로픽 CEO가 백악관에서 비공개 만찬을 연다.