실제 작업 · 상대 생산성

벤치마크는 안 합니다.
일을 시킵니다.

현재 FGM (Frontier Gatekeeper Model)은 GLM 5.3 입니다.
더 비싸면 더 빨라야 하고, 더 느리면 더 저렴해야 한다.

비용 × 생산성

FGM Map - 쉬운 문제

FGM Map
비용 × 생산성

FGM Map - 어려운 문제

측정 대기
최근 실험

Co2 실제 작업

자동 판정 결과 · 시간 패널티 반영

PASSFAILTIMEOUT
CO2 실제 작업

과제별 상세 기록

FAIL·TIMEOUT 시간에 1.5배를 적용해 첫 낙폭 비율을 구한 뒤, 그 비율을 실패·시간 초과 횟수만큼 반복합니다. 비용은 그대로입니다.

측정 근거와 제한
  • 모델별 과제당 1회 수행한 결과입니다. 이 작업들 밖의 보편적 모델 우열로 해석하지 않습니다.
  • 일부 GLM·Flash 실행에는 Claude 서브에이전트 호출이 포함되어 있습니다. 시간 비교는 이 실행 구성을 포함합니다.
  • Co2 위키는 MiMo의 자율 완주를 GLM Flash 아래인 5등급으로 잠정 판정했습니다. 이 정성 평가는 시간 비교와 별개입니다.
  • REG-1은 세 모델 모두 원 커밋 재생 가능성이 표시되었습니다. 순수 구현력의 증거로 해석하지 않습니다.
  • GLM Flash의 REG-3은 자동 채점 PASS였지만 커밋 계약 위반으로 평가상 FAIL입니다. MiMo의 TIMEOUT 2건은 테스트 노드는 통과했지만 커밋 없이 종료됐습니다.
  • MiMo FIX-2의 INFRA 1건은 자식 프로세스 종료 오류였고, 표에는 뒤이은 정상 실행 1건만 사용했습니다.
  • Co2 위키의 MiMo 합계 377분과 원본 5개 실행 합계 285.79분이 달라, 시간 비교에는 원본 실행 합계를 사용했습니다.

테스트 케이스

실제 테스트 케이스

쉬운 문제

어려운 문제

평가 방식

실제 작업.
실패에는 시간 패널티.

01

같은 실제 작업

02

실패 횟수만큼 패널티 반복

03

사람 개입 없이 자동 실행

04

GLM Index = GLM 총시간 ÷ 패널티 적용 총시간

서사

벤치마크 점수는 좋던데 왜이래?

그래서 만들었습니다.

NoBench Analysis는 벤치마크 점수 대신 실제 게임 개발 작업에서 모델이 낸 결과·시간·비용을 비교합니다.