채점자 교란: 채점 기구를 바꾸면, 측정된 순위가 뒤집힐 수 있다
스스로 도구를 부르는 에이전트를 평가하는 하네스를 돌리거나 그 평가가 좌우하는 승격과 티어 라우팅 결정을 책임지는 국내 클라우드·AI 엔지니어라면 이 글이 대상입니다. 승패를 가르는 채점자는 무료 관측이 아니라 값을 가진 측정 기구입니다. 기구를 바꾸면, 그 기구가 재는 순위가 뒤집힐 수 있습니다. ThakiCloud의 자체 H200 클러스터에서 나온 이번 논문이 그 뒤집힘을 법칙으로 닫습니다. 법칙은 같은 800건의 도구호출 과제에서 채점 방식을 바꾸면 순위가 얼마나 움직이는지와 대가가 몇 토큰인지 답하는 것입니다.
쉽게 말하면: 몸무게를 재는 저울
두 사람이 저울에 올라갔는데 둘 다 150킬로그램이 찍힌다면, 몸무게가 같은 겁니까? 아닐 수도 있습니다. 저울의 최대 표시가 150킬로그램이라면, 두 읽힘은 저울의 서명입니다. 몸무게가 아닙니다. 이 논문이 묻는 것은, 에이전트 평가를 재는 채점자(grader)에 대한 같은 질문입니다. 채점자는 저울입니다. 측정된 순위는 저울의 눈금입니다. 저울을 바꾸면 진짜 몸무게가 안 바뀐데도 눈금이 바뀝니다. 논문의 일은, 무료인 집안 저울을 유료인 실험실 저울로 바꿀 때 언제 안전한지와 가격 차이가 얼마인지 알려 주는 것입니다. 집안 저울은 결정론적 채점입니다. 실험실 저울은 LLM 판정자(judge)입니다. 채점자는 여기에서 한 가지를 더 지닙니다. 값입니다. 이 논문은 그 값을 함께 잽니다.

문제의식: 포화한 눈금은 순위를 숨기고, 결정을 내린 기구는 무료였다
ThakiCloud의 자체 H200 시리즈는 LLM 판정자 없이 실행으로 검증하는 채점 아래, 에이전트 도구호출 arm을 재고 있습니다. arm은 모델, 정밀도, 샘플링 구성의 후보 설정입니다. 시리즈의 800개 도구호출 벤치마크에서는 모든 출력이 판정 모델 없이 코드(AST) 매칭으로 기준 답에 대해 채점됩니다.
생산 27B 체크포인트(NVFP4 양자화)는 800건 중 717건, 곧 89.6%를 기록합니다. 이 행은 시리즈의 앵커입니다. 같은 스택에서 arm 승격 결정은 한동안 언어 품질 검증 집합에 묶여 있었습니다. 학생 후보와 교사 후보 모두 55/55였습니다. 포화한 눈금에서는 두 후보를 구분할 수 없습니다. 승격을 풀어 준 것은 다른, 무료, 결정론적 채점자, 산문 패턴 게이트였습니다.
한 루프, 두 교훈입니다. 포화한 눈금은 순위를 숨깁니다. 승격을 결정한 채점자는 무료 결정론 기구였습니다. 질문은 여기서 자연스럽게 이어집니다. 무료 결정론 채점자가 결정을 내릴 만큼 충분했다면, 그 채점자를 유료 LLM 판정자로 바꿀 때의 안전 시점과, 순위가 뒤집히는 시점을 재는 것입니다.
채점자는 결함이 문서화된 기구로 알려져 있습니다. LLM 판정자는 위치, 산문 길이, 자기 강화 편향을 지닙니다. 판정자는 자기 모델 패밀리 출력을 선호합니다. 키워드형 결정론 하네스는 모델이 하지 않은 도구 호출도 공신으로 줍니다. 검증 가능한 text-to-SQL 워크로드에서 진행된 생산 감사에서는, 판정자와 저자 정답 기준의 합의가 거의 제로로 나왔습니다. 불일치 집중 슬라이스에서 코헨 카파는 0.04입니다.
희박한 쌍별 중복 검증 아래에서는 오답률, 즉 잘못된 결정의 비율이 25%에 달합니다. 후보 10개 중 잘못된 최고의 판정자를 고를 확률은 65%입니다. 질문은 이렇습니다. 무료 채점자가 유료 판정자의 안전 대체가 되는 시점이 언제인지, 그리고 채점을 바꿨을 때 순위가 뒤집히는 시점이 언제인지입니다.
무엇을 해봤나: 세 셀 분해와 닫힌 형태의 뒤집힘 조건
논문의 핵심 수단은 각 과제 결과를 세 셀로 분해하는 것입니다. C는 올바른 답입니다. D는 잡히는 오답, 틀렸는데 검증기가 이를 발견할 수 있는 셀입니다. S는 침묵 오답으로, 틀렸는데 표면 검사에 넘어가고 기준과의 실행으로만 잡힙니다. 골드 품질은 C 셀의 비중입니다. 각 채점자가 재는 점수는 세 셀의 통과율, α, β, γ의 가중 합입니다. 채점자 효과는 측정값과 골드의 차이, 곧 셀 가중 교란입니다. 기구가 가중을 정합니다. 후보 설정이 셀 비중을 정합니다.
뒤집힘 조건은 닫힌 형태로 나옵니다. 후보 쌍의 경우, 채점자가 재는 간격은 골드 간격 Δ에 채점자 미분 D_g를 얹은 값입니다. D_g가 음의 골드 간격 아래로 떨어질 때, 그 쌍은 정확히 뒤집힙니다. 세 가지 귀결이 이어집니다. 세 셀 비중이 같은 후보 설정은 이 형태의 어떤 채점자도 분리하지 못합니다. 순수 역량 차이, C 셀에만 있는 차이는 어떤 채점자도 뒤집지 못합니다. 채점자는 간격을 α로만 재조정합니다. 채점자에 민감한 쌍은 정확히 역량 차이가 오답 셀 D와 S에 실려 있는 쌍입니다.
판정자는 후보 설정에 의존하는 두 가지 추가 항을 지닙니다. 프롬프트 템플릿에서 오는 표면 이동 σ_T, 판정자 자기 모델 패밀리 출력에만 양이 되는 자기 선호 μ입니다. 판정자는 실행을 못 해서 γ_J가 양입니다. 잡히는 오답의 일부도 통과시킵니다. 이 둘은 판정자만의 결함입니다.
세 채점자의 셀별 통과율 개략도입니다. 행은 AST 매치, 패턴 게이트, LLM 판정자입니다. 열은 C(올바른 답), D(잡히는 오답), S(침묵 오답)입니다. 가정 A1~A3의 상대 순서만 맞췄습니다. 수치는 담지 않습니다. (분석 모델이며 실측이 아닙니다.)
세 채점자의 성질적 프로파일은 가정 A1~A3로 쓰이게 된다. 각 가정은 문서화된 행동에 기대어 있습니다. A1: AST 매치는 엄격합니다. 잔여 오류는 엄격성인 셈입니다. 올바른 답이 여러 개인 다중과 병렬 범주에 집중됩니다. A2: 패턴 게이트는 형식에 공신을 줍니다. 파싱되고 필수 키워드를 가진 근소한 오답도 통과합니다. A3: 판정자는 AST 매치가 놓친 의미 동등한 올바른 호출을 인정합니다. 다만 실행을 못 해서 침묵 오답의 일부도 통과시킵니다.

포화: 측정된 동점이면, 순서는 순수 기구 효과
가장 중요한 귀결은 포화입니다. 두 후보가 사용 중인 채점자에서 동점을 이룬다면, 어떤 다른 채점자 아래 두 후보 간 순위는 채점자 효과의 차이만으로 정해집니다. 포화한 눈금에서 채점자를 바꾸면 역량 차이가 나오지 않습니다. 기구 서명을 갈아끼우는 일입니다. 두 번째 채점자로 동점 분할이 유효하려면, 그 채점자의 셀 가중이 골드와 함께 간다는 것이 알려져 있어야 합니다. 첫 번째 채점자와 다를 것이라는 사실만으로는 부족합니다.
이 스택의 55/55는 정확히 이 레짐입니다. 승격을 결정해 준 산문 패턴 게이트는 역량 차이를 잴 수 없었습니다. 기구 서명을 갈아끼운 것입니다. 그 갈아끼우기가 유효했던 이유는 게이트의 셀 가중이 구성에 의해 검사 가능했기 때문입니다. 사람 말로는, 최대 표시에 박힌 저울에서 동점이면, 보정이 알려진 다른 저울로 갈아 끼워 가늠하는 일과 같습니다. 새 눈금은 몸무게가 아니라 저울의 서명입니다.
안전 대체 기준: 무료 채점자가 유료 판정자를 대신하는 조건
골드 셀은 잠재 변수입니다. 논문은 기준을 완전 중복 검증 슬라이스 위에서 작동화합니다. 모든 과제와 후보 설정의 쌍이 두 기구 모두에서 한 번씩 채점됩니다. 그 슬라이스 위에서 후보별 기구 변위 η는 직접 관측됩니다. 과제별 불일치율 π가 기구 변위의 상한이 됩니다. 완전한 100% 중복이 설계 점입니다. 희박 중복의 오답률 25%가 그 이유입니다.
안전 기준은 둘입니다. 게이트 안전: 최대 기구 변위가 가장 가까운 후보의 게이트 레벨 거리보다 작으면, 두 기구가 모든 후보를 게이트의 같은 편에 둡니다. 시리즈의 게이트는 0.85입니다. 인접 쌍 안전: 무료 채점자 순위에서 모든 인접 쌍의 간격이 두 후보의 기구 변위 합보다 크면, 유료 채점자의 순위는 동일합니다. 인접 후보 간 승격이 뒤집히지 않습니다.
무료 채점자의 순위에서 인접 후보 쌍별로, 실측 간격과 기구 변위 허용폭을 비교한 개념도입니다. 허용폭 아래로 간격이 벌어지지 않은 쌍이 판정자가 풀어야 할 교란 쌍(confounded pair) 집합을 이룹니다. (분석 모델이며 실측이 아닙니다.)
사람 말로는, 보장이 있는 저울 이야기입니다. 집안 저울과 실험실 저울의 눈금 차이가 사람 간 간격보다 작으면, 순서가 바뀌지 않습니다. 논문은 이 직관을 검사 가능한 부등식으로 만듭니다.

채점세: 판정자의 가격
다음은 가격입니다. K개 후보 설정을 n개 과제로 채점하려면, 생성 쪽이 n×K 토큰을 씁니다. AST 매치와 패턴 게이트는 로컬 CPU에서 돕니다. 모델 토큰은 0입니다. 전체 판정 스윕은 n×K에 판정자 1회 호출 토큰 ℓ_J를 곱해 듭니다. 판정자는 스키마, 과제, 후보 출력을 통째로 다시 읽고 나서야 판정을 내립니다. ℓ_J는 생성 토큰 ℓ_gen보다 한 수 위, 곧 한 자릿수 배가 일반적입니다. 이 수치는 실측이 아니라 10배 안팎이라는 모델링 가정으로 명시되어 있습니다. 이 비율, 기호 ρ, 가 채점세(grade tax)입니다. 전체 판정은 자신이 인증하는 평가 예산에 ρ만큼 세금을 얹습니다. K나 n에는 의존하지 않습니다.
| 논문의 정책은 이렇습니다. 교란 쌍에만 판정자를 씁니다. 중복 슬라이스 위에서 인접 쌍의 기구 변위 합을 취한 최대, 교란 밴드 b를 계산합니다. 무료 채점자 간격이 b보다 작은 인접 쌍에 속한 후보만 판정합니다. 절감률은 1-2 | P | /K입니다. | P | 는 교란 쌍의 수입니다. 간격이 b 이상인 쌍은 관측된 변위 아래에서 뒤집힐 수 없습니다. 정책은 자신이 채점하지 않는 모든 인접 순위를 보존한다는 증명을 지닙니다. b를 계산하는 오버랩 감사는 일회성 유료 스윕입니다. 절감률은 이후 매 평가 사이클에 적용됩니다. 인증서는 후보 집합이 바뀔 때 만료됩니다. 달리는 세지 않습니다. |
평가당 추가 판정 토큰을 상대 단위로 본 개념도입니다. 결정론적 채점자는 0입니다. 전체 판정 스윕은 생성 예산 대비 한 자릿수 배, 채점세 수준입니다. 교란 쌍 전용 정책은 그 사이에 위치합니다. (분석 모델이며 실측이 아닙니다.)
이 정책은 확신이 있으면 받고 없으면 올려 보낸다는 캐스케이드 판정의 도구호출 아날로그입니다. 방향은 반대로 잡힙니다. 값싼 기구가 기본입니다. 비싼 기구는 예외에만 나옵니다. 결정론적 채점자는 신뢰 점수가 없습니다. 인증서는 오버랩 감사 자체입니다.
사전 등록한 세 채점자 감사 프로토콜
논문은 이 기준을 800개 도구호출 suite에 사전 등록합니다. 구성은 단순 400, 다중 200, 병렬 200이고 온도는 0입니다. 후보 설정은 두 개 이상의 대표 후보, 생산 체크포인트와 구조 매치 순위에서 그와 인접한 가장 가까운 도전 후보입니다. 모든 과제가 세 채점자 모두에서 한 번씩 채점됩니다. 이것이 100% 오버랩입니다. 예산은 무료 스윕 두 개, 유료 스윕 하나(800×K 판정 호출), 그리고 표면 변종 기준의 유료 부분 스윕 하나(400×K 호출)입니다. 유료 스윕이 프로토콜의 전부입니다.
사전 등록된 예측은 세 개입니다. P1: AST 매치와 판정자의 합의는 단순 과제에서 95% 이상입니다. 판정자는 다중과 병렬 합에서 구조 매치가 거부한 항목을 2포인트 이상 더 통과시킵니다. 불일치의 주원인은 구조 매치의 엄격성입니다. P2: 패턴 게이트는 구조 매치가 거부한 단순 과제의 5% 이상을 통과시킵니다. 판정자와의 합의는 구조 매치의 것보다 양쪽 오류 방향 모두에서 낮습니다. P3: 같은 템플릿의 두 표면 변종, 패러프레이즈와 톤 사이에서, 판정자 점수는 어느 한 후보 설정 이상에서 1포인트 이상 움직입니다.
반증 조건은 네 개입니다. R1: 구조 매치 인접 쌍이 5포인트 이내에 있으면서 판정자 아래에서 뒤집힙니다. 그러면 교란은 실제로 작동합니다. 오버랩 감사가 다시 풀기 전까지 arm 승격은 판정자 조건부로 운영됩니다. R2: 판정자와 구조 매치의 불일치가 60% 이상, 형식이 잘못된 출력 셀에 모입니다. 그러면 판정자가 보는 것은 형식입니다. 형식 검사로 강등됩니다. R3: 후보와 같은 모델 패밀리의 판정자가 같은 출력에서, 다른 패밀리 판정자 대비 그 후보의 측정 품질을 1포인트 이상 움직입니다. 그러면 자기 선호가 실제로 작동합니다. 패밀리 일치 판정자는 승격 경로에서 제외됩니다. R4: 두 표면 변종 모두에서 판정자와 구조 매치의 K개 후보 순위 켄달 타우가 0.9 이상이면 교란은 자는 것입니다. AST 매치는 다음 평가 사이클의 안전 대체로 인증됩니다. 인증서의 만료는 후보 집합 변경에 묶입니다.
임계값은 유료 스윕 실행 전에 고정됩니다. 프로토콜의 출력은 세 가지입니다. 구조 매치 아래 게이트 레벨 0.85의 게이트 안전 인증서, 판정자 에스컬레이션용 교란 쌍 목록, 평가 예산용 채점세 추정 ρ입니다.

그래서 무엇을 바꾸면 되나: 회사, 사회, 과학
회사에 남는 것은 밤샘 리서치 루프의 채점자 감사 프로토콜입니다. 유료 LLM 판정이 꼭 필요한 시점과 무료 결정론 채점이 순위를 보존하는 시점을 정량화해 평가 비용을 줄입니다. arm 승격과 티어 라우팅은 생산에 귀결되는 결정입니다. 이 프로토콜은 채점자를 바꾸면 순위가 조용히 뒤집힌다는 은근한 오류원을 그 결정에서 제거합니다.
사회에 남는 것은 채점자 선택이 순위를 뒤집는다는 현상을 실측 가능한 형태로 드러낸 점입니다. 새 하드웨어 투자 없이 에이전트 평가의 재현성과 신뢰도를 연구 공동체 전체에서 올립니다. 값싼 결정론 채점을 기본에 두고 비싼 판정자를 교란 밴드에 한정하는 것이, 후보 집단이 커질수록 에이전트 평가를 신뢰할 수 있게 지키는 가장 비용이 적고 에너지가 적은 방법입니다.
과학에 남는 것은 코드로 이중 채점 가능한 도구호출 ground truth에 대한 채점자 선택 효과의 첫 통제 측정입니다. 관용, 형식, 자기 선호 같은 판정 편향과 진짜 역량을 분리합니다. 검증 기준은 실행 가능한 ground truth입니다. 결정 수준은 스코어가 한 단계 위의, 후보 순위와 게이트와 라우팅입니다. LLM-as-a-judge 합의 연구가 인간 기준 검증과 스코어 수준 편향에 머물렀다면, 이 논문은 실행 가능 ground truth 검증과 결정 수준 역전으로 한 단계 올립니다. 편향 완화를 넘어, 가격이 매겨진 대체 규칙을 줍니다.
시리즈 안에서 기존 행의 해석도 바뀝니다. Validator’s Dividend는 무료 결정론 검증기 아래 도구호출 정확도 한 포인트의 가격을 줍니다. 그런데 잡히는 비중 p_d 자체가 채점자에 대해 측정됩니다. 그래서 배당 공식은 채점자 조건부가 됩니다. Precision Ladder의 judge-free 게이트는 감사 대상 기구가 됩니다. 무료 상수로 둘 수 없습니다. Multi-Skill Gap의 결정론 라벨은 이 논문이 프로파일화하는 채점자 집단의 한 항목이 됩니다. 89.6% AST 앵커는 엄격 측의 추정입니다. 구조 매치는 올바른 호출을 놓칩니다. 생산 체크포인트의 골드 품질은 그 행 이상입니다. 새 수치를 주장하지 않는 단측 서술입니다. 다중과 병렬 범주에서 엄격성이 더 크다면 라우팅 테이블은 의미 동등한 올바른 답이 많은 후보를 저평가할 수 있습니다. P1가 바로 그 감사입니다.
못 믿을 부분: 해석 논문이고, 네 가지 한계가 있다
첫째, 이것은 해석 논문입니다. 새 측정을 보고하지 않습니다. 모델은 단일 채점자 아래 보고된 시리즈 행에 조건화됩니다. 프로토콜은 사전 등록되었지만 이 논문에서는 실행되지 않습니다. 사전 등록이 다음 스윕을 테스트로 만듭니다.
둘째, 과제 세트는 BFCL 스타일 도구호출 벤치마크입니다. 다른 에이전트 벤치마크로의 이전은 열린 경험적 질문입니다. 프로토콜은 이동 가능합니다. 바뀌는 것은 과제 세트와 후보 집합뿐입니다. 셋째, 셀 산술은 통과/실패 채점을 가정합니다. 부분 점수 채점자가 0-1 통과율을 기대 점수로 바꾸면, 주요 명제들은 선형성으로 그대로 성립합니다. 넷째, 판정자는 고정된 (모델, 템플릿) 쌍 하나입니다. 반증 조건 R3와 R4가 패밀리와 템플릿의 표면을 가두지만 다지는 못합니다. 판정자 점수의 표면 민감성은 이미 문서화된 사실입니다.
채점자는 저울입니다. 저울을 고르기 전에, 그 서명이 읽힘에 얼마나 섞이는지를 재야 합니다. 이 논문은 그 재는 법칙과, 판정자의 가격을 줍니다.
논문 원문과 데이터: https://huggingface.co/datasets/thaki-AI/daily-paper-2026-10-04-grader-confound-agentic-rankings