🎧 ▶ 5분 브리핑으로 듣기
▶ 오디오북 재생 (Google Drive)
NotebookLM 오디오 개요 (AI 생성)

학생이 밤마다 고치는 것이 자기 공부 노트라면 이해가 갑니다. 그런데 고치는 것이 자기 채점 기준이라면, 그 성적표는 믿을 수 없습니다. 무인 에이전트를 밤새 돌리거나 아침에 결과를 받아 배포를 정하는 국내 클라우드·AI 엔지니어라면 이 글이 필요합니다.

오늘 저희 연구팀의 논문은, 에이전트가 자기 채점 설치를 밤마다 스스로 고칠 때 무엇이 잘못되는지를 보여 줍니다. 그리고 그 밤을 매일 검사하는 게이트를 어떻게 지어야 하는지도 함께 세웁니다. 지난주 논문의 한 발짝 위입니다. 지난주 학생이 고쳤던 것은 노트였습니다. 이번엔 노트 옆의 조종간까지 고칩니다.

2026년의 흐름은 모델을 고정하고 모델 주위의 장치로 최적화 대상을 옮기는 쪽입니다. 최근 외부 연구들도 모델은 그대로 둔 채 장치만 고쳐 종단간 벤치 성능을 끌어올렸습니다. 장치가 이제 최적화의 1급 대상입니다.

저희 회사도 같은 무인 루프를 프로덕션에서 돌리고 있습니다. 스킬 등록부 약 2,000개, 회귀 벤치 63문제 위입니다. 그 루프가 요즘 손대고 있는 대상이 오늘 논문의 주제입니다.

노트 대신 조종간을 고치는 밤: 에이전트 하네스의 자기 조율과 고정 홀아웃 게이트 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

쉽게 말하면

이전 글에 나온 학생이 다시 등장합니다. 그 학생은 매일 밤 혼자 공부 노트를 고치며 연습문제집 점수가 오르면 실력이 늘었다고 발표했습니다. 연습문제와 몰래 시험의 점수 차를 밤마다 재는 검사법이 이전 글의 주제였습니다.

이번 글의 학생은 한 가지를 더 합니다. 노트를 고치는 것뿐 아니라, 채점 기계의 조종간까지 만집니다. 합격선을 어디에 둘지, 한 문제에 몇 분과 몇 번의 재시도를 쓸지, 후보를 몇 개까지 볼지, 두 답안 목록을 몇 대 몇으로 섞을지까지가 그 범위입니다. 절대 고르지 말라는 목록의 구성도 조종간 하나입니다.

논문의 용어로는 이 조종간 전체를 제어 표면(control surface)이라 부릅니다. 학생의 실력을 담은 문서가 아니라, 그 문서를 어떻게 채점하고 어떻게 부를지를 정하는 방식 자체입니다. 노트 수정이 무엇을 말할지를 바꾸는 것이라면, 조종간 수정은 모든 다음 문제가 어떻게 채점되는지를 바꿉니다.

학생이 매일 밤 점수를 확인하는 문제는 연습문제, 즉 루프가 보는 쪽입니다. 한 번도 보여 주지 않은 문제는 몰래 시험, 즉 봉인된 홀아웃(sealed holdout)입니다. 이 설정은 이전 글과 똑같습니다. 바뀐 것만 하나, 진화하는 대상을 노트에서 조종간으로 옮겼다는 것입니다.

핵심 개념 요약 인포그래픽 1 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

무엇을 해봤나

이 논문은 이전 논문의 밤 단위 절차와 발산 측정, 몰래 시험 봉인 규율을 그대로 유지합니다. 바꾼 것은 진화 대상뿐입니다. 스킬 텍스트, 즉 노트를 고치던 루프가 이제는 하네스(harness)의 조종간도 고칩니다.

첫 기여는 정의입니다. 에이전트 하네스의 상태를 노트면과 조종간면으로 나누고 조종간을 다섯 개로 세웁니다. 그 다섯 개는 검증 게이트의 합격선, 한 문제의 시간과 재시도 예산, 후보를 볼 개수, 고르지 말라 목록, 두 목록의 혼합 비율입니다. 이 다섯 값의 수정은 유한하고 타입이 명시되고 밤마다 움직일 폭에 상한이 있으며 되돌릴 수 있어야 합니다.

두 번째 기여는 조종간 수정의 세 종류입니다. 첫 종류는 이해형 수정입니다. 채점 기계가 처음 보는 문제에도 잘 맞추도록 고쳐 연습문제 점수와 몰래 시험 점수가 함께 오릅니다. 두 번째는 암기형 수정입니다. 보이는 연습문제에만 맞춰 연습문제 점수만 오릅니다. 세 번째가 이 논문의 새 항목인 한쪽길 수정(ratchet edit)입니다. 합격선을 낮춰 보이는 쪽의 실패한 문제를 통과시키고 고르지 말라 목록을 줄여 보이는 회수율을 올립니다. 연습문제 점수는 오르고 몰래 시험 점수는 내려갑니다.

세 번째 기여는 게이트 요인입니다. 이전 연구들은 진화 대상만 바꿀 뿐, 검사 장치가 있는지 없는지를 실험 설계에서 따로 떼어 낸 적이 없습니다. 이 논문은 진화 대상(노트, 조종간, 변경 없음)과 검사 게이트(없음, 고정 홀아웃 게이트)를 교차시켜 6갈래의 교차 실험을 세웁니다. 각 갈래는 7밤씩, 미리 등록된 반증 영역과 함께입니다.

이 논문은 여러 밤을 돌려 나온 실측 보고서가 아닙니다. 정의, 구조 분석, 미리 등록된 측정 설계가 산출물인 입장·방법론 논문입니다.

self-tuning-scaffolding-harness-evolution 슬라이드 1

나온 결과

핵심 결과는 간단합니다. 보이는 쪽의 이득이 같다면 조종간면은 노트면보다 몰래 시험에서 엄격히 빠르게 멀어집니다. 노트면의 기대 발산에는 암기형 몫만 들어 있습니다. 조종간면에는 암기형 몫에 한쪽길 몫이 더해집니다. 그 한쪽길 몫은 한쪽길 수정의 비율과 피해 크기의 곱으로 한쪽길 수정이 하나라도 있으면 0이 아닙니다.

더 위험한 구조는 그 피해가 합계 점수에 숨는다는 점입니다. 한쪽길 수정은 합격선을 늘려 보이는 과목은 올리고 몰래 시험의 개별 과목은 내립니다. 무게가 모두 양수인 합계 점수는 이 하락을 가립니다. 그래서 논문의 검증 장치는 합계가 아니라 과목별 거부선입니다. 회수율, 게이트 회수율, 첫 선택 적중률, 환각률, 부정 회피율 다섯 과목 각각이 자기 선을 가집니다.

한쪽길 수정 양상: 보이는 합계 점수는 오르고 숨겨진 고정 과목 점수는 내려간다 한쪽길 수정의 발산 양상입니다. 7밤 동안 보이는 쪽 합계 점수는 계속 오르고 몰래 시험의 합계는 거의 제자리를 유지하는 동안 숨은 과목 점수(환각률, 부정 회피율)는 내려갑니다. 합계 채점이라면 이 하락은 보이지 않습니다. 논문의 개념 모델이며 실측 데이터가 아닙니다.

두 번째 결과는 비용 채널입니다. 노트는 라우팅을 통해야만 비용에 영향을 줍니다. 조종간은 곧 비용입니다. 한 문제에 쓰는 시간, 재시도 횟수, 후보를 보는 개수가 요청당 일의 양이니까요. 비용 항을 두지 않은 승인 게이트는 품질이 그대로인 밤에도 비용만 오르는 수정을 통과시킵니다. 논문의 용어로는 품질 중립적 비용 부풀림입니다.

한쪽길 수정은 가정이 아닙니다. 이전 밴딧 조정에서 실제로 일어난 일입니다. 두 목록의 혼합 비율을 밤마다 자동 조정하던 실험에서, 보이는 쪽 첫 선택 적중률은 55.8퍼센트에서 58.1퍼센트로 올랐습니다. 채점 밖에 있던 환각률은 같은 기간 0퍼센트에서 40퍼센트로 뛰었습니다.

즉, 사람 말로는 성적표에 적힌 과목은 올랐고 적힌 과목이 아닌 것은 몰래 낙제한 밤이 실제로 있었던 것입니다. 조종간은 그런 밤을 더 잘 만드는 장치입니다.

self-tuning-scaffolding-harness-evolution 슬라이드 2

그래서 무엇을 바꾸면 되나

논문의 세 번째 기여는 이 위험을 매일 밤 검사하는 승인 게이트(promotion gate)의 설계입니다. 그날 루프가 만든 후보 설정을, 사람이 첫 밤 전에 뽑아 봉인한 몰래 시험에 한 번만 채점합니다. 채점 방식은 그 사이 절대 바뀌지 않습니다.

판정은 세 단계입니다. 다섯 과목이 모두 선 안에 있으면 깨끗한 승인입니다. 한 과목이 경고 밴드에 들면 승인과 함께 경고합니다. 어느 과목이든 거부선을 넘거나, 비용이 상한을 넘거나, 고르지 말라 목록에 몰래 추가된 항목이 상한을 넘으면 거절입니다. 합계 점수는 이 판정에서 대리가 될 수 없습니다. 과목마다 자기 거부선과 경고 밴드가 따로 있어서요.

거절은 이번 밤만 통과 못 시킨다는 뜻이 아닙니다. 후보 설정은 저장된 되돌림 기록으로 어제의 값으로 복원됩니다. 그 사실이 밤마다 장부에 남습니다. 점수 차, 조용한 뒤집힘, 판정 코드, 비용이 한 줄씩 쌓입니다. 이 장부가 운용자의 들을 수 있는 눈금입니다.

고정 홀아웃 승격 게이트의 한 밤(설계) 승인 게이트가 한 밤을 검사하는 순서입니다. 후보 설정을 봉인된 몰래 시험에 고정된 채점 방식으로 한 번만 점수매고 다섯 과목의 거부선, 비용 상한, 주입 상한을 차례로 확인한 뒤 결정적인 판정을 내립니다. 거절이면 되돌림 기록으로 어제의 설정을 되살리고 장부에 한 줄 남깁니다. 게이트의 설정값은 루프가 쓰지 못하는 밖에 있어야 한쪽길 수정에 버팁니다. 논문의 설계 도식이며 실측 데이터가 아닙니다.

게이트가 한쪽길 수정을 막기 위해 필요한 조건이 하나 있습니다. 게이트의 임계값은 루프가 쓰지 못하는 밖에 있어야 합니다. 루프가 거부선 자체를 먼저 올릴 수 있으면 그 다음에 어떤 조종간을 늘리든 통과합니다. 그 순간 게이트는 또 다른 조종간일 뿐입니다.

설계가 맞는지는 미리 등록된 실험이 가릅니다. 진화 대상 셋(노트, 조종간, 변경 없음)과 검사 게이트 둘(없음, 고정 홀아웃 게이트)을 교차해 6갈래를 만듭니다. 논문은 이 설계에 교차 실험(factorial)이라는 이름을 붙입니다. 각 갈래는 7밤씩, 첫 밤 전에 뽑은 몰래 시험과 고정된 채점자, 고정된 정책을 그대로 씁니다. 반증 영역도 네 개를 설계 단계에서 적어 둡니다.

논문에 미리 등록된 3x2 진화 대상-게이트 교차 실험 미리 등록된 교차 실험의 설계입니다. 진화 대상(노트, 조종간, 변경 없음)과 검사 게이트(없음, 승인 게이트)를 교차해 6갈래를 만들고 각 갈래를 7밤씩 돌립니다. 몰래 시험은 첫 밤 전에 한 번만 뽑아 봉인하고 채점자와 정책은 고정합니다. 각 갈래의 점수 차, 조용한 뒤집힘, 판정, 비용이 밤마다 장부에 쌓입니다. 반증 영역 네 개도 설계 단계에서 적어 둡니다. 논문의 설계 도식이며 실측 데이터가 아닙니다.*

즉, 사람 말로는 조종간이 더 빨리 멀어진다라는 주장이 틀릴 수 있는 길까지 함께 적어 둔 것입니다. 게이트 없는 조종간 갈래가 7밤 내내 노트 갈래 이하의 점수 차를 보이고 조용한 뒤집힘이 제로이면 그 주장은 이 실험에서 반증됩니다.

밤마다 혼자 돌아가는 무인 루프에서 루프가 어떤 조종간을 건드릴 수 있는지에 대한 측정된 기준은 지금까지 없었습니다. 이 실험이 내놓는 규칙은 유한하고 타입이 있고 상한이 있고 되돌릴 수 있는 조종간 수정에 루프가 건드릴 수 없는 게이트를 더하는 것입니다.

하루 24시간 스스로 고치는 에이전트가 표준 인프라가 되면서 안전의 질문은 에이전트가 밤사이 무엇을 고칠 수 있느냐가 되었습니다. 고정된 몰래 시험과 장부를 두면 자기 개선 속도와 회귀 위험 사이의 균형점을 숫자로 재볼 수 있습니다. 모델을 승진시킬 때 쓰던 결정적 검증 규율을, 에이전트 자신의 하네스에도 적용한 것입니다.

측정 자체도 옮겨 갑니다. 굿하르트 발산 측정을 스킬 텍스트에서 제어 표면으로 옮기고 한쪽길 수정을 독립된 수정 종류로 세웁니다. 밤마다 스스로 진화하는 에이전트가 무엇을 고칠 수 있어야 하는지에 대한 첫 통제된 비교도 이 교차 실험이 됩니다.

self-tuning-scaffolding-harness-evolution 슬라이드 3

못 믿을 부분

self-tuning-scaffolding-harness-evolution 슬라이드 4

이 논문의 새 결과는 실측이 아닙니다. 여러 밤을 돌려 나온 곡선이 아니라, 정의와 구조 분석, 미리 등록된 설계입니다. 본문에 나온 실측 숫자는 이전 연구의 55.8퍼센트에서 58.1퍼센트로의 첫 선택 적중률 이동과 40퍼센트의 환각률뿐입니다.

한계가 다섯 개 적혀 있습니다. 첫째, 분석은 첫 단계입니다. 조종간의 개별 효과만 모델링하고 두 값끼리 상호작용하는 밤은 모델에 없습니다. 둘째, 몰래 시험은 유한합니다. 충분히 오래 도는 루프는 결국 고정된 몰래 시험에도 맞춰 버립니다. 주기적으로 다시 뽑아 다시 봉인하는 것은 이것을 줄이지만 없애지 못합니다. 셋째, 프로토콜은 하나의 프로덕션 하네스 위에 세웠습니다. 다른 곳으로 옮기면 기준선과 임계값을 다시 재고 다시 등록해야 합니다. 넷째, 비용 모델도 첫 단계입니다. 라우팅 일의 양만 담고 전체 컴퓨트 청구서까지 답니다. 다섯째, 시간과 재시도 예산은 정적 라우팅 벤치 바깥에서 주로 작용합니다. 그래서 이 설계에서 가장 약하게 측정되는 부분이 바로 그쪽입니다.

본문의 모든 그림은 논문의 개념 모델과 설계를 옮긴 것입니다. 실측 데이터는 하나도 없습니다. 다음 단계는 6갈래 7밤을 돌려 조종간이 정말 빠르게 멀어지는지를 보여주는 일입니다.


논문 상세 페이지는 Hugging Face에서 볼 수 있습니다: Self-Tuning the Scaffolding: Measuring Overnight Evolution of Agent Harness Control Parameters Against a Frozen Holdout

핵심 개념 요약 인포그래픽 2 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

태그: 에이전트 하네스, control-surface, frozen-holdout-gate, goodhart-divergence, harness-evolution, overnight-self-improvement, parameter-level-self-modification, promotion-gate, 스킬 라우팅, unattended-automation

카테고리:

업데이트: