🎧 ▶ 5분 브리핑으로 듣기
▶ 오디오북 재생 (Google Drive)
NotebookLM 오디오 개요 (AI 생성)

무인 에이전트를 돌리거나 그것을 맡고 있는 H200 인스턴스의 서빙 비용을 책임지는 엔지니어라면 이 글을 읽어야 한다. 에이전트가 매 턴 다시 보내는 고정 머리말은 버전 안에만 고정되어 있는 셈이다. 하네스가 밤마다 자기 자신을 다시 쓰면 캐시는 첫 편집된 엔트리부터 무효화되고 한 번의 재작성을 살아남는 비율은 100 중 2도 못 된다.

prefix는 첫 편집에서 깨진다: 스킬 하네스의 밤마다 자기 재작성이 캐시 재사용과 서빙 비용을 빼앗는 방식 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

쉽게 말하면

인쇄소로 비유하면 된다. 에이전트는 매 턴 같은 원고를 요청하는 것이다. 인쇄소는 이전 판과 1페이지부터 페이지 단위로 일치하는 부분은 다시 찍지 않는 규칙을 쓴다. 한 페이지만 바뀌어도 그 뒤는 새 원고로 처리되어 다시 찍힌다. 서빙 엔진의 접두 캐시(prefix cache)가 하는 일이 이것인 셈이다.

원고는 에이전트가 매 턴 보내는 스킬 매니페스트로, 200개 엔트리 6,000토큰이다. 하네스는 일부 페이지를 밤마다 다시 찍는 출판사다. 설명 문구를 다시 쓰고 장 순서를 바꾸며 제어 파라미터를 조정한다. 다시 찍기가 시작되는 지점은 첫 깨짐이라고 불리며 바뀐 첫 페이지에서 정해진다.

출판사가 밤마다 많이 고치면, 논문이 가격 매기는 기준 구성에서는 첫 깨짐이 평균 4페이지 안팎이다. 그 뒤로 200페이지까지 다시 찍히고 살아남는 비율은 100 중 2도 못 된다. 이 글이 주는 레버는 전부 인쇄소에서 정할 수 있는 것들인 셈이다. 원고를 어떻게 묶을지, 얼마나 자주 다시 찍을지, 내보낼지 말지, 두께를 어떻게 둘지를 정하는 것들이다. 인쇄기 변경도 모델 변경도 필요 없다.

핵심 개념 요약 인포그래픽 1 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

밤마다 바뀌는 매니페스트

고정 머리말은 시스템 프롬프트, 툴 스키마, 스킬 매니페스트 세 조각이다. 서빙 인스턴스는 첫 턴에 프리필(prefill), 처음부터 계산하는 과정을 돌리고 그 뒤는 접두 캐시를 쓴다. 캐시된 블록은 0번 토큰부터 서빙된 머리말과 일치할 때만 재사용된다. 이 규칙을 정합 의미론이라고 부른다.

매니페스트는 라우팅 계층이 쓸 수 있는 200개 엔트리를 순서대로 나열한다. 이 논문의 주제는 이 매니페스트 자체가 움직이는 일이다. 밤사이 자기 진화 루프가 설명 문구를 다시 쓰고 엔트리 순서를 바꾸며 제어 파라미터를 조정한다.

플릿의 기록된 역사도 이것을 뒷받침한다. 레지스트리가 3주 동안 1,600개에서 2,029개로 늘었다.

기록된 편집 스윕을 보면 11개 설명 파일이 다시 쓰인 것이 전부인 셈이다. 식별자와 고정 파라미터는 건드리지 않았다.

앞서 두 연구는 정적인 쪽을 가격 매겼다. 버전 안의 순서는 입력 비용의 12~89%까지 값이 있고 인덱스 오래됨은 자기만의 감소 법칙과 최적 재임베딩 주기를 가진다. 밤마다 재작성이 서빙 인스턴스의 캐시에 무엇을 하는가는 가격 매지지 않았다. 이 논문이 가격 매기는 층이 그것인 것이다.

가격 매기는 기준 구성은 측정치가 아니라 전제다. 재작성을 인스턴스에 반영하는 이벤트, 적용(apply)마다 21~31%의 설명이 다시 쓰이고 14~17개 엔트리의 순위가 이동한다. 기록된 스윕 속도보다 몇 배 위에 놓인 스트레스 지점이다.

unstable-prefix-harness-erosion 슬라이드 1

첫 깨짐 법칙

법칙은 닫힌 형태로 나온다. 연속 두 버전이 공통으로 갖는 접두의 기대 길이는 첫 깨짐에서 정해진다. 엔트리가 재작성될 확률이 β이고 엔트리 수가 N이면, 적용당 바뀔 엔트리의 기대 수는 곱 βN이다. βN이 손가락보다 크면, 살아남는 접두는 매니페스트 크기가 커도 커지지 않는다. 매니페스트 맨 앞의 일정 토큰 예산이 된다.

생존 비율은 βN이 클수록 급격히 낮아진다. 기준 구성에서는 적용당 50개 엔트리가 바뀌고 살아남는 것은 1.6%뿐이다. 즉, 사람 말로는 200개 페이지 중 196개가 밤마다 다시 찍히는 것과 같다.

First-break law: surviving manifest prefix as churn grows 적용당 바뀔 엔트리의 기대 수(βN)가 커지면, 한 번의 적용을 살아남는 캐시된 매니페스트 비율이 줄어든다. βN이 1이면 약 63%, 10이면 약 10%, 기준 지점(βN=50)에서는 6,000토큰 중 96토큰, 1.6%가 생존한다. 해석 모델의 그래프이며 실측이 아닙니다.

여기서 성질 두 개를 짚어 봅니다. 첫째, 캐시가 크거나 루프가 많이 공유한다고 줄지 않습니다. 앞서 가격 매긴 밤 안 밀림과는 다른 채널입니다. 둘째, 포화 구간에서는 손실이 매니페스트 크기와 무관합니다. 2,000토큰이든 48,000토큰이든 적용마다 거의 전부 다시 찍히고 청구서만 크기만큼 커집니다.

unstable-prefix-harness-erosion 슬라이드 2

다시 찍기를 본문으로만 묶는 재편집

첫 레버는 원고를 어떻게 묶을지입니다. 현재 레이아웃은 엔트리마다 이름과 설명을 접근 빈도순으로 엮어 둡니다. 그래서 설명 하나가 바뀌면 깨짐이 그 엔트리 머리에 옵니다. 논문은 바뀌어도 전면이 절대 안 닿는 레이아웃을 제안합니다. 안정 접두 레이아웃(PSL)이라고 부릅니다.

두 층 구조입니다. 먼저 식별자, 이름, 고정 파라미터 같은 안정 필드를 전부 식별자순으로 이어 붙여 앞부분에 둡니다. 이것이 골격으로, 6,000토큰 중 2,400토큰입니다. 골격 엔트리는 거의 변하지 않아 절대 깨지지 않습니다. 그 뒤에 설명 문구를 모은 상세 블록을 둡니다. 교환 규칙은 상세 블록을 재작성 확률이 낮은 엔트리부터 정렬합니다.

그러면 무효화를 상세 블록 안으로 가둘 수 있습니다. 기준 구성에서 적용 시 무효화 범위는 5,904에서 3,546으로, 1.7배 줄어듭니다.

효과는 골격 비중이 커질수록 커집니다. 긴 파라미터 블록을 골격으로 넘기면, 축소는 2.5배가 됩니다.

Where an apply invalidates: current layout vs prefix-stable layout 6,000토큰 매니페스트의 무효화 위치입니다. 안정 골격은 2,400토큰, 상세 블록은 3,600토큰입니다. 현재 레이아웃은 엔트리마다 안정 필드와 변동 필드를 엮어 두어 첫 깨짐이 거의 전체 매니페스트를 무효화합니다. 안정 접두 레이아웃은 바이트 고정 골격을 먼저 그리고 무효화를 상세 블록에 가둡니다. 해석 모델의 그래프이며 실측이 아닙니다.

적용 한 번의 가격과 동결 주기

적용은 눈에 보이는 이벤트입니다. 적용 직후 첫 턴은 5,904토큰을 미캐시로 프리필하고 그 턴의 입력 비용은 웜 기준선의 2.3배가 됩니다.

재편집 창 안에 턴이 떨어지는 루프는 전부 같은 미스를 겪습니다. 이 현상을 논문에서 충돌 계수라고 부르는 것입니다. 루프가 빠를수록 계수는 커집니다. 즉, 사람 말로는 루프가 빠를수록 재편집 창에 사람이 몰리고 첫날의 청구서와 지연이 튀어 오릅니다.

루프 간격 충돌 계수 첫 토큰 지연(기준선 1.44초) 적용당 청구
900초 1.02 2.46초(1.7배) $0.0033
60초 1.37 2.97초(2.1배) $0.0043
10초 3.21 5.69초(3.9배) $0.0100

루프 간격별 충돌 계수, 첫 토큰 지연, 적용당 청구. 웜 기준선 지연은 1.44초입니다. 전부 모델 예측이며 실측이 아닙니다.

얼마나 자주 다시 찍을지는 동결 주기(freeze cadence)가 정합니다. 주기가 k라면, k밤의 편집이 한 번의 적용으로 묶입니다. 밤당 비용은 두 항의 합입니다. 분배 재편집 비용은 k가 커질수록 줄고 매니페스트 오래됨 비용은 k가 커질수록 늘습니다. 주기를 7로 하면, 밤당 세금은 주기가 1일 때의 절반가량이 됩니다.

동결 주기 k 현재 레이아웃(토큰/밤) 안정 접두 레이아웃(토큰/밤) 안정 접두 레이아웃 + 게이트(토큰/밤)
1 5,904 3,546 1,773
2 2,978 1,788 894
4 1,495 898 449
7 856 514 257
14 428 257 129
28 214 129 64

동결 주기별 분배 무효화 범위 S(k)/k, 토큰/밤 단위, 루프 간격 900초 조건입니다. 전부 모델 예측이며 실측이 아닙니다.

Per-night decay law under a freeze cadence 밤당 감소 법칙, 동결 주기 k별 분배 무효화 범위 S(k)/k 그래프입니다. 무효화 범위는 레이아웃에서 상한이 잡히고 밤당 비용은 k에 대해 쌍곡선으로 줄어듭니다. 안정 접두 레이아웃이 바닥을 곱셈으로 내리고 품질 게이트가 이벤트율을 절반으로 만듭니다. 해석 모델로 그린 그래프라는 뜻. 실측 데이터는 담지 않습니다.*

합을 최소화하면 제곱근 법칙이 나옵니다. 최적 주기 k는 라우팅 포인트 하나를 잃는 것이 후속 재작업으로 얼마나 비싼지라 정해집니다. 기준 구성에서는 k가 재작업 비용에 따라 약 1에서 12 사이입니다. 편하게 읽으면, 라우팅 포인트가 비싸면 매일 다시 찍고 싸면 주 단위 하나로 묶는 것입니다.

비용 지형은 평평합니다. k*의 2배 이내라면 어떤 주기도 25% 넘게 비싸지지 않습니다. 그래서 운영자는 정확한 값을 쫓을 필요가 없고 재작업 비용을 재고 캘린드에 맞는 값을 고르면 됩니다.

매니페스트 재동결과 검색 인덱스 재임베딩은 같은 작업입니다. 레지스트리가 움직이면 두 산출물 모두를 따라잡아야 하니까, 한 번에 적용하는 것이 좋습니다. 그러면 충돌 창은 하나만 냅니다.

하드웨어 비대칭도 있습니다. 재편집 창 동안 구판과 신판 매니페스트가 캐시에 같이 머무르며 용량이 작은 머신에서는 유효 유지 시간이 짧아집니다. 32B/H100에서는 창마다 유지 시간의 12.9%가 깎입니다. 이벤트는 정적인 레버가 가장 약한 곳에서 유지 시간을 가장 많이 깎습니다.

unstable-prefix-harness-erosion 슬라이드 3

게이트와 핀

품질 게이트는 전부와 합성됩니다. 발산 게이트와 채택 게이트가 밤의 재작성이 실제로 라우팅을 좋게 했는지 판정합니다. 거절된 밤은 적용이 없게 됩니다. 버전 변경도, 무효화도, 이벤트도 없는 것입니다. 현재 레이아웃에서 이득 없는 변동은 세금만 가는 일이고 게이트는 그것을 아무 일도 안 되게 만듭니다. 채택률이 0.5이면 밤당 서빙 세가 절반이 됩니다.

풀 핀(pool pin)은 두 번째, 영구적인 채널을 다룹니다. 범위 내 풀이 레지스트리를 따라가면 27% 성장은 1,585토큰의 매니페스트 증가가 되고 턴당 입력의 +4.5%가 영구화됩니다. 시간이 지나도 풀리지 않는 래칫입니다. 풀 핀을 걸면 새 스킬은 기존 스킬을 밀어내고만 들어올 수 있습니다. 그러면 래칫은 더는 돌지 않습니다.

레버를 쌓으면 변동 채널은 밤당 인스턴스 비용의 0.07%에서 0.01%로 줄어듭니다. 래칫은 제로가 됩니다. 전부 배포 시점의 수치입니다. 엔진 변경도, 학습도, 라우팅 결과 변화도 없습니다.

unstable-prefix-harness-erosion 슬라이드 4

이 채널을 따로 재면 얻는 것

이 루프를 맡는 플랫폼에 달라지는 것은 서빙 청구서의 가시성입니다. 하네스 자신의 밤마다 자기 수정이 청구서를 조용히 키워 왔습니다. 이제 적용당 무효화율, 최적 동결 주기, 무효화를 상세 블록에 가두는 레이아웃까지 재게 됩니다. 라우팅 결과는 바꾸지 않고 운영자가 그대로 설정하는 레버들입니다.

의미는 플랫폼 밖으로 갑니다. 24/7 도는 자기 개선 에이전트 인프라는 밤마다 자신을 다시 쓰는 것이 일반적이지만, 그 서빙 계층의 숨은 세금은 보이지 않았습니다. 이 논문은 그 비용을 에너지와 함께 예측 가능하게 만듭니다. 품질 이득은 지키고 내는 가격은 안정된 접두 가격으로만 묶을 수 있습니다.

과학적으로는 접두 불안정을 인덱스 오래됨과 버전 안 순서 효과 모두와 구별되는 독립 서빙 비용 채널로 분리합니다. 자기 진화와 캐시 재사용 동역학 사이의 첫 닫힌 형태 연결입니다. 수정-동결 주기가 라우팅/서빙 목적 함수에 새 변수가 됩니다.

못 믿을 부분

이 글의 수치는 전부 명시된 전제 10개 아래에서 나온 모델 예측이며, 실측이 하나도 없습니다. 논문은 이 예측을 검증할 재실행 프로토콜을 전용 H200에서 지정해 둡니다. 매니페스트를 고정하는 편과 밤마다 바꾸는 편을 비교하고 사전 등록된 반증 조건을 씁니다. 이 프로토콜은 아직 규격 단계에 있습니다.

첫째는 변동율 자체입니다. 기준 구성인 21~31% 재작성, 14~17 이탈은 기록된 스윕보다 몇 배 위의 전제입니다. 프로토콜은 재실행 결과를 신뢰하기 전에 기록된 스윕 속도로 다시 고정합니다. 그래도 결론은 달라지지 않습니다. 기록된 속도 상한에서도 생존율은 10개 중 1개 수준입니다.

둘째는 독립성 전제입니다. 첫 깨짐 법칙은 엔트리가 독립적으로 재작성된다고 둡니다. 큐레이터가 관련 스킬 가족을 한꺼번에 다시 쓰면, 첫 깨짐은 법칙이 예측하는 것보다 일찍 옵니다. 골격 보호는 그 집중 재작성이 식별자를 건드리지 않는 한에서만 작동합니다. 기록된 스윕은 건드리지 않았습니다. 다만 그 스윕 하나를 본 것에 불과합니다.

셋째는 품질 전제입니다. 동결 주기는 모델 파라미터인 오래됨 기울기를 물려받으므로, k*는 운영자가 재는 재작업 비용에 조건부입니다. 안정 접두 레이아웃은 매니페스트를 식별자순으로 다시 렌더링하고 위치 민감성 노출은 매니페스트가 48,000토큰일 때 가장 큽니다. 절감은 측정한 품질 손실만큼 뺀 뒤에야 쓰여야 합니다.

넷째는 엔진 의미론입니다. 전부 엄격한 정합 접두 재사용 안에서 성립합니다. 필드를 제자리 패치하거나 캐시 지시를 따르는 엔진은 비용 구조가 달라, 첫 깨짐 법칙이 더는 적용되지 않습니다. 절감은 전구한 값 리스크의 가격과 맞바꾸는 것입니다.

세 장의 그림도 전부 해석 모델로 그린 그래프입니다. 실측 곡선이 아닙니다.


논문 상세 페이지는 여기에서 볼 수 있습니다: The Unstable Prefix: Measuring KV-Cache Reuse Decay and Serving-Cost Inflation Under Overnight Self-Evolving Skill Harnesses on Self-Hosted H200

핵심 개념 요약 인포그래픽 2 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

태그: agent-workload, freeze-cadence, h200-inference, kv-prefix-caching, manifest-stability, self-evolving-harness, serving-cost-drift, skill-registry-churn, unattended-automation

카테고리:

업데이트: