예측가능성 세금: 무인 에이전트 루프에서 p95 상한을 지키는 대가
무인 에이전트가 한 과제를 끝내는 데 드는 비용은, 평균이 아니라 꼬리에서 깨집니다. 무인 에이전트 루프를 돌리거나 그 청구서를 책임지는 클라우드·AI 엔지니어라면, 이 한 줄이 곧 설계 원칙인 셈입니다. ThakiCloud의 오늘 논문 ‘예측가능성 세금’은 그 대가를 측정합니다. 질문은 단순합니다. p95 비용 상한을 지키려면, 평균 비용이 얼마나 오르는지, 그마저 못 사면 품질을 얼마 내줘야 하는지, 이 두 가지가 논문의 물음인 것입니다.
글의 핵심 개념을 형상화했습니다.
쉽게 말하면: 지진 보험
지진 보험을 들어본 사람은 압니다. 집 한 채를 지키려면 매달 작은 자기를 내야 합니다. 그 자기는 확률과 기대값에 따라 정해집니다. 보험 설계의 핵심은, 가장 큰 지진을 어디까지 담을 것인가입니다.
무인 에이전트 루프의 청구서도 같습니다. 과제를 받으면 모델을 골라 부릅니다. 안 되면 재시도하거나 상위 티어로 올립니다. 건드린 토큰마다 돈을 냅니다. 인간이 개입할 자리가 없으므로, 청구서를 책임지는 쪽은 평균 토큰과 평균 달러로만 회계합니다. 그래서 예산이 깨지는 지점은 꼬리입니다. 재시도 폭풍, 긴 기간에 쌓이는 오류, 싼 티어에서 가장 비싼 티어로 이어지는 사슬이 바로 그 꼬리이기 때문입니다.
이 논문이 측정하는 예측가능성 세금(predictability tax)은 보험 자기와 같은 물입니다. p95 비용 상한이라는 계약, 과제의 95퍼센트가 그 돈 안쪽에서 끝난다는 약속에 붙는 자기입니다. 그 자기를 돈으로 못 내는 동네에서는, 품질을 내줘야 합니다. 보장이 그 대가로 낮아집니다.

문제의식: 평균으로 적힌 청구서
지금의 회계는 기대값 하나에 의존합니다. 과제당 평균 토큰, 평균 달러, 라우팅 결정당 평균 비용이 전부입니다. 그러나 예산이 깨지는 지점은 평균이 아닙니다. 평균은 꼬리에 숨은 확률을 보여 주지 못합니다.
라우팅 정책도 같은 기대값 위에서 설계됐습니다. FrugalGPT의 캐스케이드(cascade)는 싼 티어부터 시작해 안 될 때만 올려 보냅니다. 학습한 라우터는 특징 점수로 티어를 고릅니다. 목표는 기대 비용 최소화입니다. 둘 다 과제당 비용의 분포는 정책의 부산물로 여깁니다. 평균이 전부라면, 꼬리는 누가 책임지겠습니까?
이 논문은 분포 전체를 1급 시민으로 옮긴다. 품질은 고정한다. 정책별로 과제당 비용의 평균과 분산, 꼬리 분위기를 함께 재서 평균-분산 프런티어(mean-variance frontier)를 그린다는 뜻. 그리고 한 물건을 격리한다. p95 상한이라는 빡빡한 비용 계약을 사려면, 얼마나 더 내야 하는지, 그마저 못 사면 품질을 얼마 내줘야 하는지, 그것이 예측가능성 세금인가.

무엇을 해봤나: 분포를 1급 시민으로
설계 공간은 5가지 정책으로 채운다. 특정 티어를 고정해 한 번만 부르는 정책과, 싼 티어부터 올려가는 캐스케이드, 난이도 점수로 티어를 고르는 학습한 라우터가 한 축인 셈. 여기에 비용과 분산을 함께 최적화하는 라우터와, 예산 상한에서 루프를 잘라내는 정책이 더해진다.
세금의 정의는 계약 한 쌍에서 나온다는 것이다. 품질은 q 이상, 과제당 비용 p95는 B 이하라는 계약에 맞는 정책 중 가장 싼 평균 비용이, 무약속 정책의 평균 비용보다 얼마나 큰가가 보험형 세금인 셈. 어떤 정책도 그 평균으로 못 사면, 세금은 품질로 내기도 한다. p95가 B를 넘지 않는 정책이 도달할 수 있는 최대 품질에서, 목표 품질까지 벌어지는 간격.
캐스케이드의 분산은 두 조각으로 갈린다. 호출 자체의 잡음과, 과제마다 다른 경로가 만들어 내는 과업 이질성이다. 두 가지 티어 지형 중 A 지형에서는 전체 분산이 약 40인데, 호출 잡음 조각은 1 안쪽이다. 꼬리를 만들어 내는 것은 어려운 과제가 비싼 티어까지 올라가는 경로 차이, 곧 이질성인 셈. 즉, 사람 말로는, 청구서가 흔들리는 이유는 통화의 잡음이 아니라 지진의 크기다.
캐스케이드의 평균 비용은 고정 2티어와 같습니다(3.79). 표준편차는 품질이 맞은 고정 3티어보다 약 2.2배 큽니다(6.33 대 2.86). 그 차이는 분산 분해의 과업 이질성 항 H입니다. 호출 잡음이 아닙니다. (해석 모델이며 실측이 아닙니다)
세금의 크기는 손절 항등식으로 나온다. 상한을 두면 얻는 평균 절감은, 꼬리 부분의 적분과 정확히 같다. 세금은 두 방식으로 납니다. 상한 밖 과업 비중이 적으면 평균 비용으로, 보험형으로 납니다. 비중이 크면 평균으로 살 수 없습니다. 품질로 내는 천장형입니다. 두 방식을 가르는 기준은 탈출 경계(escape bound)인가. p95가 B를 넘지 않는 정책은, 가장 비싼 5퍼센트 과제를 제외하면 전부 상한 안에 두어야 합니다. 그래서 그 정책들이 지킬 수 있는 최대 품질이 탈출 경계라는 뜻.
분산 벌점 라우터의 행동도 정리됩니다. A 지형의 어려운 과제를 두고 보면, 벌점이 임계치 아래이면 아무것도 안 합니다. 임계치를 넘으면 어려운 과제를 통째로 비싼 티어로 돌립니다. 반쯤 헤지는 천장 지형에서 존재하지 않는 셈.

나온 결과: 세금은 곡선이 아니라 계단이다
A 지형은 어려운 과제가 3티어까지 올라가야 품질을 지킵니다. B 지형은 2티어가 강해서 과제가 거의 위로 올라가지 않습니다. 즉, 사람 말로는, A 지형은 지진이 잦은 동네이고 B 지형은 드문 동네인가.
A 지형의 헤드라인은 계단입니다. 세금이 매끄러운 곡선으로 주어지지 않습니다. 품질 0.9까지는, p95 약 5.4의 계약 안에서, 평균을 42% 아끼며 담깁니다. 즉, 사람 말로는, 큰 보험은 안 들어도 되는 손해 구간에서, 자기 없이 보장까지 늘린 것입니다.
그 위를 담으려면 대가도 계단이 됩니다. 마지막 6.4의 품질 포인트는 상한 밖 3티어 호출이 책임집니다. 다 주면 p95는 4.3배로 뛸 뿐입니다. 평균도 크게 오릅니다. 즉, 사람 말로는, 자기 한 푼 더 내는 구간이 아닙니다. 보장 한도를 통째로 올리는 대가입니다.
품질 0.915까지는 p95 약 5.4 안쪽의 계약이 평균 2.19로 담깁니다(무상한 캐스케이드 3.80 대비 평균 42% 절감). 마지막 6.4의 품질 포인트를 다 주면, p95는 5.38에서 22.92로 4.3배, 평균은 2.19에서 3.80으로 73% 오릅니다. p95 10 이하 계약은 목표 품질 0.90에서 공짜인 셈입니다. 탈출 경계 0.953을 넘으면 품질로만 납습니다. 예측가능성 세금은 천장 경계에서 계단입니다. (해석 모델이며 실측이 아닙니다)
p95 10 이하 계약은, 목표 품질 0.9에서는 공짜입니다. 상한을 둔 캐스케이드가 같은 품질에서 고정 3티어보다 평균을 거의 9분의 1로 떨어뜨립니다. 즉, 사람 말로는, 보험이 이미 들어져 있는 셈입니다.
그 위는 다릅니다. 탈출 경계, 약 0.95를 넘으면 계약은 비용으로 못 사게 됩니다. 그때 세금은 품질로 납니다. A 지형의 완전한 천장, 0.98을 원하면 2.6 포인트의 품질을 내줘야 합니다. 즉, 사람 말로는, 보장 한도가 여기까지라, 더 높이 달라고 하면 보험사가 거절하는 값입니다.
B 지형은 반대편입니다. 2티어가 강해서 과제가 거의 안 올라갑니다. 상한 밖 비중은 1% 미만이라, p95 약 4.9의 예측가능성은 캐스케이드에 공짜로 붙습니다. 즉, 사람 말로는, 지진이 거의 없는 동네에서는 자기 한 푼에 보장이 통째로 붙는 것입니다.
다만 더 빡빡한 계약을 원하면 대가는 품질로 납니다. p95 1.2 이하로 올리면 캐스케이드는 싼 티어 고정으로 추락하고 품질도 함께 떨어집니다. A 지형에서는 과업의 8.4%가 상한 밖 호출을 짊어집니다. B 지형에서는 0.5%뿐입니다. 즉, 사람 말로는, 지형에 따라 세금을 내는 통이 평균인지 품질인지 갈립니다.
꼬리 지수 α가 정하는 상한도 하나 있습니다. α가 2 이하이면 분산이 무한정입니다. 그러면 평균-분산 목적함수 자체가 정의되지 않습니다. 그때 잘 정의된 예측가능성 대상은 p95 같은 분위 수 계약뿐입니다. α가 1 이하가 되면 평균조차 무한정이 됩니다. 어떤 유한한 가격으로도 예측가능성을 못 삽니다. 재시도 폭풍의 경계입니다. 즉, 사람 말로는, 지진의 빈도와 크기는, 보험 자기라는 물건 자체가 존재하는지를 가릅니다.
단위 규모의 Pareto 법칙에서, p95 상한의 상대 손절 비용은 α = 1.1에서 0.692로 시작해 α = 5에서 0.018까지 떨어집니다. α가 1과 2 사이이면 과제당 비용 분산이 무한정입니다. 이때 평균-분산 목적함수는 정의되지 않습니다. 그때 분위 수 계약만이 잘 정의된 예측가능성 대상입니다. (해석 모델이며 실측이 아닙니다)
그래서 무엇을 바꾸면 되나
클라우드 엔지니어에겐, 톰 단가에 새 축이 생깁니다. 예측가능성 세금 곡선 T(B)가 두 번째 가격표가 됩니다. 빡빡한 p95 계약을 사려는 고객에게 얼마를 붙일지가 계산으로 나옵니다. 기존 H200와 라우터 스택 위에서, 예산 상한 라우팅과 평균 비용 라우팅의 두 플랜을 나눌 수 있습니다. 제로 토큰 스킬 라우터와 큐 인식 티어 폴백과도 합쳐집니다.
작은 팀과 비영리 단체에겐, 무인 자동화를 청구서 놀이에서 예산으로 바꾸는 법입니다. 꼬리에 더 내는 대가가 정량화되면, 청구서 놀이가 사라집니다. 꼬리 재시도 폭풍이 허비하는 전기와 달러도, 이제 계상할 수 있는 값이 됩니다.
과학적으로는, FrugalGPT식 기대 비용 캐스케이드가 분포 수준 목표로 오릅니다. 품질은 고정합니다. 평균과 분산, 꼬리 분위기를 함께 비교하는 프런티어가 첫 계산으로 정리됩니다. 비용 분산은 이제 라우팅의 1급 지표입니다. 정책의 부산물이 아닙니다.

못 믿을 부분
이 논문의 모든 수치는 해석 모델에서 나온 값입니다. 티어 가격 비율은 1 대 3.75 대 18.75, 성공 확률도 선언 값입니다. 텔레메트리가 아닙니다.
캐스케이드의 재시도는 과업 유형만 주어지면 독립적으로 일어납니다. 호출 잡음은 모든 티어에서 같은 값인 것으로 둡니다. 유한한 티어 깊이도 가정입니다. 학습한 라우터 두 종도 선언된 임계치로 대용됩니다.
측정 프로토콜은 지정되어 있습니다. 방향성을 미리 선언한 가설로, 이 논문의 각 정리를 잴 수 있게 짰습니다. 파일럿 규모에서는 p95 추정이 거칠 수 있는 만큼, 꼬리 가설은 더 큰 반복이 필요합니다. 실행은 향후 일입니다.
그래도 결론은 단단합니다. 평균으로만 적힌 청구서는, 예산이 꼬리에서 깨질 때까지 아무 경고도 주지 못합니다.
논문 원문과 데이터: https://huggingface.co/datasets/thaki-AI/daily-paper-2026-09-28-predictability-tax-cost-variance-routing