이 글 공유하기

무인으로 도는 에이전트 루프의 반복 업무에서 추론 비용을 설계하는 국내 클라우드·AI 엔지니어라면 이 글을 읽어야 합니다. 루프가 한 번 성공한 업무는 다음에 두 길 중 하나로 처리됩니다. 처음부터 다시 계획하는 길과, 검증된 성공 기록을 스킬 루틴으로 컴파일해 리플레이하는 길입니다. ThakiCloud의 이번 논문은 이 선택을 셀프호스트드 GPU 위에서 닫힌 형태의 비용-품질 모델로 가격 매깁니다. 어떤 재발 빈도와 어떤 드프트에서, 컴파일 비용이 상환되는 지점과 상환이 무너지는 지점을 답하는 브레이크이벤 법칙입니다. 한 줄로 줄이면, 반복 업무의 추론 비용을 시간 축에서 되돌려 받는 규칙입니다.

쉽게 말하면: 한 번 성공한 요리의 레시피

주방을 떠올려 보겠습니다. 매 주문마다 재료를 보고 조리 순서를 처음부터 생각하는 셰프가 있습니다. 성공한 요리를 레시피로 정리해 둔 주방도 있습니다. 레시피는 틀입니다. 양과 재료가 들어가는 빈칸이 있습니다. 그 값이 레시피 영역과 맞지 않으면 가드가 울립니다. 단골 주문이 다시 오면 빈칸만 채워 요리합니다. 단골의 취향이 레시피에서 벗어났으면, 처음부터 다시 요리합니다. 주방이 리모델링되면 레시피를 다시 써야 합니다. 이 논문의 질문은 이 레시피가 언제 자기 값을 찾는가입니다. 단골이 하루 한 번씩 오고 취향이 크게 변하지 않는다면, 레시피는 값집니다. 주문이 자주 바뀌거나 주방이 잦게 손대면, 처음부터 요리하는 편이 더 쌉니다. 이 비유에서 레시피는 에이전트 루틴, 셰프의 즉흥 조리는 모델이 매번 처음부터 계획하는 clean-slate 해석을 가리킵니다.

문제의식: 반복 업무마다 처음부터 다시 치르는 추론 비용

무인 에이전트 루프는 사람이 임계 경로(critical path)에 서지 않은 채 24시간 도는 시스템입니다. 그 용량은 운영자가 직접 소유한 추론 용량, 곧 셀프호스트드 GPU 위에서 나옵니다. 셀프호스트드 환경에서는 토큰이 곧 시간입니다. 디코딩된 토큰 하나하나가 기기의 벽시계 시간을 쓰므로, 한 과제를 디코딩하지 않는 1초는 다음 과제가 쓸 수 있는 1초입니다.

같은 가족의 과제가 새로운 파라미터 값과 함께 반복 도착할 때, 루프는 매번 처음부터 계획해 해석(interpretation)합니다. 매 반복마다 온전한 과제당 추론 비용을 치르는 셈입니다. 이 두 실행 체제는 오래된 계보를 지닙니다. 해석은 ReAct가 정한 현대 LLM 에이전트의 기본 작동 방식입니다. 컴파일은 Voyager의 성장하는 스킬 라이브러리입니다. Voyager는 스킬 라이브러리가 작동한다는 것을 확립했습니다. 하지만 언제 값을 찾는가는 묻지 않았습니다. 비용 모델도, 드프트 회계도, 재플랜에 대한 브레이크이벤 조건도 없습니다.

2026년의 스킬 하네스 연구는 스킬의 정문을 잽니다. 라우팅, 검색, 구성, 유지보수, 하네스 자체의 진화까지 포함합니다. 정문을 재지만 행동 자체의 가격은 매기지 않습니다. 리플레이와 재플랜을 토큰과 품질로, 그리고 가족이 얼마나 자주 재발하고 얼마나 빠르게 드프트하는지의 함수로 가격 매기는 축은 비어 있습니다. ThakiCloud 플랫폼은 같은 셀프호스트드 설정에서 인접한 레버들의 가격을 이미 매겼습니다. 라우팅 결정 자체를 캐싱하는 안전 스킵 프론티어, Cached Router입니다. 캐시된 결정은 레지스트리 셔른과 패러프레이즈 드프트라는 두 독립 시계에서 늙습니다. 에이전트 루프가 매 턴 다시 보내는 고정 프리픽스의 토큰 경제학, Manifest Order입니다. 무료 결정론 검증기 아래 도구호출 품질 1퍼센트포인트의 가격, Validator’s Dividend입니다. 이 레버들은 루프가 얼마를 쓰는지 바꿉니다. 하지만 루프가 무엇을 하지는 바꿉니다. 반복 가족의 모든 인스턴스는 여전히 처음부터 계획됩니다. 이 논문이 가격 매기는 마지막 레버가 바로 그것입니다. 성공한 트레이스를 재사용 가능한 루틴으로 컴파일하는 일, 그리고 어떤 과제 가족을 컴파일할지 정하는 규칙입니다.

핵심 기여: 리플레이와 재플랜을 가격 매기는 닫힌 형태 모델

논문의 첫 기여는 셀프호스트드 GPU 서빙 위에서 컴파일과 해석 실행의 닫힌 형태 비용-품질 모델입니다.

해석 비용은 공유 재송 블록과 계획 블록의 합으로 쓰입니다. 공유 재송 블록은 시스템 프롬프트, 도구 스키마, 스킬 매니페스트로 이루어져 있습니다. 두 실행 체제가 모두 매 턴 다시 보냅니다. 계획 블록은 숙고적 계획의 추론 팽창을 지닙니다. 리플레이는 같은 공유 블록 위에 훨씬 작은 계획 블록을 얹습니다. 알려진 스캐폴드에는 숙고가 필요 없으므로, 팽창 계수는 해석보다 훨씬 작습니다. 컴파일은 일회성 비용입니다. 검증된 성공 트레이스 하나에서 파라미터화 템플릿과 슬롯별 가드, 검증기 게이트를 증류하는 데 드는 비용입니다.

세 가지가 붙습니다. 첫 시계는 슬롯 드프트입니다. 인스턴스 값이 템플릿의 표면 형태로 벗어나면 가드가 울립니다. 슬롯 m개, 슬롯별 불일치 확률 ρ면, 실행당 가드 발화 확률은 1-(1-ρ)^m입니다. 가드가 울리면 폴백이 나갑니다. 쓰던 리플레이 프리픽스의 α 비율과 온전한 해석 비용이 함께 빠져나갑니다. 두 번째 시계는 셔른입니다. 스캐폴드가 루틴의 눈앞에서 바뀌면, 실행당 확률 p_c = μ/λ로 루틴은 무효화되고 재컴파일됩니다. 세 번째는 침묵 실패입니다. 가드를 지난 리플레이도 의미적으로는 틀릴 수 있습니다. 스키마는 통과하고 뜻만 틀린 경우입니다. 무료 결정론 검증기, 스키마와 AST 수준의 검사기가 침묵 실패의 비중 δ를 잡습니다. 잡힌 실패는 비용 η·C_I로 지역 수리를 받습니다. 놓친 비중 (1-δ)·p_s^raw는 토큰 비용 없이 품질 손실로 남습니다.

Compiled execution path of an unattended agent loop 무인 에이전트 루프의 컴파일된 실행 경로 개념도입니다. 검증된 성공 트레이스는 파라미터화 루틴으로 컴파일된 뒤, 재발할 때마다 리플레이됩니다. 슬롯 가드가 드프트를 감지하면 처음부터 해석으로 폴백합니다. 스캐폴드 셔른이 루틴을 무효화하면 재컴파일됩니다. (분석 모델이며 실측이 아닙니다.)

실행당 기대 비용은 E[C_C] = C_I - S(p_m) + p_c·C_comp로 쓰입니다. S(p_m)은 실행당 절감입니다. 수리 비용과, 불일치 시 버려진 리플레이 프리픽스를 뺀 순 절감으로, 드프트 확률 p_m에 대해 선형이고 단조 감소합니다.

네 개의 결과가 이 절감 위에 올라갑니다. 첫째, 컴파일의 브레이크이벤입니다. 컴파일이 엄격히 값지는 조건은 S(p_m) > 0이고 가족의 재발 빈도 λ가 λ* = μ·C_comp / S(p_m)보다 높은 것입니다. (churn, 재발) 평면에서 프론티어는 직선이고 기울기는 C_comp / S(p_m)입니다. 드프트가 절감을 갉아먹으면 직선은 위로 올라갑니다. 같은 규칙의 반대 읽기가 셔른 예산 μ* = λ·S(p_m) / C_comp입니다. 재발이 고정된 상태에서 스캐폴드가 하루에 몇 번까지 바뀌어도 컴파일이 값을 찾는 최대 속도로, 레지스트리 유지보수의 운영 예산으로 읽힙니다.

둘째, SLO의 드프트 천장입니다. SLO가 만족되려면 p_m이 p_m* 이하여야 합니다. 하지만 SLO가 해석 품질 q_I 이하인 범주에서는 p_m*가 1을 넘습니다. 천장은 유탕으로 남습니다.

셋째, economics-first corollary입니다. 폴백이 모든 드프트 수준에서 품질을 해석 수준 이상으로 고정합니다. 그래서 SLO가 해석이 이미 내놓는 품질 이하이면, 배포 경계를 정하는 것은 토큰입니다. 품질은 p_m에 대해 선형으로, 해석 수준 쪽으로 부드럽게 떨어집니다. 기대 비용은 훨씬 가파르게 올라갑니다. 현실적 파라미터에서는 비용 경계가 먼저 도착합니다. 품질이 SLO를 위협하려면 드프트가 한두 자릿수 배 더 커져야 합니다.

Expected per-execution token cost: compiled replay versus clean-slate interpretation 실행당 기대 토큰 비용의 개략도입니다. 드프트가 낮으면 컴파일 리플레이가 해석보다 쌉니다. 드프트가 절감을 갉아먹으면 리플레이 비용이 해석 위로 교차합니다. 교차점은 S(p_m) = 0입니다. 그 왼쪽에서 컴파일을 멈추게 하는 신호는 토큰입니다. (분석 모델이며 실측이 아닙니다.)

넷째, 유한 지평선의 최소 상환 창 W입니다. W = C_comp / (S(p_m) - p_c·C_comp)만큼 실행이 쌓여야 첫 컴파일 비용이 상환됩니다. p_c가 브레이크이벤 셔른 p_c에 가까워지면 W는 무한대로 발산합니다. 브레이크이벤 근처의 루틴은 어떤 유한 창 안에서도 상환되지 못합니다.

이 규칙은 다른 비용 레버와 재도출 없이 합성됩니다. 품질 중립인 공유 비용 레버가 두 체제의 비용에서 같은 액수 κ를 빼면, 절감 S, 브레이크이벤 λ, 창 W는 모두 변하지 않습니다. 프리픽스 캐시 히트 비율 φ가 주는 κ = φ·c_0, 라우팅 결정 스킵 비율 s가 주는 κ = s·C_route가 바로 그 경우입니다. 변하는 것은 절대 가격뿐입니다. 모델 티어와 양자화 레버는 계획 블록을 (1-ψ)로 줄여, S는 (1-ψ)·S로, λ는 λ/(1-ψ)로, W는 W/(1-ψ)로 이동시킵니다. 프론티어의 모양은 그대로입니다. 더 싼 티어일수록 컴파일의 상대 매력은 줄어듭니다. 검증기는 다른 경로로 합성됩니다. 게이트를 강화하면, 잡는 비중 δ가 올라갑니다. 수리 비용 항은 커집니다. 침묵 바닥 (1-δ)·p_s^raw는 낮아집니다. 경제학 우선 범주에서 천장이 유탕이므로, 게이트의 수준을 정하는 것은 침묵 바닥 리스크입니다.

H200 위 14B 예시: 하루 한 번쯤 오는 가족이 컴파일 대상

이 논문은 해석 논문입니다. 이 절의 숫자는 실측이 아니라, 프론티어의 규모를 고정하는 예시 인스턴스화입니다. 단일 H200(141 GB HBM3e)에서 14B급 dense 모델을 서빙하는 설정입니다. 루프당 디코드는 14B FP8, paged KV에서 400 토큰/초 부근입니다. 공유 재송 블록은 2.0k 토큰, 해석은 12.4k, 리플레이는 2.9k 토큰으로 쓰입니다. 원 절감 Δ_0은 9.5k에 둡니다. 슬롯 수는 가족당 4개이고 컴파일 비용 C_comp은 14k 토큰, 곧 해석의 약 1.1배입니다. 침묵 실패 확률은 0.03, 검증기 검출 비중 δ는 0.85, 수리 비용 계수 η는 0.25입니다. 셔른율은 하루 0.5, 가족 도착률은 하루 2, 해석의 1회 성공률은 0.88, SLO는 0.85, 운영 창은 30일입니다.

중간 드프트의 수치를 보겠습니다. 슬롯별 불일치 확률 ρ가 0.06이면, 4개 슬롯 각각이 인스턴스당 약 6% 확률로 템플릿과 어긋나는 상태입니다. 가드 발화 확률 p_m은 약 0.22, 실행당 절감 S는 6.7k 토큰입니다. 브레이크이벤 재발 빈도 λ*는 셔른율 0.5/일 기준 하루 1.04회입니다. 하루 한 번쯤 도착하는 반복 업무는 컴파일 대상입니다. 실행당 순수 절감 S - p_c·C_comp은 약 3.2k 토큰, 디코드 8초가 남습니다. 30일 창 절감률은 해석 예산 744k 토큰 대비 24%입니다. ρ가 0.01이면 절감률은 42%까지 올라갑니다.

드프트는 자기 비용을 단조하게 갚습니다. ρ가 0.01에서 0.15로 오르면, λ는 0.78에서 1.98로, 최소 상환 창 W는 2.6에서 443으로 늘어납니다. 그래서 이 설정, 하루 2회 재발과 30일 창에서 먼저 부딪히는 제약은 상환 창입니다. steady-state 브레이크이벤보다 앞당겨져 부딪힙니다. 창 제약의 컷오프는 ρ ≈ 0.14 부근입니다. 비용이 퇴화하는 지점 ρ^S ≈ 0.30보다 훨씬 안쪽에 있습니다.

Break-even recurrence of routine compilation versus per-slot drift 브레이크이벤 재발 빈도의 개략도입니다. 과제 가족의 도착률이 λ보다 높을 때만 컴파일이 값집니다. λ는 슬롯별 드프트와 스캐폴드 셔른율이 올라갈수록 단조하게 상승합니다. (분석 모델이며 실측이 아닙니다.)

품질 쪽은 처음부터 끝까지 유탕입니다. SLO 0.85가 해석 품질 0.88보다 낮으므로, 천장 p_m*은 1.26으로 1을 넘습니다. q_C는 모든 드프트에서 해석 수준 0.88 이상을 유지합니다. ρ = 0.06에서는 1회 성공률 0.97로, 24% 적은 비용을 쓰면서도 품질은 오히려 오릅니다. 이 범주에서 컴파일의 경계를 정하는 것은 품질이 아니라 토큰입니다. 폴백 옵션이 품질을 해석 수준으로 부드럽게 떨어뜨리기 때문에, 품질이 먼저 무너지는 일은 드프트가 비용 퇴화 지점에 훨씬 못 미칠 때까지 일어나지 않습니다.

토큰이 곧 시간이라는 전제 아래, ρ ≈ 0.06의 각 컴파일 실행은 디코드 약 8초를 되돌려 받습니다. 플릿의 실행 비중 φ_c가 규칙을 통과하는 가족, ρ 0.03~0.10 대역에 속하면, 전체 토큰 예산은 그 비중의 13~25%를 곱한 만큼 줄어듭니다. φ_c = 0.3이면 새 하드웨어 없이 전체 토큰 예산의 4~7% 절감입니다. 예산 항목이 아닌 부수 이익도 있습니다. 컴파일 경로는 과제당 비용을 거의 결정론적으로 만듭니다. 리플레이가 지배하는 경로에서 변하는 것은 폴백과 재컴파일뿐입니다. 같은 과제가 실행마다 한 자릿수 배 이상으로 토큰을 쓰는 실행 간 변동을 눌러, 용량 계획이 다시 평균 속도 문제로 돌아갑니다.

그래서 무엇을 바꾸면 되나: 회사, 사회, 과학

회사에 남는 것은 무인 루프의 컴파일 정책입니다. ThakiCloud AI 플랫폼의 밤샘 자율 루프는 이제 어떤 반복 업무를 스킬 루틴으로 컴파일할지 판단하는 정량 브레이크이벤 규칙을 지닙니다. 재발 업무의 토큰과 시간 지출은 시간 축에서 상환됩니다. Metis 토큰 계수로 직접 재울 수 있습니다. 프론티어의 모든 입력, 재발 λ, 셔른 μ, 슬롯별 드프트 ρ, 운영 창 τ는 생산 하네스가 이미 쓰는 로그에서 읽힙니다. 측정 프로토콜은 이 입력들을 BFCL 스타일의 파라미터화 함수호출 가족과 결정론적 성공 검사 위에 올립니다.

사회에 남는 것은 한계비용의 구조 변화입니다. 재발 업무마다 추론 비용을 처음부터 다시 치르는 구조가, 한 번 검증된 루틴으로 상환되는 구조로 바뀝니다. 완전 자율 업무 자동화의 한계비용을 크게 낮추는 일입니다. 셀프호스트드 GPU 한 대로 온스테이션 에이전트 자동화를 도입하지 못했던 소규모 조직까지, 그 문이 열립니다.

과학에 남는 것은 compiled와 interpreted, 두 실행 체제 사이의 첫 비용-품질 상환 프론티어입니다. 라우팅 결정 캐싱, Cached Router의 두 시계 구조를 트레이스 단위 행동 메모리로 한 단계 확장한 것입니다. Voyager의 정성적 스킬 라이브러리를 재발 빈도와 드프트 축 위의 정량 브레이크이벤 법칙으로 올립니다. Voyager가 스킬 라이브러리가 작동한다는 것을 확립했다면, 이 논문은 언제 값을 찾는지 법칙으로 줍니다.

못 믿을 부분: 해석 논문이고 네 가지 한계가 있습니다

첫째, 이 논문은 해석 논문입니다. 프론티어는 닫힌 형태 규칙입니다. H200 절의 숫자는 그 모델의 예시 인스턴스화이며 실측이 아닙니다. 각 수량이 측정되는 실험 설계는 측정 프로토콜 절에서 명시되어 있습니다. 10개 이상의 파라미터화 함수호출 가족, ρ 0.01~0.25 드프트 스윕, 하루 0.2/0.5/1.0 셔른 스케줄, 같은 서빙 인스턴스 위의 두 arm 교착 실행입니다. 30일 창 기준의 성공 기준도 고정됩니다. 절감은 90~110% 이내에, 브레이크이벤 재발 빈도는 1.3배 이내에, 품질은 0.02 이내에 측정되어야 합니다.

둘째, 채널 독립성 가정입니다. 슬롯 드프트와 스캐폴드 셔른은 조건부 독립으로 모델링됩니다. 자기 진화 레지스트리에서는 셔른이 관측된 과제 표현에 키를 잡을 수 있습니다. 두 채널이 결합하면 이 프론티어는 실제 비용 증가의 하한으로 읽어야 합니다. 규칙은 창을 축소해 적용해야 합니다.

셋째, 비용 모델의 구조적 이상화입니다. 가드 검출 시점 α = 1, 늦은 감정은 보수적인 선택입니다. 세분된 가드는 가드 토큰을 초기 수리로 바꾸는 거래입니다. C_comp은 가족당 상수로 잡힙니다. 실제로는 스캐폴드 길이와 슬롯 수와 트레이스 새로움에 비례해 커집니다. 단일 트레이스에서 증류한 루틴은 그 트레이스의 표면 형태에 과적합해, 침묵 실패율을 높일 수 있습니다. 컴파일 비용이 해석을 크게 넘는 가족은 어떤 현실적 재발에서도 λ* 위에 남습니다. 규칙은 이를 자동으로 압니다. 셔른 감지는 즉시로 가정됩니다. L 실행 만큼 지연되면, 품질 리스크는 침묵 바닥으로 유계됩니다. 비용 리스크는 L·p_m·α·C_R로 유계입니다. 검증기가 방패입니다.

넷째, 회계의 범위입니다. 1회 시도 토큰 비용만 가격 매깁니다. 침묵 실패의 하류 인시던트 비용은 제외됩니다. 그 리스크는 검증기 수준 δ가 통제합니다. 단일 셀프호스트드 인스턴스 전제입니다. 클라우드 API 가격 제도는 절대 가격을 바꾸지만 규칙은 바꾸지 않습니다. 다중 루틴 가족과 가족 간 루틴 공유는 열린 확장입니다.

한 번 성공한 반복 업무는 자산입니다. 처음부터 다시 계획하는 것은 매번 비용입니다. 이 논문의 법칙은 그 사이를 토큰 단위로 가격 매깁니다. 컴파일할 가족, 재컴파일할 시점, 해석에 남길 가족을 정하는 규칙입니다.

논문 원문과 데이터: https://huggingface.co/datasets/thaki-AI/daily-paper-2026-10-06-compiled-routine-agent-loops-amortization

이 글 공유하기

태그: amortized-inference-cost, cost-quality-frontier, fallback-to-interpretation, h200-serving, parameter-substitution, procedural-memory, routine-compilation, skill-ecosystem, trace-replay, unattended-agent-loops

카테고리:

업데이트: