플래너의 배당: 계획이 반응형 실행을 이기는 임계 지점
에이전트가 과제를 끝내는 데 걸리는 단계 수가 임계 값을 넘으면 그때그때 대응하는 것보다 시작 전에 전체 계획을 세우는 쪽이 토큰을 이깁니다. 셀프호스티드 GPU에서 무감시 에이전트 루프를 돌리거나 그 비용 청구서를 책임지는 엔지니어라면 이 한 줄이 곧 설계 원칙입니다. 그 이유는 임계 값이 논쟁이 아니라 계산으로 나오기 때문. 이 글은 ThakiCloud의 논문 ‘플래너의 배당’을 소개합니다.
글의 핵심 개념을 형상화했습니다.
쉽게 말하면: 내비게이션을 켤 시점
먼 길을 가려면 세 가지 방법이 있습니다. 지도 없이 처음 느낌으로 한 번에 달려가는 것, 매 교차로에서 표지판을 보며 그때그때 판단하는 것, 출발 전에 내비게이션에 전체 코스를 입력해 두고 이후 내비게이션을 따라가는 것입니다. 첫 번째는 갈수록 길을 잃습니다. 두 번째는 매 교차로마다 지난 길을 다시 떠올려야 하는 셈입니다. 세 번째는 초반에 코스 입력 비용만 치릅니다. 그러면 이후 모든 교차로를 싸게 지납니다.
코스가 길어지면 세 번째의 초반 비용은 회수되는 것입니다. 근출장이라면 아깝습니다. 장거리에서는 내비게이션이 표지판 운전을 이깁니다. 논문의 질문은 바로 이 회수 시점. 에이전트의 언어로 이 거리는 과제를 끝내는 데 걸리는 단계 수가 됩니다. 내비게이션은 계획 호출, 표지판 운전은 단계별 반응, 무계획 직주는 한 번의 호출에 각각 대응합니다.

문제의식: 계획 켜기는 경험칙의 영역
무감시 에이전트 루프에서는 모든 과제가 고정된 에이전트 프리픽스를 안고 들어옵니다. 시스템 프롬프트, 스킬 매니페스트, 툴 스키마가 그 프리픽스이고 각 모델 호출은 프리필과 디코디 토큰으로 청구됩니다. 이 청구서에서 가장 큰 레버는 계획 정책입니다. 과제를 무계획으로 한 번에 처리할 것인가, 단계마다 반응할 것인가, 시작 전에 전체를 계획할 것인가의 문제입니다.
반응형 ReAct가 기본값이었고 계획 후 실행(plan-then-execute)은 대안이었습니다. 둘 중 무엇을 켤지는 각 하니스가 자기 경험대로 정합니다. 최근 근거는 두 진영 모두에서 단편적입니다. 웹 에이전트는 계획 후 실행이 기본값이어야 한다는 주장, 타입이 정해진 행동 공간에서는 반응형이 충분하다는 주장, 여섯 가지 패러다임을 18,000회 실행해 어느 쪽도 지배하지 않는다는 측정까지 모두 있습니다.
이 논의가 전부 품질에 머물렀다는 것이 공통점입니다. 비용까지 합치고 과제가 몇 단계인지에 따라 가격 차이가 어떻게 달라지는지는 아무도 답하지 않았습니다. 계획과 반응의 선택에는 프런티어가 없고 임계 값도 계산되지 않은 상태입니다.

무엇을 해봤나: 세 방식의 토큰 가격과 성공률
이 논문은 세 구성의 토큰 비용과 성공률을 단계 수 H의 함수로 닫힌 형태에 씁니다. 세 구성은 무계획 직전, 반응형 ReAct, 계획 후 실행(PTE)입니다. 무계획 직전은 한 번의 호출로 전체 경로를 씁니다. ReAct는 H번의 호출로 단계마다 판단하고 PTE는 계획 호출 한 번에 실행 호출 H번을 더합니다.
성공률에서는 둘의 감소 속도가 다릅니다. ReAct의 성공률은 단계 수의 제곱만큼 빠집니다. 매 호출이 이전의 모든 맥락을 다시 읽고 쌓인 맥락이 과제의 신호를 덮기 때문입니다. PTE의 감소는 1차에 머뭅니다. 고정된 계획이 맥락에 남아 있고 계획이 단계마다 해야 할 일을 줄여 주기 때문입니다.
한 번의 시도 당 비용에서는 반대로 PTE가 가장 비쌉니다. 계획 호출 자체의 비용이 먼저 들어오기 때문입니다. 단계 수가 늘면 이야기가 반전됩니다. 계획이 단계별 숙고를 줄여 주고 쌓이는 맥락도 작아지므로 PTE는 ReAct보다 싼 쪽으로 넘어섭니다. 그 교차점이 비용 브레이크이벤 13.8입니다.
계획 구성별 1시도 당 토큰 비용입니다. 계획 후 실행은 계획 호출 때문에 처음엔 가장 비쌉니다. 단계 13.8 부근에서 반응형 ReAct보다 싼 쪽으로 넘어선 뒤, 차이는 계속 벌어집니다. 무계획 직전은 1시도 당으로는 가장 싸지만 성공률이 단계 수와 함께 무너지기 때문에 전달 비용 프런티어를 지킬 수 없습니다. (해석 모델의 예측이며 실측이 아닙니다.)
나온 결과: 두 운영 방식, 두 임계 값
토큰 청구는 성공해서 전달된 과제당 가격으로 봐야 합니다. 재시도는 허용되지만 성공한 것만 전달되는 운영에서는 가장 싼 방식이 바뀌는 접곡이 13 부근으로 나옵니다. 13보다 짧은 과제에서는 무계획 직전이 가장 쌉니다.
계획 구성별 과제당 기대 전달 비용입니다. 재시도 허용 운영(Regime I)의 값이며 무계획 직전이 가장 싼 팔은 프런티어 인계점인 단계 13 부근, 엄밀한 접곡 값 12.95까지 유지합니다. 그 뒤에는 계획 후 실행이 프런티어 팔이 되고 반응형 ReAct는 단계 2부터 프런티어 밖으로 밀려나기도 합니다. (해석 모델의 예측이며 실측이 아닙니다.)
13보다 긴 과제에서는 PTE가 가장 싼 쪽으로 넘어섭니다. 그리고 ReAct는 단계 2부터 한 번도 가장 싼 적이 없습니다. 재시도 허용 운영에서는 ReAct가 비용과 품질을 합친 프런티어 밖, 즉 접곡에서 완전히 밀려난다는 뜻입니다.
즉, 사람 말로는, 표지판 운전은 짧은 거리에서야 경쟁력이 있습니다. 거리가 길어지면 내비게이션이 돈을 덜 쓰고 길을 덜 잃습니다.
단 한 번의 시도로 성공률 0.9를 보장해야 하는 운영에서는 차이가 더 극적입니다. PTE가 ReAct를 제치는 접곡은 단계 8로 앞당겨집니다.
단일 시도 성공률 목표 0.9에서의 가능 단계 수 천장입니다. ReAct의 성공률은 단계 수의 제곱만큼, 계획 후 실행은 1차만큼 감소하기 때문에 계획 후 실행이 ReAct보다 약 5배 넓은 작업 지대를 지킬 수 있습니다. 명목 가정의 엄밀한 천장 값은 ReAct 7.26, 계획 후 실행 35.12입니다. (해석 모델의 예측이며 실측이 아닙니다.)
이것의 이유는 성공률 감소 곡선입니다. ReAct의 성공률은 단계 수의 제곱에 비례해 빠지지만 PTE는 1차에 머뭅니다.
그래서 ReAct가 성공률 0.9를 지킬 수 있는 최장 단계 수는 7 안팎입니다. PTE는 35 안팎까지 갑니다. 5배 가까운 차이입니다.
성공률 목표를 1포인트 더 확보하는 데 드는 한계 비용도 벌어집니다. 같은 명목 전제, 단계 16에서입니다.
ReAct는 21,932토큰을 쓰지만 PTE는 6,003토큰이면 됩니다. 3.7배 차이입니다.
즉, 사람 말로는, 장거리에서 표지판 운전은 돈이 들뿐 아니라 길을 더 잃습니다. 내비게이션은 초반 코스 입력 값만 더 드는 쪽입니다.

그래서 무엇을 바꾸면 되나: 단계 수를 보면 된다
운영자 규칙은 한 줄입니다. 내비게이션을 켤 시점은, 코스 길이, 즉 예상 단계 수를 보면 됩니다. 과제를 내보내기 전에 메타데이터에서 예상 단계 수를 읽고 임계 값을 넘으면 계획 호출을 켜는 것입니다. 재시도 허용 운영이면 단계 13부터이고 단일 시도 0.9 운영이면 단계 8부터입니다.
두 실수는 대칭적이지 않습니다. 필요 없는 계획을 켜는 실수는 한 번의 계획 호출 비용, 즉 상한 있는 비용입니다. 필요할 때 안 켜는 실수는 다릅니다. 플래너의 배당은 단계가 길수록 커지고 상한이 없으므로 안 켠 대가는 계속 불어납니다. 단일 시도 운영에서는 임계 값을 넘으면 ReAct가 목표 성공률을 맞추기 위해 필요한 재시도가 급증해 사실상 운영 불가능해집니다.
이 계산이 틀렸는지 확인하는 방법까지 논문에 적혀 있습니다. 같은 모델, 같은 하니스, 같은 온도에서 계획 호출만 켜고 끄며 세 팔을 비교하는 실험입니다. 브레이크이벤 13.8이 예측 구간 밖으로 벗어나거나 ReAct가 재시도 운영에서 두 개 이상의 단계 구간에서 가장 싼 것으로 나오면 모델은 반증됩니다.

회사가, 사회가, 과학이 얻는 것
ThakiCloud에 이건 운영 규칙입니다. 생산 무감시 에이전트 루프에서 단계 13을 넘는 과제에는 계획 호출을 켜면 됩니다. 신뢰도를 지키면서 토큰 지출을 줄이는, 이제 경험칙이 아니라 계산으로 뒷받침된 기준입니다.
사회적으로는 더 싼 장거리 자동화입니다. 토큰이 줄면 전기도 줄고 긴 작업을 도맡는 자율 에이전트 시스템이 더 많은 팀과 서비스로 퍼질 수 있습니다.
과학적으로는, 계획이라는 축에 첫 비용-품질 프런티어가 생기는 것입니다. 반응형인지 계획형인지를 고르는 논쟁은 과제가 몇 단계인지라는 변수로 가격화됩니다. 이 논문은 ReAct의 정성적 지위를 측정 가능한 프런티어로 승격시키는, ReAct에 대한 명시적 업그레이드로 끝납니다.
못 믿을 부분
이 논문은 해석 논문입니다. 이 글의 모든 수치는 명시된 명목 가정에 대한 닫힌 형태 예측이며 실측이 아닙니다.
가장 불안한 지점은 무계획 직전의 실수 누적 속도를 어떻게 잡느냐입니다. 한 번의 호출 안에서는 관측 피드백이 없으므로 단계 간 실수가 이 속도로 겹쳐집니다. 이 매개변수에 앵커가 가장 약하고 값이 어긋나면 접곡 위치가 이동합니다. 반증 기준이 정확히 이 지점을 겨냥하고 있습니다.
프런티어가 가격에 넣지 않은 이득도 있습니다. 프롬프트 인젝션에 노출된 환경에서는 고정된 계획이 제어 흐름의 경계가 되어 안전성이 올라갑니다. 그런 환경에서는 이득이 비용보다 커지므로 임계 값을 더 짧은 단계 쪽으로 당겨야 합니다.
외부 연구가 패러다임의 이점이 과제에 의존한다고 한 것도 기억해 둬야 합니다. 이 모델에서 과제를 라우팅하는 변수는 단계 수이지만 관찰이 적고 상태가 예측 가능한 과제는 무계획 직전 쪽으로 밀립니다.
즉, 이 계산은 3팔 실험이 실제 H200에서 돌기 전까지는 예측일 뿐입니다. 다만 틀려야 할 지점이 이미 정해져 있는 예측이라, 그 결과를 지켜보면 됩니다.
논문 원문과 데이터: https://huggingface.co/datasets/thaki-AI/daily-paper-2026-09-26-planning-vs-reactive-cost-frontier