무인 에이전트 루프는 어떤 도구로 실행할지 라우터에게 맡깁니다. 무인 루프를 돌리거나 그 청구서를 책임지는 클라우드·AI 엔지니어면 이 글의 독자입니다. 작업은 같은데 문장만 조금 바뀌면 실행되는 도구가 다른 것이 될 수 있습니다. 그 흔들림은 무인 루프에서 조용히 청구됩니다. ThakiCloud의 오늘 논문은 그 흔들림에 가격표를 씁니다. 라우터는 수천 개의 스킬 레지스트리에서 스킬 하나를 골라 줍니다. 결정은 한 번뿐이고 실수를 잡아 줄 사람이 없습니다. 이 논문은 선택이 이렇게 흔들리는 라우터를 ‘변덕스러운 라우터’라고 부릅니다.

변덕스러운 라우터: 같은 의도가 다른 문장이 될 때, 스킬이 흔들리는 대가 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

쉽게 말하면: 잘못된 주방으로 가는 주문서

주방이 1,600개 이상인 식당을 상상해 보십시오. 주문 전담 스태프는 주문서를 읽고 올바른 주방에 전달합니다. 같은 요리를 다른 말로 시키면 주문서는 다른 주방으로 갈 수 있습니다. 주문은 같은데 받는 셰프가 달라지는 것입니다. 논문의 변덕스러운 라우터(fickle router)가 바로 이 주문 전담 스태프입니다.

논문은 문장이 바뀌어도, 같은 요리가 같은 주방으로 전달되는지 묻습니다. 즉, 사람 말로는, 잘못된 주방으로 간 주문서 한 장당 비용이 얼마인지가 이 논문의 질문입니다.

fickle-router-paraphrase-instability 슬라이드 1

문제의식: 흔들림을 보지 못하는 정확도

라우터 성능은 보통 숫자 하나로 보고합니다. 고정된 쿼리에서 최고의 스킬을 한 번 고르는 정확도입니다. 그 숫자는 각 쿼리를 하나씩 얼려서 봅니다. 흔들림은 같은 의도의 두 쿼리 사이의 차이입니다. 그래서 쿼리 단위의 정확도에서는 보이지 않습니다.

흔들림은 무인 루프에 세 방향으로 들어옵니다. 사용자가 요청을 다시 쓰고 윗 단계가 재작성하며 번역이 의도를 보존합니다. 이것들은 모두 의도를 보존한 패러프레이즈(paraphrase)입니다. 그 순간 top-1이 바뀌면 잘못된 도구가 실행됩니다. 의도가 ‘보관’이었을 때 ‘삭제’로 읽혀도 아무도 알아채지 못합니다. 잘못된 도구가 돌고 그 비용이 청구됩니다. 흔들림은 무인 루프의 조용한 청구서입니다.

앞선 논문 ‘Quantizing the Gatekeeper’는 같은 혼합 점수의 모델 쪽을 보았습니다. 임베딩 모델을 압축하면 점수가 얼마나 움직일 수 있는지를 보였습니다. 이 논문은 축을 입력 쪽으로 옮깁니다. 쿼리가 의미 보존 패러프레이즈로 재작성될 때 결정이 얼마나 안정적인지 묻습니다. 쓰는 점수는 같습니다. 키워드 일치 점수(BM25)와 의미 유사도 점수(임베딩 코사인)를 가중 합한 혼합 점수입니다.

fickle-router-paraphrase-instability 슬라이드 2

핵심 기여: 흔들림에 가격을 매긴다

첫 번째 기여는 흔들림을 횟수가 아니라 비용 단위로 재는 것입니다. top-1 스킬의 변화는 모두 같지 않습니다. 같은 일을 하는 무해한 등가 스킬, 시작하고 나서 다시 하게 만드는 스킬, 완전히 다른 스킬이 있습니다. 논문은 이 변화를 플립(flip)이라 부르고 세 범주로 나눕니다.

플립 분류별 하류 비용 플립 3범류를 하류 비용으로 나란히 그린 그림입니다. 무해한 등가 범류는 비용이 0이고 비용 높은 재실행 범류는 그 중간이며 해로운 오배송 범류가 가장 큽니다. (해석 모델이며 실측이 아닙니다)

각 플립을 이 비용으로 가중해 평균한 지표를 불안정 질량(instability mass)이라 합니다. 패러프레이즈 패밀리 하나당 라우터에게 평균 얼마의 비용이 드는지를 묻습니다. 평균 플립률에 플립당 평균 비용을 곱하면 신뢰성 세금(reliability tax)이 됩니다. 무인 루프가 흔들림을 치르는 대가입니다.

두 번째 기여는 무인 루프의 비용 항등식입니다. N개 과제를 돌리면 기대 총비용은 과제 수에 기본 비용 더하기 신뢰성 세금을 곱한 값이 됩니다. 무인 상태에서는 그 청구서가 보이지도 않고 책임지지도 못합니다. 오배송의 비용은 잘못된 스킬 위에서 실행이 깊어질수록 커집니다.

fickle-router-paraphrase-instability 슬라이드 3

흔들림이 일어나는 때: 마진이 얇은 곳뿐

논문의 핵심은 플립이 언제 일어나는가의 기하입니다. top-1 스킬 점수와 2위 스킬 점수의 차이를 마진(margin)이라 합니다. 논문의 경계는, 플립이 마진이 패러프레이즈로 점수를 움직일 수 있는 범위 안에 있을 때만 일어난다는 것을 보여 줍니다.

패러프레이즈 패밀리 위의 top-1 대 top-2 혼합 점수 원문장과 멀어질수록 top-1 스킬 점수는 내려가고 2위 스킬 점수는 올라가는 그림입니다. 두 선이 교차하는 곳에서 2위 스킬이 top-1을 앞섭니다. 마진이 흔들림 반경 안에 있을 때만 플립이 일어날 수 있습니다. (해석 모델이며 실측이 아닙니다)

즉, 사람 말로는, 두 주방의 간격이 좁으면 문장으로 주문서 행선이 바뀔 수 있습니다. 간격이 크면 어떤 재작성으로도 행선이 바뀌지 않습니다. 흔들림은 근소한 차이쌍이 몰린 곳에 집중됩니다.

이 위에 논문의 최적 안정성 게이트(stability gate)가 올라갑니다. 마진이 두꺼우면 바로 라우팅합니다. 얇으면 LLM이 재확인하고 행동을 다시 도출합니다. 최적 임계값은 재확인하면 아낄 플립 비용과 재확인 비용이 서로 같은 지점입니다. 얼마나 지켜 봐야 하는가의 답입니다.

입력이 흔들리고 모델도 흔들리면 경계는 결합합니다. 두 흔들림 반경은 더해지고 안전 마진은 그 합에 맞춰야 합니다. 하나의 노브로 두 흔들림을 따로 흡수할 수 없습니다.

fickle-router-paraphrase-instability 슬라이드 4

그래서 무엇을 바꾸면 되나

회사에겐 야간 자기 진화 루프의 새 축이 됩니다. 루프는 라우팅 시점에 마진을 읽고 아끼는 비용이 더 큰 곳에만 재확인 예산을 씁니다. 신뢰성 세금은 로컬 라우트 평가 하네스(sra_bench/route_bench) 위에서 줄일 수 있는 숫자가 됩니다.

사회에겐 완전 자율 워크플로의 신뢰성 신호가 됩니다. 문장으로 결정이 흔들리면 그 흔들림은 예기치 않은 비용 초과와 잘못된 스킬 실행으로 청구서에 나타납니다. 이를 재면 운영자가 관리할 수 있는 것으로 만듭니다.

과학에겐 새로운 축의 분리입니다. 확률 보정은 고정 쿼리에서 예측 확률이 얼마나 믿을 만한가를, 정확도는 한 방에 얼마나 맞으냐를 다룹니다. 같은 일을 다른 문장으로 했을 때의 흔들림은 그 둘과 다른 축입니다. 논문은 이 축에 지표, 경계, 비용 항등식, 게이트까지 줍니다.

못 믿을 부분

이 논문은 해석 연구입니다. 지표를 정의하고 정리를 증명하며 감사 프로토콜은 지정으로 남깁니다. 논문의 모든 그림은 해석 모델이며 실측이 아닙니다.

감사는 세 번째 기여로 지정됩니다. 측정 프로토콜은 반증 가능한 가설 5개를 미리 씁니다. 가설의 예로, 흔들림이 마진이 얇은 곳에 집중되는지, 세금이 해로운 소수가 좌우하는지, 최적 게이트 임계값이 흔들림 반경 안에 있는지를 들 수 있습니다.

이론의 두 흔들림 반경은 가정입니다. 주어진 임베딩 모델과 BM25에서 성립하는지는 검증으로 넘깁니다. 케이스당 패러프레이즈 변형 8개로, 드문 표현은 덜 잡힐 수 있습니다.

비용 모델은 1차입니다. 한 과제 안에서 여러 흔들림이 일어나는 상호작용은 넣지 못합니다. 결과는 한국어-영어 1,600개 스킬 레지스트리라는 특정 레짐에서이고 그대로 옮겨지지 않을 수 있습니다.

의도를 보존하는 패러프레이즈를 고르는 필터도 완벽하지 않습니다. 의미가 살짝 흐른 변형을 들일 수 있고 유효한 패러프레이즈를 떨어뜨릴 수 있습니다. 그러면 불안정 질량과 신뢰성 세금에 편향이 생깁니다. 편향 방향은 정해져 있지 않습니다.

그래도 결론은 단단합니다. 흔들림은 마진이 얇은 곳에서만 일어날 수 있고 무인 루프의 청구서는 이제 비용 단위로 읽을 수 있습니다.

논문 원문과 데이터: https://huggingface.co/datasets/thaki-AI/daily-paper-2026-09-29-fickle-router-paraphrase-instability

태그: 에이전트 하네스, decision-instability, paraphrase-robustness, retrieval-stability, routing-reliability, semantic-equivalence, 스킬 라우팅, sra-bench, top-1-flip-rate, unattended-automation

카테고리:

업데이트: