스킬·도구·서브에이전트 레지스트리의 BM25 계열 어휘 검색기를 만들거나 운영하는 엔지니어라면 이 글을 읽어야 합니다. 검색 점수에 임계값을 걸고 컨텍스트를 주입하는 구조라면 더더욱 그렇습니다. 어휘 기반 리트리벌에서 토큰을 정의하는 정규 표현식은 검색이 닿는 세계 전체를 정의합니다. 그 정규식에 없는 문자는 검색이 아예 인지하지 못합니다. ThakiCloud AI Research의 자율 연구 논문 ‘Script-Blind Retrieval’은 프로덕션 스킬 라우터 하나를 상대로 이 경계를 실측한 감사입니다. 1,911개 항목의 코퍼스, ASCII 전용 토크나이저, 6.0점 주입 게이트가 그 구조입니다. 감사의 시점은 2026년 8월 14일 한글 2자 바이그램 패치가 출하된 직후입니다. 이 논문은 그 패치가 한자와 가나에 일반화되는지를 묻고 그 일관화가 안전한지를 코드 격리된 세 조건으로 비교합니다. 답은 두 줄입니다. 정규식 한 줄의 문자 클래스 확장이 한자 쿼리의 Top-1을 0.0%에서 95.24%로 되살립니다. 그 확장을 ‘일관된’ 형태로까지 마치면 회귀 스위트는 그대로 통과합니다. 한자 요청에 대한 실제 주입 능력은 76포인트 빠지지만 랭킹 지표에는 그 흔적이 거의 없습니다.

검색의 경계를 정의하는 토크나이저 정규식

프로덕션 에이전트 하네스의 라우터 첫 단계는 거의 항상 어휘 기반입니다. BM25 변종이거나 IDF 가중 터미널 오버랩 스코어입니다. 싼 데 콜드 스타트가 없고 디버깅이 쉬워서입니다. Skill Retrieval Augmentation(SRA)이 이 패턴을 정형화했고 레지스트리가 커질수록 라우팅이 1급 엔지니어링 문제가 된다는 것도 여러 시스템 연구가 확인했습니다. 어휘 검색은 실패할 때까지 보이지 않는 전제를 물려받습니다. 토큰을 정의하는 정규식이 곧 그 라우터가 검색으로 도달할 수 있는 전체 공간이라는 전제입니다.

감사 대상은 ThakiCloud의 Claude-Code 기반 에이전트 하네스가 매일 사용하는 스킬 검색 컴포넌트입니다. 688줄짜리 단일 파이썬 모듈입니다. 스킬 정의 파일, 서브에이전트 정의, 금융 서비스 플러그인 카탈로그를 하나의 평탄한 코퍼스로 색인합니다. 2026년 8월 15일 기준 1,911개 항목이고 밑에 있는 정의 파일은 1,823개입니다. 차이는 이중 이름 앨리어싱에서 옵니다. frontmatter 이름과 디렉토리 이름이 다르면 둘 다로 색인되는 경우입니다. 스코어링은 손으로 만든 IDF 가중 오버랩입니다. 쿼리 토큰이 후보의 이름을 통째로 맞추면 3.0×idf, 이름 부분 문자열이면 2.0×idf, 일반 토큰 집합에 속하면 1.0×idf를 누적합니다. 문구와 부분 문자열 보너스가 그 위에 얹히고 이름 완전 매칭은 무조건 플러스 5.0을 줍니다. IDF 항은 토큰의 코퍼스 내 문서 빈도를 0.5~1.5 범위의 가중치로 대사합니다.

이 라우터에서 결과를 좌우하는 것은 게이트입니다. 점수가 GATE_MIN = 6.0 이상인 후보만 호출한 에이전트의 컨텍스트에 주입됩니다. 5.9점으로 1위를 해도 에이전트의 눈에는 검색되지 않은 것과 동일합니다. 랭킹 리콜과 게이트 통과 리콜은 별개의 질문입니다. 이번 감사는 두 질문이 하나의 스코어링 변경 아래에서 정반대의 답을 줄 수 있음을 보여 줍니다.

8월 14일 유지보수자가 두 커밋을 올렸습니다. 첫 커밋은 한글 음절 블록(U+AC00~U+D7A3)의 2자 이상 연속을 겹치는 2자 단위로 쪼개는 추출기를 추가한 것입니다. 형태소 분절기가 없는 상황에서 CJK 계열 텍스트를 색인하는 표준 방식입니다. 두 번째 커밋은 그 2자 한글 바이그램의 가중치를 0.35로 할인하는 프래그먼트 신뢰 할인을 도입했습니다. 바이그램이 단어 전체보다 신뢰도가 낮아 전체 가중치로 두면 한국어 쿼리가 과매칭한다는 판단에서입니다. 엔지니어링 로그의 수치는 시스템의 변경 히스토리가 남긴 증거입니다. 자체 골드 벤치에서 Top-1이 40.0%에서 42.2%로, 게이트 Recall@5가 66.7%에서 68.9%로 올랐다는 기록이며 논문은 그것을 형식적 아블레이션으로 취급하지 않습니다.

라우터는 약 230개 항목의 한국-영어 동의어 사전도 함께 몰고 다닙니다. 2026년 6월 이후, 특정 검색 놓침을 막기 위해 만들어졌다는 날짜 달린 주석과 함께 하나씩 쌓인 것입니다. 중국어 항목은 0입니다. 일본어 항목도 0입니다. 사람 관찰 하나, 진단 하나, 커밋 하나로 한 항목씩 만들어지는 열거형 다국어 브리지는 노동 집약적이고 수렴하지 않습니다.

이 감사의 질문은 그 직후에 놓입니다. 한글을 고친 패치가 한자와 가나에도 일반화되는지를 묻고 그 패치를 내부적으로 일관되게 만드는 것이 안전한지를 묻습니다. 일관되게 만든다는 것은 0.35 할인을 한자·가나 바이그램에도 똑같이 적용하는 것을 뜻합니다. ThakiCloud의 이전 진단 연구가 이 하네스에서 병목이 리트리버 쪽이라고 세웠습니다. 야간 자율 수리 루프 연구는 그 수리를 인간 엔지니어에게 넘겼습니다. 이 논문은 그 엔지니어가 실제로 출하한 것을 감사하는 것입니다.

세 조건, 한 줄의 차이

감사는 코드 격리 상태로 세 가지 토크나이저 조건을 비교합니다. 실험 하네스가 라이브 라우터 모듈을 조건마다 importlib로 한 번씩 가져와 독립적인 모듈 객체를 만듭니다. 어떤 조건에든 땜을 박아도 다른 조건으로 새지 않습니다. 색인 빌드 진입점만 호출하고 색인 로드 진입점은 불러들이지 않습니다. 디스크 위의 프로덕션 인덱스 캐시는 실험 내내 읽히지도 쓰이지도 않습니다. 감사 대상은 출하된 소스 그 자체입니다. 출하 상태는 손대지 않습니다.

baseline은 8월 15일 출하된 그대로입니다. ASCII 메인 정규식, 한글 전용 바이그램 추출기, 0.35 할인이 적용된 상태입니다. cjk_naive는 최소 수정입니다. 추출기의 문자 클래스를 한글에서 CJK 통합 한자(U+4E00~U+9FFF), 히라가나(U+3040~U+309F), 가타카나(U+30A0~U+30FF)로 확장합니다. 정규식 한 줄의 변경입니다. 0.35 할인은 그대로 두어 한자·가나 바이그램은 전체 IDF 가중치로 점수화됩니다. cjk_full은 원칙적 평등 수정입니다. 같은 확장 위에 할인 판정 조건을 일반화합니다. ‘2자 한글 바이그램인가’였던 조건이 ‘한글·한자·가나 범위에 모두 속한 2자 바이그램인가’가 됩니다. 한자·가나 바이그램도 0.35로 할인합니다. 최소 수정을 리뷰한 엔지니어가 같은 현상인데 상수만 다르다고 판단하고 내부를 일관되게 만드는 위생적 변경이 정확히 이것입니다.

두 조건 모두 메인 ASCII 정규식과 스탑워드 집합을 건드리지 않습니다. ASCII만 들어 있는 쿼리와 문서의 토큰 집합과 가중치는 세 조건에서 바이트 동일합니다. 이 동등성은 실험에서 나온 값이 아닙니다. diff 자체의 구조적 성질입니다.

평가 표면은 셋입니다. 구조 감사는 1,911개 항목 전체에서 CJK 우세 항목을 찾습니다. 전체 설명에 한자·가나가 8자 이상 들어 있는 항목입니다. 각 조건에서 구조적 블라인드가 몇 개인지를 셉니다. 구조적 블라인드는 이름과 디렉토리 이름에서 파생되는 토큰 외에 설명이 단 한 개도 기여하지 못하는 상태입니다. 이런 항목은 자기 이름을 이미 아는 사람에게만 검색될 수 있습니다. 라우터의 존재 이유가 무너집니다. CJK 쿼리 평가는 손으로 쓴 만다린 태스크 쿼리 21개를 사용합니다. 각각 해당 스킬 정의 파일과 대조해 검증된 골드로 매핑됩니다. 회귀 평가는 라우터의 기존 공식 골드 벤치, 한국어 프로덕션 쿼리 45개를 손대지 않고 실행합니다. 21개 쿼리는 골드의 설명에 있는 고유명사와 영역어를 재사용합니다. 분석기 없는 바이그램 인덱스가 도달할 수 있는 현실적 상한에 가깝습니다. 최악 케이스는 아니지만 라우터에 맞춘 것도 아닙니다. 쿼리는 어떤 조건도 돌리기 전에 고정됐습니다.

실패의 중심, 쿼리 쪽

코퍼스 전체 구조 감사는 ‘CJK 설명이 도달 불가능하다’는 가설을 약하게만 지탱합니다. CJK 우세 항목 59개 중 baseline에서 구조적으로 블라인드인 것은 2개, 3.4%뿐입니다. 그것도 같은 스킬의 두 이름 앨리어스, 85자 설명이고 그중 한자가 66자인 한 스킬입니다. ASCII 정규식과 한글 전용 추출기가 둘 다 그 설명을 쪼개기를 거부하면 남는 토큰은 이름에서 파생된 3개뿐입니다. cjk_naive와 cjk_full에서는 59개 중 구조적 블라인드가 0개입니다.

Structurally Blind Skills: Baseline vs CJK-Fixed Conditions 1,911개 항목 중 CJK 우세 59개(전체 설명에 한자·가나 8자 이상)를 감사한 결과, 출하된 baseline에서 설명이 단 한 토큰도 기여하지 못하는 구조적 블라인드는 2개(3.4%)뿐이었습니다. 두 CJK 조건에서는 모두 0으로 복원됩니다. 논문의 로컬 벤치 하네스 실측이며 하이브리드 리랭은 모든 조건에서 꺼져 있고 프로덕션 인덱스 캐시는 읽지도 쓰지도 않았습니다.

진짜 실패는 토크나이징 탐사가 다른 위치에서 잡아냅니다. baseline에서 순수 한자 쿼리 ‘哔哩哔哩视频下载转录成文字’(비리비리 동영상을 내려받아 문자로 전사하는 태스크)를 토크나이징하면 토큰은 빈 집합입니다. ASCII 문자가 하나도 없기 때문입니다. 쿼리 토큰이 없으면 스코어링 함수는 1,911개 항목 전부에서 0을 반환합니다. 리트리버는 후보를 아무것도 내놓지 않습니다. 랭킹 오류가 아니라 완전한 무응답이고 색인에 무엇이 들어 있어도 마찬가지입니다. cjk_naive에서는 같은 쿼리가 11개 바이그램으로 토크나이즈됩니다. 哔哩, 视频, 下载, 转录, 文字, 频下 같은 11개 단위로 정답 스킬이 1위가 됩니다.

모든 쿼리가 이토록 깨끗하게 실패하지는 않습니다. 21개 중 하나인 ‘知乎视频转录保存成markdown笔记’(질후 동영상을 전사해 markdown 노트로 저장하는 태스크)는 ASCII 외래어 ‘markdown’을 품고 있어 baseline도 top-3를 내놓습니다. 그 top-3에는 골드가 없습니다. 우연히 하나의 일반적 토큰에 맞는 무관한 항목이 들어찹니다. 혼성 스크립트 쿼리는 내장된 ASCII를 통해 최악의 경우에서 부분 탈출하지만 정답으로 탈출하지는 못하고 오답으로 탈출합니다. 순수 스크립트 쿼리는 아예 탈출하지 못합니다. 이 구별은 프로덕션 로그로 이 버그의 발생률을 추정하는 사람에게 중요합니다. ‘아무것도 반환하지 않은 쿼리’만 세는 모니터링은 무언가를 반환하는 혼성 케이스를 놓쳐 구조적으로 과소 집계합니다.

21개 쿼리의 수치입니다. baseline은 Top-1 0.0%, Recall@5 0.0%입니다. MRR 0.0037은 깊은 랭킹의 우연한 명중에서만 나옵니다. cjk_naive는 Top-1 95.24%, Recall@5 100%, 게이트 Recall@5 95.24%, MRR 0.9683입니다. cjk_full은 Top-1 90.48%, Recall@5 100%, MRR 0.9444입니다. 랭킹 지표는 거의 그대로인데 게이트 Recall@5는 19.05%입니다.

Top-1 Accuracy: Baseline vs cjk_naive vs cjk_full 21개 한자 쿼리에서 세 조건을 비교한 Top-1 정확도입니다. 출하된 baseline은 0.0%, 한 줄의 문자 클래스 확장 cjk_naive는 95.24%, 0.35 할인을 한자·가나에 일관 적용한 cjk_full은 90.48%입니다. 로컬 벤치 하네스 실측이며 21개 쿼리는 각각 검증된 골드로 매핑됐습니다.

회귀 평가에서는 세 조건이 완전히 동일한 숫자를 냅니다. Top-1 51.11%, Recall@5 82.22%, 게이트 Recall@5 75.56%, MRR 0.6256. 이 일치는 근사가 아닙니다. 45개 쿼리 중 어느 것도 한자·가나 문자를 포함하지 않아 변경된 코드 경로가 구조적으로 발동하지 않기 때문입니다. 시스템이 이미 평가받고 있는 표면에서 CJK 방향의 변경은 정확히 아무것도 태우지 않는 셈입니다. 최소 수정은 실측된 표면 위에서 엄밀한 개선입니다. 제로였던 능력을 되살리고 이미 재고 있던 표면에서는 대가가 0이라는 뜻입니다.

게이트 콜랩스, 일관한 수정이 지운 76포인트

가장 중요한 결과는 cjk_full에서 랭킹 지표와 게이트 지표가 갈라지는 것입니다. 기제는 산술적으로 단순합니다. 앞에서 본 비리비리 쿼리에서 정답 스킬은 두 CJK 조건 모두에서 1위입니다. cjk_naive에서 그 점수는 8.017으로 게이트 6.0을 넘어서 에이전트 컨텍스트에 주입됩니다. cjk_full에서는 점수에 기여하는 한자 바이그램 전부가 0.35로 곱해집니다. 점수가 바이그램 기여가 지배하는 가중 합이라 총점은 거의 정확히 비례적으로 스케일링합니다. 8.017 × 0.35 = 2.806. 2.806은 6.0보다 작으므로 스킬은 조용히 주입되지 않는다. 에이전트는 관련 스킬이 아예 없는 것처럼 동작한다. 그 사이 Recall@5는 100% 그대로인 셈이다. Top-1은 4.76포인트, MRR은 0.024만 내려간다. Recall@k와 MRR을 보고하는 회귀 스위트는 이 변경을 통과시킨다. 한자 스크립트 요청에 대한 프로덕션 능력은 76포인트 빠진 것이다.

Gated Recall@5: The Gate Collapse Effect 두 CJK 조건 모두 랭킹 지표는 거의 완벽(Recall@5 100%, MRR 0.9683/0.9444)이지만 게이트 통과 Recall@5는 cjk_full에서 95.24%에서 19.05%로 추락한다. 한자·가나 바이그램에 0.35x 할인이 적용되면 점수가 주입 임계 GATE_MIN = 6.0 아래로 재스케일링되기 때문이다. 로컬 벤치 하네스 실측(21개 한자 쿼리, 임계 6.0)입니다.

논문은 이 실패 모드를 gate collapse라고 명명합니다. 임계값 게이트를 거는 검색 시스템에서 점수는 결정 변수입니다. 순서만 정하는 장치가 아닙니다. 순서를 바꾸지 않고 점수만 재스케일링하는 변경은 모든 랭킹 기반 지표에서는 보이지 않고 게이트에서는 온전히 보입니다. 두 CJK 조건을 IR 실무자가 보고하는 지표로 보면 거의 동일합니다. Recall@5 100% 대 100%, MRR 0.9683 대 0.9444. 프로덕션 에이전트가 실제로 보는 것을 결정하는 지표에서는 76포인트 벌어집니다. 95.24% 대 19.05%. RAG에서 유사도 임계 이상 컨텍스트만 주입하는 시스템, 도구 호출을 확정하기 전 신뢰 게이트를 거는 시스템, 이 스킬 라우터와 같은 구조라면 모두 같은 위험 안에 있습니다. 처방은 작고 쌉니다. 프로덕션 임계값을 그대로 써서 회귀 스위트 전부에 Recall@k와 MRR 곁에 게이트 통과 지표를 함께 보고하는 것입니다. 없으면 진짜 프로덕션 회귀가 멀쩡한 랭킹 스위트를 통과합니다.

‘일관된’ 수정이 왜 위험했는지도 분명합니다. 0.35 상수는 한국어 과매칭에 맞춰 캘리브레이트된 값입니다. 그 상수를 다른 문자로 적용하는 것은 두 상수가 지배하는 양이 같은 양이라는 주장을 전제합니다. 그 주장 자체가 경험적입니다. 한자 바이그램과 한글 바이그램이 같은 양의 독립적 어휘 증거를 지니는지에 대해 측정된 바가 없습니다. 한 문자에서 캘리브레이트된 상수를 다른 문자의 regime 밖으로 내보내는 것입니다.

여기서 문자 유형론적 설명이 가능하지만 논문은 가설로만 제시합니다. 한글 한 글자는 자소 2~3개의 음소 복합체인 음절 블록입니다. 음절은 통상 형태소가 아닙니다. 한국어 단어에서 아무렇게나 잘린 2음절 조각은 단어나 형태소가 아닐 수 있습니다. 한자 한 글자는 반대로 통째로 하나의 형태소, 하나의 단어인 경우가 많습니다. 한자에서는 2자 바이그램이 실제 복합어가 됩니다. 임의의 조각으로 읽히는 경우는 드뭅니다. 그렇다면 한글에 맞춰 캘리브레이트된 할인은 한자에서 과보정입니다. 이번 실험의 효과 방향과 정확히 일치합니다. 다만 한 코퍼스, 21개 쿼리, 할인값 스윕 없음, 통계 검정 없음의 상태입니다. 검증이 필요한 주장은 이 스코어링 함수에서 한자 바이그램의 최적 할인이 한글 바이그램의 최적 할인보다 엄격히 크다는 것입니다. 논문 설계는 그 주장을 두 평가 세트의 다른 차이와 분리하지 못합니다. 적절한 후속은 이 코퍼스에 일본어 스킬이 생기면 같은 방법론 감사와, 거친 2점 비교 대신 할인값 스윕을 돌리는 것입니다.

300자 절단 정정과 선형 과정을 대신하는 한 줄

이전 사고 보고서는 2026년 8월 11일 프로덕션 사고 이후에 쓰였습니다. 도달 불가능한 트리거를 ASCII 토크나이저와 300자 설명 절단의 결합으로 귀인합니다. 대응으로 각 스킬 설명의 처음 300자에 트리거를 앞세우도록 요구했습니다. 이 감사의 코드 검토는 그 귀인의 두 번째 절반을 지지하지 않습니다. 300자 슬라이스는 표시용으로 반환되는 설명 필드에만 적용됩니다. 점수에 쓰는 토큰 집합은 그 슬라이스 전에 전체 설명에서 계산됩니다. CJK 우세 항목의 평균 설명 길이는 385.2자입니다. 그 절단에 토큰을 하나도 잃지 않습니다. 감사된 버전에서 절단 순서는 스크립트 블라인드 스팟의 작동 메커니즘이 아닙니다.

논문은 이전 귀인이 틀렸다고 주장하지 않습니다. 감사되지 않은 레비전의 동작은 이용 가능한 변경 히스토리로는 재구성할 수 없습니다. 부정보다 좁은 정정입니다.

방법론적 지점은 이 정정과 별개로 서 있습니다. 사고 도중 쓰인 귀인은 시간 압박 아래 형성된 가설입니다. 나중에 코드에서 독립적으로 재파생하는 비용은 잘못된 메커니즘을 겨냥한 대응을 유지하는 비용보다 쌉니다.

대응의 비용 구조가 바뀝니다. 앞세우기 대응은 스킬별 수동 과정입니다. 영향받는 설명을 사람이 전부 다시 쓰고 앞으로 새로 쓰는 모든 스킬도 그 제약 아래 작성해야 합니다. 영향받는 스킬 수에 비례하는 선형 비용입니다. 새 기여를 강제할 메커니즘이 없으니 시간이 갈수록 썩습니다. 이번 최소 수정은 정규식 한 줄의 문자 클래스 확장입니다. 이 코퍼스의 CJK 우세 항목 59개 전체의 구조적 도달성을 되살립니다. 한자 쿼리 Top-1을 0.0%에서 95.24%로 올립니다. 기존 평가 표면의 실측 비용은 0이고 어떤 스킬 설명도 고치지 않습니다. 레지스트리 크기에 대해 비용이 일정한 수정과, 크기에 대해 선형이고 영원히 반복되는 과정의 차이입니다.

회사와 사회와 과학에 남는 것

회사에서는 이 감사가 1,911개 항목 스킬 코퍼스 전체에서 구조적으로 도달 불가능한 집합을 정량화합니다. 라우터 소스에 바로 적용 가능한 코드 레벨 수정도 줍니다. 문자 클래스 확장 또는 절단창 완화. 스킬별 수동 트리거 재배치 없이 한글·한자·가나 트리거의 도달성을 토크나이저 레벨에서 복원합니다. gate collapse 발견은 회귀 스위트에도 반영돼야 합니다. 앞으로 cjk_full 류의 변경이 리뷰를 통과하지 못하도록 게이트 지표를 기본적으로 보고하도록 회귀 스위트를 고치는 것입니다.

사회적으로는 BM25 계열 검색과 도구 라우팅 전반에 적용 가능한 비라틴 문자권 사용자의 접근성 지식이 남습니다. 약 230개 한영 동의어 사전의 중국어 항목 0, 일본어 항목 0이라는 숫자가 말해 주듯 열거로 만드는 다국어 브리지는 노동 집약적이고 수렴하지 않습니다. 토크나이저 레벨 수정은 그 대비에서 유지 보수 비용이 낮은 길입니다. 한자·가나 사용자를 포함해 CJK 사용자가 에이전트 도구 생태계에서 구조적으로 불리하지 않도록 합니다.

과학적으로는 프로덕션 retrieval-augmented 에이전트 시스템에서 아직 문서화되지 않은 실패 모드를 정량적으로 특성화합니다. 토크나이저 정규식과 점수 임계 게이트가 결합해 만드는 스크립트 편향입니다. 랭킹 지표로만 인증하면 그 회귀가 안전으로 판정되는 평가 구조의 허점도 함께 드러납니다. SRA 프레임워크의 다국어 강건성 한계에 대한 실측 보완이고 이름만 다국어인 구성요소가 그 문자를 처리한다고 가정하지 않고 그 문자로 감사해야 한다는 방법론 전제가 실증됩니다.

한계

한계도 정직하게 열려 있습니다.

첫째, 단일 코퍼스입니다. 모든 측정은 한 조직의 내부 레지스트리, 1,911개 항목에서 나왔습니다. 공개 벤치가 아닙니다. 보고된 효과 크기는 이 시스템에 대한 서술입니다. BM25 스킬 라우터 전반의 일반적 효과 크기로 읽으면 안 됩니다. 메커니즘은 어떤 문자를 커버하지 않는 정규식 문자 클래스로 일반적입니다. 크기는 이 시스템의 것입니다.

둘째, 쿼리 세트 구성입니다. 21개 중국어 쿼리는 논문 저자가 손으로 쓴 것입니다. 여러 어노테이터의 독립 라벨링도, 실제 사용자 로그 샘플링도 없습니다. 이 내부 하네스에 중국어 사용자는 존재하지 않습니다. 골드의 설명에 있는 고유명사와 영역어를 재사용합니다. 분석기 없는 바이그램 토크나이저에 대해 거의 최적의 시나리오에 가깝습니다.

셋째, 가나는 end-to-end로 미검증입니다. 감사된 코퍼스에는 일본어 스킬이 존재하지 않습니다. 가나 쪽 확장 검증은 2문장 가나 문자열에서 17개 토큰을 만든 합성 단위 탐사로만 가능합니다. 일본어에 대한 시스템 레벨 증거는 없습니다.

넷째, 회귀 표면은 한국어 전용입니다. 기존 공식 골드 벤치에 영어 케이스가 없어 영어 전용 회귀 세트는 돌리지 않았습니다. 영어 비회귀 주장은 구조적이지 경험적이지 않습니다. 어느 조건도 메인 ASCII 정규식과 스탑워드를 건드리지 않습니다. ASCII 토큰 추출과 가중치는 세 조건에서 바이트 동일합니다. 강한 주장이지만 측정은 아닙니다.

다섯째, 한국어 결과의 정확성은 기계적입니다. 45개 벤치에서 세 조건이 바이트 동일하게 일치하는 것은 기대된 결과입니다. 그 쿼리가 한자·가나를 포함하지 않아 변경된 코드 경로가 구조적으로 발동될 수 없기 때문입니다. diff가 의도한 대로 스코프됐다는 확인일 뿐입니다. 수정이 일반적으로 무해하다는 증거는 아닙니다.

여섯째, 하이브리드 리랭 계층이 제외됐습니다. 모든 조건에서 임베딩 기반 리랭을 끄고 어휘 계층만 분리했습니다. 프로덕션에서는 켜져 있을 때 동작이 다를 수 있습니다. 가장 그럴듯한 방향은 블라인드 스팟의 부분적 은폐입니다. 임베딩은 정규식 토크나이즈에 의존하지 않기 때문입니다. 그 상호작용의 정량은 미해 과제입니다.

일곱째, 할인값 스윕이 없습니다. 전체 가중치와 0.35 일괄 할인, 두 극단만 비교했습니다. 한자·가나의 최적 할인은 두 값 사이에 있을 가능성이 가장 큽니다. 유지보수자는 주입 게이트에 대해 이미 임계값 스윕을 돌린 경험이 있습니다. 같은 형식의 할인 스윕은 이 논문의 거친 2점 비교를 곡선으로 바꿉니다. 식별 가능한 후속 작업 중 가치가 가장 높은 것입니다.


논문 상세 페이지는 https://thakicloud.com/tech-blog/ko/research/cjk-skill-router-blind-spots/에서 볼 수 있습니다.

본문의 모든 수치는 논문의 로컬 벤치 하네스에서 출하된 라우터 소스(2026년 8월 15일 기준)를 대상으로 측정한 값입니다. 하이브리드 리랭은 모든 조건에서 꺼져 있고 프로덕션 인덱스 캐시는 읽지도 쓰지도 않았습니다. 본문 세 개 그림은 해당 실측을 도식화한 것입니다.

태그: 에이전트 하네스, bm25, gate-collapse, information-retrieval-fairness, multilingual-retrieval, non-latin-script, retrieval-augmented-agents, 스킬 라우팅, tokenization, truncation-bias

카테고리:

업데이트: