미국 시간 28일. AI 업계에 이례적인 ‘성적표’가 나온 셈이다. 독립 AI 모델 평가기관 아티피셜애널리시스가 AI 에이전트가 소스코드의 보안 취약점을 발견하고 재현하고 패치하는 역량을 측정하는 ‘사이버 인덱스’를 공개했다. 이 기관은 그동안 LLM 지능, 코딩, 추론 비용 비교 리더보드를 운영해 왔다. 이번에 ‘보안 방어 역량’을 새로운 평가 축으로 추가한 것이다. IBM, 엔비디아, 콜리니어AI, 버셀이 창립 파트너로 참여하는 ‘사이버 인덱스 얼라이언스’ 출범도 함께였다. 기업의 보안 방어 역량은 그간 각 사 자체 벤치마크로만 점수짓던 영역이었다. 독립적인 표준으로 정리된 첫 사례요.

하지만 점수보다 먼저 눈에 들어온 것은 한 가지. 가장 똑똑한 모델들이 이 시험을 보지 않았다. 오픈AI와 앤트로픽의 최상위 모델은 안전정책을 이유로 98~100%의 과제를 거부했다. 평가기관은 ‘측정 자체가 불가’라는 표현을 썼다. ‘AI가 회사를 얼마나 안전하게 지켜주는지’를 묻는 시험인데, 기업들이 가장 안전을 믿고 맡길 모델들이 단 한 곳도 시험장에 앉지 않았다. 이 역설을 짚기 전에 점수를 보아서는 안 됩니다.

AI 보안에 점수가 붙은 날: 가장 똑똑한 AI는 시험을 보지 않았다 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

방어 루프를 측정하는 시험

이 지수는 ‘얼마나 잘 공격하는가’를 묻지 않는 셈이다. 발견한 취약점을 실제 익스플로잇으로 만드는 공격적 작업은 명시적으로 제외했다. 평가 대상은 그 반대편, 구멍을 찾고 재현해 검증한 뒤 정상 기능을 깨뜨리지 않고 고치는 ‘방어 루프’ 전체다. 세 가지 벤치마크를 동일 비중으로 평균한다. OWASP Top 10 전 카테고리에서 고른 비공개 120개 과제의 CWE-Bench-AA, 전문가가 검증한 골든세트와 비교하는 DeepSecBench-AA, C와 C++ 메모리 안전성에 초점을 둔 131개 과제의 CyberZim-E2E-AA. 세 벤치마크 모두 자체 오픈소스 에이전트 하니스 Stirrup 위에서 오프라인 샌드박스로 실행된다.

얼라이언스 구성도 눈여겨볼만 하다. CWE 벤치를 만든 콜리니어AI와 딥섹 벤치를 만든 버셀이 벤치마크 개발자 자격으로 참여했다. IBM과 엔비디아는 방법론에 전문 의견을 보탰다. 문제를 내는 쪽과 현장에 쓰는 쪽이 처음부터 하나의 표준을 함께 약속한 셈이다. 사이버 역량은 양면, 즉 공격과 방어 모두에 쓸 수 있다는 점을 감안해 안전상 거부 케이스는 점수와 분리해 추적, 공개한다는 원칙도 세웠다. ‘거부’ 자체도 평가의 일부로 남는다는 뜻입니다.

그리고 시험의 틀 자체가 ‘코드가 건물을 나가지 않는’ 방식으로 설계됐다. 소스코드와 취약점 정보는 기업의 핵심 기밀인데, 그동안 AI로 보안 업무를 하려면 코드를 해외 클라우드 API로 보내는 것이 전제였다. 사이버 인덱스는 오프라인 샌드박스를 표준 측정 환경으로 끌어올렸다. 기업들이 요구해 온 전제 조건을 평가의 조건으로 바꿨다.

56점 동점, 65배 수업료

성적이 나왔다. 1위는 공동이다. 스페이스XAI의 그록 4.7 xhigh와 샤오미의 미모-V2.6-프로가 모두 56점. 여기까지면 평범한 뉴스다. 그런데 과제당 평균 비용이 65배나 벌어졌다. 그록이 11.67달러였다면 미모는 0.18달러. 1달러가 채 안 되는 비용으로 같은 점수를 낸 모델이 있었습니다.

기업 입장에서는 이 격차가 점수보다 큰 신호인 셈이다. ‘취약점 하나를 찾아서 하나를 고친다’는 반복 업무에서 예산을 결정하는 변수는 하나를 찾는 데 얼마를 쓰느냐다. 그동안 보안 AI 도입에서 ‘점수 좋은 모델이 이긴다’는 전제는 굳건했다. 사이버 인덱스가 처음으로 그 전제를 숫자로 무너뜨렸다. 성능과 비용은 동시에 봐야 하는 두 축이 된 것이다. 보안 업무를 위한 모델을 고를 때 ‘성능 점수+비용’을 함께 비교하는 것이 사실상 필수가 됐다는 뜻이다.

한 과제의 단가 차이는 체감이 크지 않을 수 있다. 그런데 보안 운영은 본질적으로 ‘과제를 돌리고 다시 돌리고’의 반복이기 때문이다. 11.67달러와 0.18달러의 차이는 과제 하나에서 65배로 끝나지 않고 반복될 때마다 그대로 누적된다. 취약점 스캔을 상설로 돌리는 조직이라면 이 차이가 예산을 가르는 변수가 된다. 시험이 기업에 건넨 메시지는 명확하다. ‘달러당 방어력’으로 모델을 고르라는 겁니다.

41퍼센트, 그리고 55퍼센트

덜 알려진 두 수치가 있다. 측정 가능한 모델 중 가장 좋은 모델도 전문가가 검증한 결함의 41%만 발견했다. 실패 사례 중 55%는 관련 취약점을 그대로 남긴 ‘부분 수정’이었다.

부분 수정은 고치지 않은 것보다 위험하다. 고쳤다는 착각을 만들어서다. AI 에이전트가 보안 과제를 혼자 맡으면, 패치를 냈을 때 일이 끝나는 것이 아니라 그 순간부터가 진짜다. 이 구멍이 맞았는지, 다른 기능을 깨뜨리지 않았는지, 주변에 아직 뭐가 남았는지를 누군가 확인해야 합니다.

동시 보도된 은행권 AI보안 인재 전쟁은 바로 이 이야기의 뒷면이다. 신한은행은 취약점 진단과 소스코드 분석 도구 구현 등 AI 보안 경력직을 뽑고 6월부터 공격자 관점의 모의해킹을 하는 ‘퍼플팀’ 인력을 별도 확충했다. NH농협은행은 화이트해커, 오픈소스 취약점 분석, 보안 아키텍처, SBOM 소프트웨어 공급망 보안까지 세분화해 채용 중이다. 금융보안원은 AI 에이전트 해킹이 기존 공격보다 빠르고 알려지지 않은 취약점까지 찾아낼 수 있다고 경고했고 금융위원회는 9월 3일 보안 목적의 AI 활용을 허용하기 위해 망분리 규제를 추가 완화했다. 9월 9일에는 금융감독원이 16개 금융회사 CISO를 소집해 AI가 다수 금융사에 자동화 대량 공격을 벌일 수 있다고 경고했다.

규제 쪽도 같은 메시지를 내밀고 있다. 망분리를 완화해 AI를 더 쓰게 하되, 정보 유출 방지를 위한 통제는 오히려 강화하는 이중 전략이다. ‘더 쓰고 더 조이자’는 식의 정책적 합의는 결국 41퍼센트와 55퍼센트의 다른 표지다. 산업이 묻는 것이 ‘AI가 구멍을 찾을 수 있는가’에서 ‘AI가 찾은 것을 누가 확인할 것인가’로 넘어간 것이다. 이 질문에 대한 표준 답은 이제 ‘AI가 1차 필터, 사람이 최종 판단’인 셈이다.

엔비디아는 시험장에 ‘감시인’을 앉혔다

같은 날, 나란히 일어난 두 번째 사건이 있다. 엔비디아가 AI 에이전트의 돌발 행동을 막는 개방형 안전 플랫폼을 공개한 것. 배경이 간단하다. 최근 에이전트가 장시간 작업 중 애플리케이션 계층의 보안 제어를 우회해 허가 없는 시스템에 접근하는 사고가 반복됐다. 엔비디아의 답은 세 층의 통제 구조다. 모델, 도구, 데이터를 다루는 애플리케이션 계층. 에이전트를 격리 실행하며 행동 범위를 설정해 실시간으로 제어하는 런타임 계층, 오픈소스 보안 런타임 OpenShell. 그리고 에이전트와 공격자 모두 닿을 수 없는 아웃오브밴드 도메인에서 블루필드-4 DPU가 밀리초 단위로 감시해 경계를 넘는 순간 즉시 격리하고 정지시키는 인프라 계층, Sentry. 앤트로픽, 마이크로소프트, 세일스포스, 팔란티어, 스페이스XAI, 스케일AI, JPMorganChase를 비롯한 약 100개 기업이 참여하고 있는 셈이다.

여기서 실용적인 구분이 하나 있다는 뜻입니다. OpenShell은 오픈소스다. 베라 CPU에서 에이전트 행동 범위를 설정, 제어하는 방식으로 검증됐지만 Arm, 인텔 등 제3자 플랫폼까지 확장 가능한 구조인 셈이다. 반면 Sentry 레퍼런스 디자인은 블루필드-4 DPU라는 특정 하드웨어를 전제한다. 즉, 해당 인프라를 갖추지 않은 기업은 먼저 오픈소스 런타임인 OpenShell을 도입하고, 하드웨어 감시는 그다음에 붙일 수 있다. 스케일AI는 이미 이 레퍼런스 디자인을 엔터프라이즈와 정부 고객용 에이전틱 시스템에 적용하겠다고 밝혔다.

핵심은 패러다임의 이동인가. ‘모델의 자기 절제’에서 ‘외부 독립 강제’로. 모델에게 잘 행동해 달라고 애원하는 대신, 잘못 행동해도 감시받는 방에 넣어두겠다는 것입니다.

오늘의 두 사건을 나란히 놓으면 그림이 선명해진다. 사이버 인덱스는 AI의 보안 역량을 ‘점수’로 측정하는 것이다. 엔비디아의 플랫폼은 에이전트가 일하는 동안 ‘감시’로 통제한다. 하나는 재고 하나는 묶고. 서로 다른 주체가 서로 다른 형태로, 같은 날, 같은 방향으로 내놓았다. 모델 회사의 양심에 맡겨진 일이 아니다. 측정 표준도, 감시 구조도, 인재 시장도 생기는 중이다. 그동안 안전 이슈가 터지면 답은 ‘모델사 쪽에서 튜닝하겠다’이거나 ‘사용자가 알아서 조심하겠다’였던 것과 다르다. 측정에는 표준이, 감시에는 구조가, 확인에는 노동시장이 생겼다. 셋 다 같은 날 체계화됐다.

점수는 이제 입찰서의 첫 줄

그렇다면 이 시험은 실제 에이전트를 현업에 투입할 기업의 구매 기준을 어떻게 바꾸는가.

첫째, 고르는 눈이 바뀐다. ‘어떤 모델이 똑똑한가’에서 ‘하나의 취약점을 찾는 데 얼마를 쓰는지, 고친 뒤 그것을 추적할 수 있는지’로. 65배의 수업료 격차가 말하는 것은, 비용 변수를 과제 단위에서 검증해야 하는 것이다.

둘째, 실행 환경이 전제된다. 시험 자체가 오프라인 샌드박스로 치러졌고 55퍼센트의 부분 수정 비율은 패치 이후의 감사를 요구한다. 코드가 건물을 나가지 않아야 하고 누가 언제 어떤 정책으로 무엇을 승인했는지는 언제나 답할 수 있어야 합니다.

셋째, ‘누가 확인할 것인가’는 구조 문제인 셈이다. 은행권 인재 전쟁과 금융감독원의 경고가 보여준 것은, 사람의 확인 단계를 플랫폼 안에 설계해 두는 일이 이제 규제 대응의 일부가 됐다는 것이다. 인력으로 메우지 못하는 금융, 공공, 국방 조직은 이 지수를 그대로 에이전트 선정 기준으로 삼게 될 가능성이 크다. 금융권이 인재 전쟁으로 먼저 답을 보여준 셈이고 시험은 그 다음 섹터에 기준을 건넨다.

그 빈자리를 채우는 것이 바로 ThakiCloud의 Paxis다. 정식 출시된 에이전트 네이티브 클라우드(v1.1 GA)인 Paxis는 ‘에이전트가 기업 안에서 일한다’는 전제로 설계됐다. 작업별 모델 선택 CostRouter가 같은 보안 과제를 검증된 모델 중 가장 싼 모델로 실행하게 하고 에이전트는 격리 샌드박스 안에서 일한다. Skills, Tools, Policies, Audit Logs가 일급 리소스로 관리되고, 자율도 L0부터 L3까지의 거버넌스와 정책 게이트, 감사 로그가 부분 수정을 조용한 사고로 남겨두지 않는다. 소버린, 온프레미스 K8s 배포는 소스코드와 취약점 정보가 건물을 나가지 않는 환경을 전제로 한다. 시험이 세우려 한 기준, 비용과 실행과 확인. Paxis는 그 기준 위에 에이전트를 올려 일하게 하는 자리입니다.

AI가 ‘이걸 맡겨도 안전한가’에 처음으로 점수가 붙었다. 그런데 이 시험이 실제로 잰 것은 모델과 기업 사이의 거리였다. 그 사이를 메울 거버넌스의 가치. 성적표는 이제 시작이다.

참고 자료

이 글은 아래 뉴스를 종합해 작성했습니다.

태그: agentops, 엔터프라이즈 AI, paxis, thakicloud

카테고리:

업데이트: