벤치마크에서 진 에이전트가 1위를 잡았다
인텔리전스지수로만 판단한다면 메타의 새 에이전트 뮤즈는 출시되지 말았어야 했습니다. 21일 아티피셜애널리시스 인텔리전스지수에 따르면 뮤즈에 들어간 뮤즈스파크1.3 모델은 45점을 받았습니다. 같은 날 앤트로픽 페이블5.1과 오픈AI GPT-6 아스트라는 53점으로 공동 1위였습니다. 8점 차이입니다. 지난 2년의 논리라면 이 제품은 앱스토어 중반 어딘가에서 사라져야 했습니다. 벤치마크를 먼저 확인하고 그 다음에 출시하는 것이었습니다. 그게 지난 두 해의 기본 순서였습니다.
그런데 시장은 다른 결정을 내렸습니다. 센서타워 집계에서 누적 다운로드는 9월 8일 미국 출시 6일 만에 90만 건을 넘었고 21일에는 250만 건을 돌파했습니다. 뮤즈는 18일 미국 애플앱스토어 무료 1위, 21일 구글플레이 1위를 찍었습니다. 가장 결정적인 증명은 주식시장에 떨어졌습니다. 메타 주가는 21일 11% 오르며 741.25달러에 마감했고 거래량은 약 4800만 주에 달했습니다. 작년 4월 이후 최대 일일 상승폭입니다. 출시 이후 주가는 약 20% 높아졌습니다. 45점 모델이 53점 모델과의 도박에서 이긴 셈입니다. 뮤즈의 역설 하나만으로는 오늘 뉴스를 설명할 수 없습니다. 중요한 것은 다른 기사들이 전부 같은 질문의 다른 각도에서 쓰여 있다는 점입니다. 이 글은 그 역설부터 붙들고, 같은 질문이 어디까지 퍼져 있는지 따라갑니다.
글의 핵심 개념을 형상화했습니다.
8점이 못 재었던 것
왜 점수가 낮은 에이전트가 이겼는가. 답은 벤치마크가 재지 않는 세 변수에 있습니다.
첫째는 배포 경로입니다. 뮤즈는 왓츠앱에서 씁니다. 메타는 36억 명 데일리 이용자 기반을 갖고 있고 에이전트는 사람들이 매일 여는 메신저 안에 이미 들어 있습니다. 이용자가 ‘AI를 써야지’라는 의도를 떠올릴 필요 없이 에이전트에 도달합니다. 반면 오픈AI와 앤트로픽은 매일 여는 메신저가 없습니다. 별도 앱 다운로드와 계정 연결을 요구합니다. 같은 날 테크전략 매체 스트래테커리의 벤 톰슨은 AI 산업이 성능이 수요를 충족하는 ‘성능 포화’ 국면에 들어갔고 이용자의 시선이 편의성과 개인화 쪽으로 돌았다고 평가했습니다. 그가 써본 개인 에이전트 중 가장 뛰어나고 쓰기 쉬운 제품으로 고른 것은 뮤즈였습니다. 클레이턴 크리스텐슨이 오래 전에 설명했던 전형적인 패턴입니다. 성능이 한 번 기준선을 넘으면 차이는 체감되지 않고, 경쟁은 다음 변수로 이동합니다.
둘째는 가격입니다. 기본 기능은 무료이고 유료는 월 20달러와 100달러입니다. 전문 지식 없이 대화만으로 업무를 위임할 수 있습니다. 위임의 문턱이 없으니 시험의 범위도 넓어집니다.
셋째, 그리고 이 글의 핵심인 위임 범위입니다. 뮤즈가 사용자를 대신해 처리하는 것은 이메일, 일정, 결제, 쇼핑입니다. 답을 주는 단계를 지나 실제 거래와 개인정보를 건드립니다. 이 순간 ‘8점 차’의 의미가 바뀝니다. 챗봇이 8점 밀리면 다른 것을 쓰면 그만입니다. 돈과 일정을 대신 치르는 에이전트가 8점 밀렸을 때 질문은 ‘얼마나 믿을 수 있는가’로 바뀝니다. 벤치마크가 재는 것은 모델이라는 단일 부품입니다. 에이전트 제품은 모델과 도구, 기억, 배포 경로가 한데 모인 시스템입니다. 배포가 메신저 안에 있고 가격이 0에 가깝고 위임 범위가 넓은 시스템이 높은 점수의 부품을 이길 수 있습니다. 이번 흥행이 말하고 있는 것은 그거입니다.
53점 제조사 쪽에서 보면 이 흥행은 경고입니다. 성능 포화가 확인되면 벤치마크의 가격 결정력은 약해지고 경쟁은 배포 경로와 경험 쪽으로 이동합니다. 자기만의 ‘왓츠앱’이 없는 두 회사는 이제 벤치마크표가 답하지 못하는 질문을 마주합니다. 매일 AI를 쓴다는 생각 없이 AI를 쓰는 사용자까지, 어떻게 닿는가.
NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.
‘똑똑함’이 이유로는 모자란 순간
뮤즈 현상의 뒷쪽은 다른 곳에서 작성되고 있습니다. 에이전트가 결제와 개인정보를 다루기 시작하면 ‘멈출 수 있는 능력’과 ‘무엇을 했는지 증명하는 능력’이 제품으로 분리됩니다.
신호는 연이어 도착했습니다. 옥타는 라스베이거스 컨퍼런스에서 에이전트와 호출 대상 도구 사이의 실행 경로에 정책을 실시간 적용하고 기록하는 ‘에이전트 게이트웨이’를 공개했습니다. 3월에 공개한 에이전트 보안 프레임워크의 일환인 셈입니다. 킬스위치도 날카로워졌습니다. 기존에는 에이전트를 비활성화하면 새 세션만 차단됐지만 이제는 활성 토큰 전체를 취소하고 진행 중인 세션까지 종료합니다. 탐지에도 직원 단말용 섀도우AI 에이전트 디스커버리가 더해졌습니다. 노트북과 데스크톱에 설치된 관리되지 않은 에이전트까지 찾아내며, 기존에 있던 베드록과 에이전트포스 가져오기, 브라우저 섀도우 에이전트 탐지에 새롭게 덧붙은 것이기도 합니다. 옥타는 AWS와 크라우드스트라이크, 도커, 세일즈포스를 포함한 11개 업체와 ‘블루프린트 얼라이언스’를 출범시켰습니다. 에이전트가 침해당하면 토큰 취소와 세션 종료, 네트워크 격리, 복구까지 한자리에서 대응한다는 구상입니다.
자금시장의 판단도 뒤따랐습니다. 데이터 보안 스타트업 사이이에라는 골드만삭스서 기업 가치 120억달러 기준 4억달러를 추가 유치했습니다. 2026년 누적 조달액은 14억달러에 이릅니다. 지난 6월 에볼루션 이퀄리티가 이끈 6억달러 시리즈 G의 연장 라운드라고 할 수 있습니다. 사이이에라는 민감 데이터 위치 파악 플랫폼에서 자란 기업이고 에이전트 보안으로 사업을 넓힌 뒤 에이전트 가디언을 공개했습니다. 에이전트를 목록화하고 과도한 권한을 탐지하며 MCP 서버의 보안을 점검하고 위험 행위를 차단하고, 격리합니다. 9월초에는 비인간 아이덴티티 보안 기업 오아시스 시큐리티를 10억달러에 인수하기도 했습니다. 위즈 중심으로 흐르던 사이버보안 투자 사이클이 에이전트 보안으로 넓어지고 있다는 것이 기관의 읽기입니다.
두 기사가 가리키는 방향은 같습니다. 통제 대상으로는 이제 인간 계정이 아니라 에이전트 자체입니다. 옥타의 탐지는 직원 단말에 돌아다니는 섀도우 에이전트까지 확장했고, 사이이에라는 비인간 아이덴티티를 관리하는 회사를 10억달러에 샀습니다. 에이전트는 인간과 분리된 자기 신원과 권한을 갖습니다. 보안 제품이 다투는 곳은 바로 그 신원을 다루는 계층입니다.
이 변화가 말하는 것은 신원의 단위 자체가 바뀐다는 점입니다. 브라우저 시대에는 신원이 사람 계정 하나였습니다. 에이전트 시대에는 신원이 사람 계정에 에이전트 신원이 더해집니다. 에이전트가 사람을 대신해 행동하면, 권한 관리의 대상은 더 이상 ‘누구인가’가 아니라 ‘대신 행동하는 것이 뭘 할 수 있는가’가 됩니다. 그래서 경쟁의 대상이 로그인 화면이 아니라 실행 경로 위의 게이트로 이동하고 있습니다.
그런데 이 이야기의 주인공은 그 자체로 신뢰 문제를 안고 있습니다. 메타는 미국 FTC로부터 50억달러 벌금을 낸 기업이고 아동 중독 관련해서는 최대 180억달러 규모의 합의도 함께 거명되고 있습니다. 결제와 개인정보를 다루는 에이전트를 출시하면서 자사의 전력이 업계 최대 규모의 신뢰 부채인 기업이 ‘믿고 맡긴다’를 팔고 있습니다. 역설처럼 보이지만 그래서 더 명확해집니다. 신뢰가 제품의 일부로 남는 한 아무도 증명할 수 없기 때문에, 신뢰는 별도의 제품으로 분리되는 것입니다.
유엔안보리에서는 문제 자체에 이름이 붙었습니다. 오픈AI 올트먼과 앤트로픽 아모데이를 비롯한 AI 업계 리더들이 ‘AI와 국제 안보’ 회의에 모여 국제 공조를 촉구했습니다. 벤지오는 ‘AI 에이전트가 지시를 거부하고 인간이었다면 범죄가 될 행동을 했다’며 AI 사고의 공통 정의와 보고 체계 마련을 제안했습니다. 올트먼은 인간 통제 아래 유지할 수 있다는 강력한 근거 없는 모델은 훈련해서는 안 된다는 선을 지켰습니다. 백악관의 크라치오 실장은 슈퍼지능 통제의 글로벌 체제 구축 시도에 전적으로 거부 입장을 냈습니다. 글로벌 공조가 막히면 거버넌스의 짐은 각 나라와 각 회사로 넘어옵니다. 그 짐이 닿는 곳은 에이전트를 돌리는 플랫폼입니다. 거버넌스의 방향은 여전히 각자도생으로 갈려 있지만 기업 쪽의 결론은 명확해집니다. 권한을 줄 수 있는 능력, 멈출 수 있는 능력, 증명할 수 있는 능력은 이제 옵션이 아닙니다. 이 논의가 안보리라는 수준까지 올라왔다는 사실 자체가 신호입니다. AI 거버넌스가 연구 윤리위를 지나 안보리에 이르기까지 이동했다면, 다음은 기업 이사회입니다.

반 박자 늦게, 같은 질문이 한국 기업에 온다
소비자 시장은 이미 ‘얼마나 믿을 것인가’를 묻기 시작했습니다. 같은 질문은 한국 기업에 반 박자 늦게, 그리고 더 무겁게 도착합니다. 소비자 시장이 250만 다운로드라는 발로 답한 것을, 기업 시장은 조달 명세와 감사 질문지로 답할 터입니다. 답의 내용은 같고 형태만 다릅니다. 기업에 들어가는 에이전트는 이메일 요약 단계를 지나고 있습니다. 포지큐브는 23일, S-OIL 임직원을 위한 AI 어시스턴트 고도화 프로젝트를 마쳤다고 발표했습니다. 멀티 에이전트 기반 생성형 AI 플랫폼 로비 G 맥스로, 통합인증과 마이크로소프트 365에 이어 감사보고서까지 자동 작성합니다. 별도 절차 없이 PC와 모바일에서 쓰이고 사용자 데이터와 조직 데이터가 연계됩니다. 포지큐브 측은 단일 에이전트의 ROI와 확장성 한계를 극복한 멀티 에이전트 업무 운영 모델이라고 설명합니다. 동시에 에이전트가 소비할 데이터 레이어도 표준화되고 있습니다. 쿠콘은 국내외 2500여 기관에서 수집한 약 300종의 금융 데이터 API를 MCP 상품으로 전환 중이고, 전량 전환은 내년 완료입니다. 하나은행과 IBK기업은행, KB국민은행, 카카오페이 같은 기존 금융과 핀테크 고객 기반으로 MCP 상품 도입이 확대될 것이라는 전망까지 붙습니다.
이런 어시스턴트가 금융 데이터와 개인정보를 건드리기 시작하면 평가 기준이 바뀝니다. 똑똑한가. 통제 가능한가. 어떤 권한을 갖고 누가 승인했는가. 위험한 순간 즉시 멈출 수 있는가, 그리고 그 증거는 어디에 남는가. 실행 기록은 감사 가능하게 보존되는가. 이 질문들은 벤치마크표에서 답을 얻지 못합니다. 소비자 에이전트에서 실패의 신뢰 비용은 개인이 지면 됩니다. 기업 에이전트에서는 회사가 감당합니다. 감사와 책임이라는 이름으로. 질문의 무게가 다른 이유입니다.

이 역설이 가리키는 렌즈
오늘 뉴스가 기업의 통증을 네 방향에서 드러냅니다. 에이전트의 행동을 어떻게 증명할 것인가, 안보리 회의의 보고 체계 논의입니다. 어떻게 즉시 멈출 것인가, 게이트웨이와 킬스위치입니다. 어디에서 안전하게 돌릴 것인가, 격리와 탐지입니다. 그리고 얼마를 낼 것인가, 무료와 유료의 가격 경쟁입니다. 소비자 시장이 ‘점수’보다 ‘믿음’을 택하기 시작한 순간, 기업이 필요한 것은 옵션이 아니라 에이전트가 도는 무대 자체입니다. ThakiCloud의 Paxis는 Agent-Native Cloud 위에 Skills, Tools, Policies, Audit Logs를 일급 리소스로 놓고 있습니다. 자율도는 작업별로 L0부터 L3까지 거버넌스가 구분하고 정책 게이트와 감사 로그가 실행 경로를 실시간으로 기록합니다. 에이전트는 격리 샌드박스에서 실행되고 작업별 모델 선택(CostRouter)이 비용을 통제 가능한 선에 둡니다. 메타의 뮤즈는 ‘8점 차이는 상관없다’는 도박에서 이겼습니다. Paxis가 준비하는 것은 그 다음 질문의 답입니다. 기업은 에이전트를 얼마나 믿고, 그 믿음을 어떻게 증명할 것인가.

참고 자료

이 글은 아래 뉴스를 종합해 작성했습니다.
- 뉴스핌, [뮤즈 돌풍] ①최고 성능 아니어도 흥행…AI 경쟁 기준이 바뀐다
- 디지털투데이, 옥타, AI 에이전트용 런타임 게이트웨이 추가
- AI타임스, 포지큐브, S-OIL 임직원 업무 효율 높이는 ‘AI 어시스턴트’ 고도화
- 이투데이, 쿠콘, 금융 데이터 API ‘AI 맞춤형’ 전환 속도…내년 완료
- 연합뉴스, 유엔안보리 모인 AI업계 리더들, 국제 공조 촉구…美는 반대(종합)
- 디지털투데이, 사이에라, 골드만삭스서 4억달러 추가 유치…AI 보안 확장
NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.