🎧 ▶ 5분 브리핑으로 듣기
▶ 오디오북 재생 (Google Drive)
NotebookLM 오디오 개요 (AI 생성)

새로운 에이전트의 첫 성장 무기가 TV 광고라면, 경쟁은 이미 리더보드에서 앱스토어로 옮겨갔습니다. 금요일부터 미국 앱스토어 다운로드 1위를 지킨 제품은 메타 Muse입니다.

주가도 먼저 반응했습니다. Muse 첫 출시 이후 메타 주가는 10% 상승했고, 1년 만에 최고 하루를 기록했습니다. 메타는 Facebook과 Instagram의 앱 내 홍보 슬롯을 Muse에 배정했고, 이 제품에는 첫 전국 TV 광고가 나갔습니다. 벤치마크 순위와 개발자 커뮤니티로 제품을 재던 업계에서, 제품 성장 곡선을 광고 슬롯과 TV 시차가 그리는 모습은 처음 있는 일입니다. 다만 이번 주인공이 에이전트 제품이라는 점이 다릅니다.

이 사건이 보여주는 것은 한 시기의 끝이기도 합니다. 지난 2년간 AI 업계는 벤치마크 점수와 개발자 도입률이라는 두 숫자로 제품을 심판해 왔습니다. 점수가 높으면 좋았고 개발자가 말해줘야 살아남는 구조였습니다. 에이전트는 다른 종류의 제품입니다. 에이전트가 사용자의 일상으로 들어오려면 사용자가 이미 있는 곳에 설치되어야 합니다. 사용자가 이미 있는 곳은 앱입니다. 그리고 앱은 다운로드 수로 잽니다.

눈에 띄는 숫자는 642,000입니다. Muse의 초기 출시 기간 일일 활성 사용자(DAU)입니다. 같은 기준의 ChatGPT 초기 출시 기간 DAU는 231,000이었고 약 3배에 해당합니다. 겉보기에는 새 에이전트의 데뷔 기록이지만 더 냉정한 읽기가 있습니다.

광고로 들어온 에이전트 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

3배와 분배

출시 단계의 DAU 비교가 재는 것은 분배입니다. Muse는 개발자 커뮤니티의 입소문에서 자라지 않았습니다. Facebook과 Instagram의 앱 슬롯에 배치되고 TV 시간까지 사들이자 성장한 것입니다. 이미 그 앱이 폰에 있는 사용자들에게 ‘AI 에이전트’는 한 번 탭하면 되는 선택지가 됐습니다. 다운로드 결정의 마찰은 거의 0에 가까워집니다.

이게 ChatGPT의 초기 기간과 다른 지점입니다. 그때의 231,000은 찾아보고 듣고 설치한 사람들입니다. 지금의 642,000은 광고를 보고 클릭하고 설치한 사람들입니다. 두 숫자는 같은 것을 잰 게 아닙니다. 전자는 끌어당김을, 후자는 밀어넣기를 측정합니다.

분배 자산은 사겠다는 대로 사라지지 않습니다. 메타가 가진 것은 광고가 붙을 자리입니다. 매일 여는 앱 안에 슬롯이 있고 그 슬롯을 오늘 Muse에 배정했습니다. 경쟁사가 동일한 예산을 들고도 이 자리에 접근하는 것은 어렵습니다. 소비자 에이전트 경쟁에서 이 격차는 모델 벤치마크 점수 몇 점보다 훨씬 빠르게 벌어집니다.

두 속도의 경쟁이 동시에 벌어집니다. 소비자 쪽은 다운로드와 잔류율로, 기업 쪽은 완주와 감사로입니다. 같은 제품이 양쪽에서 동시에 점수를 받는 경우는 드뭅니다. 대개 소비자용 에이전트는 소비자에게서, 기업용 플랫폼은 기업에서 평가받습니다. 이번 주가 특이한 이유는 소비자 쪽의 점수가 기업의 의사결정에도 영향을 주려 한다는 것입니다. 주가는 이미 그렇게 움직였을 것입니다.

소비자 에이전트가 이 속도로 클 수 있었던 이유도 따로 있습니다. 수요 쪽은 이미 준비되어 있었습니다. 사람들은 이미 챗봇을 오래 써 왔고 ‘AI와 대화한다’는 경험은 더 이상 새로운 것이 아닙니다. 남은 것은 ‘일을 대신해 주는 에이전트’를 설치하는 동작뿐이었습니다. 광고가 줄인 것은 결정까지의 시간입니다. 그래서 이 런칭의 속도는 미리 쌓여 있던 수요의 양으로 읽어야 합니다.

그렇다고 오늘 수치를 무조건 반신반의할 필요는 없습니다. 더 의미 있는 검증은 다음 30일에 있습니다. 광고가 꺼진 뒤 DAU 선, 앱스토어 1위 유지 기간, 설치 후 다시 여는 비율입니다. 소비자 에이전트의 성패는 런칭 주가가 아니라 이 곡률로 판정납니다. 광고가 만들어 낸 스파이크인지, 사용이 만들어 낸 곡선인지. 642,000이라는 숫자는 이 질문에 대한 1주차 데이터에 불과할 수도 있습니다.

설치 이후를 따질 필요도 있습니다. 앱스토어 순위는 다운로드 수를 잽니다. 완주한 업무 수가 아닙니다. 소비자는 에이전트를 설치했다가 다시 열지 않을 수 있습니다. 한 주만 갖고 지웠을 수도 있고. 소비자 제품이라면 그것도 하나의 자연스러운 결과입니다. 호기심과 신기함도 가치의 일부이고 잔류율은 제품 팀이 풀어야 할 과제입니다. 하지만 에이전트가 기업의 업무에 들어온다면 다른 잣대가 필요합니다.

핵심 개념 요약 인포그래픽 1 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

기업을 닥치는 세 질문

왜 소비자 숫자가 기업으로 바로 넘어가지 않는 걸까. 가치의 단위가 다르기 때문입니다. 소비자 에이전트의 가치 단위는 대화인 셈. 한 번 즐거운 채팅이면 충분합니다. 기업 에이전트의 가치 단위는 업무입니다. 에이전트가 실제 업무를 건드리기 시작하면 실패의 비용은 회사의 책임이 됩니다. 아래 세 질문은 여기서 나옵니다.

첫째, 무엇을 했을까. 에이전트가 자체적으로 일을 돌리면 모든 행동에 기록이 남아야 합니다. 무엇을 건드렸고 무엇을 바꾸고 어떤 순서로, 어떤 권한으로. 기록이 없으면 검증이 없고 검증이 없으면 도입이 없습니다. 기업에서 감사 로그는 신뢰의 전제 조건으로 작동하는 것입니다. 소비자는 앱을 지워도 되지만 기업은 지울 수 없습니다. 지울 수 없다면 기록할 수 있어야 합니다. 소비자 앱에서 기록은 사용자의 폰 안에 있습니다. 기업에서는 기록이 회사가 볼 수 있는 곳에 있어야 합니다. 그 차이가 채팅 히스토리와 감사 로그의 차이인 셈.

둘째, 해봐도 되는 걸까. 자율성과 거버넌스는 별개의 문제입니다. 에이전트가 할 수 있는 것의 범위가 넓어질수록, 할 수 있는 것과 해서는 안 되는 것의 경계를 더 분명히 그어야 합니다. 그 경계는 정책이고 정책은 사후 보고서가 아니라 모든 행동 앞에서 기계적으로 집행되어야 하는 것입니다. 사고가 났을 때 ‘에이전트가 알아서 했어요’라는 설명은 책임의 근거가 될 수 없는 것입니다. 자율도를 세밀하게 관리할수록 에이전트를 도입하기 쉬워집니다.

셋째, 얼마가 들었을까. 에이전트의 업무가 자체 인프라 위에서 돌거나 토큰 단위로 청구되면 작업당 비용은 관리 변수가 됩니다. 지출은 토큰 단가만으로 구성되지도 않습니다. 중도에 틀어진 작업은 다시 돌리고 잘못된 파일을 건드린 작업은 조사해야 합니다. 실패 지출이 토큰 단가 위에 쌓이는 것입니다. 동시에 모델 단가는 계속 내려갑니다. 스페이스엑스AI의 Grok 4.7은 코딩 에이전트 지수 56점으로 상위 4개 AI 연구소 반열에 올랐고, 가격은 입력 토큰 100만 개당 2달러, 출력 100만 개당 6달러입니다. 가격 경쟁은 이미 ‘어떤 업무에 어떤 모델을 돌리느냐’가 물음값이 되는 구간까지 들어왔습니다.

세 질문을 한 줄로 묶으면 하나입니다. 에이전트가 일을 한다면, 그 일이 기록되고 승인되고 계산되어야 합니다. 이 세 단어가 충족되는 순간에야 에이전트는 도구에서 업무 시스템으로 올라섭니다. 소비자 에이전트가 대화의 단위로 끝나는 동안, 기업 에이전트는 이 세 단어를 제품으로 만들어야 합니다.

붐 이후의 비용

거버넌스가 제도화되는 시점이기도 합니다. Muse 광고전이 나간 같은 날, 캘리포니아 주지사 뉴스콤은 프론티어 모델의 긴급 차단(킬스위치)을 포함한 안전 권고를 2개월 내 검토하도록 하는 행정명령에 서명했습니다. 프론티어 연구소들 사이에서 ‘모델을 누가 멈추느냐’는 대화가 연구 과제의 목록에서 규제와 법적 틀의 목록으로 넘어오고 있습니다. 기업에서는 같은 질문이 더 구체적으로 도착합니다. 에이전트가 잘못할 때 누가 책임지느냐, 그리고 책임의 근거 기록이 무엇이었느냐.

소비자 에이전트 붐은 공짜가 아닙니다. 수백만 명이 매일 에이전트를 쓰면 추론 서빙과 GPU 자원 수요도 그만큼 커집니다. 지금의 모델 가격 전쟁은 그 인프라 비용에 대한 경쟁인 셈입니다. 소비자 트래픽이 오를수록 서빙 비용은 더 가팔라지고, 그래서 단가를 낮추는 쪽과 서빙을 효율화하는 쪽은 같은 방향을 향해 달립니다.

소비자와 기업은 쓰는 길이도 다릅니다. 소비자는 한 메시지를 보내고 한 답을 받습니다. 기업 에이전트가 맡는 업무는 여러 단계를 거치며 한 업무가 단일 채팅보다 훨씬 많은 토큰을 소비할 수 있습니다. 업무가 길어질수록 모델 간 차이는 커지고 작업별 모델 선택의 가치는 높아집니다. 이것이 비용 문제가 소비자 트래픽이 폭발하는 순간 거버넌스 문제가 되는 이유입니다.

비용과 통제 사이에는 한 단계 더 갈 문제가 있습니다. 어디에서 돌리느냐입니다. 일부 기업에는 에이전트가 아무리 좋아도 데이터를 외부 클라우드에 올릴 수 없는 영역이 있습니다. 그런 영역에서는 ‘에이전트가 얼마나 좋은가’보다 ‘어디에서 도는지’가 먼저 옵니다. 온프렘과 소버린 환경이 전제 조건이 되는 고객군입니다. 거버넌스 요구가 강한 곳일수록 이 질문은 더 먼저 제기됩니다.

가격이 내려갈수록 어떤 업무에 어떤 모델을 쓸지 하는 선택은 거버넌스 질문이 됩니다. 코딩 특화 모델의 가격이 2달러에서 6달러로 내려온 시점에, 모든 업무에 같은 비싼 모델을 무조건 돌리는 것 자체가 거버넌스 실패입니다. 모델 선택은 비용과 위험의 문제입니다.

결국 다음 단계 에이전트 시장의 가치는 다운로드 순위가 아니라 실행 경제성과 실행 통제로 결정될 것입니다. 한 업무를 끝내는 데 드는 비용, 실행을 승인한 주체, 깨끗하게 남은 흔적.

1위에서 완주까지

ThakiCloud의 Paxis는 이 질문에 다른 쪽에서 답합니다. Paxis는 ThakiCloud의 Agent-Native Cloud로, v1.1 GA를 마친 정식 제품입니다. 실험 프로젝트가 아닙니다. Paxis에서 Skills, Tools, Policies, Audit Logs 네 가지는 일급 리소스입니다. 에이전트의 일은 어떤 스킬을 보유하고 어떤 도구에 접근하고 어떤 정책 앞에 서며 어떤 감사 기록을 남기는가로 정의됩니다.

자율도(L0~L3)는 단계별로 관리되고 정책 게이트는 실행 시점에 점검되며 모든 행동에는 감사 로그가 남아야 합니다. 실행은 격리된 샌드박스 안에서 이뤄지고 MCP 커넥터와 스킬 마켓을 통해 외부 도구와 스킬을 검증된 형태로 끌어옵니다. 소버린 또는 온프렘 Kubernetes 환경에서도 돌리며, CostRouter가 작업별로 모델을 골라줍니다.

소비자 시장은 이미 사람들이 에이전트를 쓰고 싶어 한다는 것을 증명했습니다. 남은 것은 기업이 에이전트를 업무에 가져오는 단계입니다. ‘가져온다’는 것은 실행과 책임에 대한 질문의 형태로 옵니다. 그 질문에 답하는 인프라를 가진 쪽이 다음 에이전트 시장의 가치를 결정하게 될 것입니다.

이것은 TV 광고에 대한 답이 아닙니다. 업계가 DAU와 다운로드 수로 에이전트를 재기 시작했다는 것은, 누가 실행하고 누가 책임지는가의 본경쟁이 이제 막 시작됐다는 뜻입니다. 기업에 중요한 물음은 에이전트를 얼마나 많은 사람이 깔았느냐가 아닙니다. 에이전트가 완주한 업무가, 언제든 감사할 수 있는 기록으로 남아 있느냐입니다.

앱스토어 1위는 에이전트를 얼마나 많은 사람의 폰 안으로 들여보냈는지를 잽니다. 기업 에이전트는 얼마나 많은 업무를 완주했는지를, 그리고 그 기록이 깨끗한지를 잽니다.

핵심 개념 요약 인포그래픽 2 NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.

참고 자료

이 글은 아래 뉴스를 종합해 작성했습니다.

태그: ai-frontier, llmops, paxis, thakicloud

카테고리:

업데이트: