주머니의 30B, 사무실의 15배
글의 핵심 개념을 형상화했습니다.
“매개변수”라는 단어가 들어간 스마트폰 스펙시트
이 업계에서 먼저 읽는 것은 스펙시트입니다. 9월 22일, 현지시간으로 퀄컴이 연례 스냅드래곤 서밋을 열었습니다. 테이블에 올린 것은 두 개의 최상위 플랫폼, 스냅드래곤 8 엘리트 익스트림 6세대와 스냅드래곤 8 엘리트 6세대. 둘 다 2nm 공정이라는 점도 눈에 띕니다. 2016년 첫 서밋 이후 10년, 퀄컴은 매년 단 하나의 최상위 8 시리즈 칩셋만 내놓았습니다. 10주년인 올해 처음으로 최상위 플랫폼이 둘이 됐고 퀄컴은 이 체제를 듀얼 엘리트라 부릅니다. 폴더블, 트라이폴드 같은 폼팩터 다변화에 대응하기 위한 편성이라고 설명합니다. 폼팩터가 다르면 들어갈 에이전트 경험도 달라질 테고 하나의 칩으로 모든 폰을 아우르던 시대가 닫힌다는 뜻이지요.
더 재미있는 부분은 개수가 아니라, 스펙시트에 적힌 내용입니다. 모바일 프로세서 역사상 처음으로 5GHz 클럭 장벽을 뚫었습니다. 8코어 커스텀 오라이온 CPU는 프라임 2개와 퍼포먼스 6개 코어로 구성됐고 L2 공유 풀 기반의 오라이온 플렉스 캐시까지 새로 들어갔습니다. 헥사곤 NPU는 최대 32K 토큰 컨텍스트를 지원하고, 온칩 공유메모리는 50% 증설됐으며, 프리필 성능은 최대 80% 좋아졌습니다. UFS 5.0과 결합하면 30B급 MoE 모델이 기기에 직접 올라와 구동됩니다. 2023년, 스냅드래곤 8 3세대가 10B급 온디바이스 생성형 AI를 스마트폰에 태웠을 때와 비교하면 3년 만에 주머니에 들어가는 모델의 체급이 세 배로 커진 셈입니다.
32K 토큰이라는 수치를 곱씹어 보면, 이 스펙시트가 에이전트용임을 알 만합니다. 에이전트는 한 번 답하는 것이 아니라, 문서를 읽고 도구를 부르고 결과를 검증하는 식으로 컨텍스트를 쌓아가는 존재이기 때문입니다. 길게 기억하고 빠르게 첫 문장을 뽑아내는 것. 이 두 가지가 동시에 스펙의 기준이 된 것입니다.
그 아래에는 더 조용한 변화가 숨어 있었습니다. 듀얼 마이크로 NPU, 퀄컴 센싱 허브는 전력을 20% 줄이고 성능은 85% 끌어올린다고 합니다. 퍼스널 스크립 기능은 일상 대화를 온디바이스 지식 그래프로 바꿔 에이전트의 개인화를 돕습니다. 그리고 CPU 자체가 에이전틱 워크플로의 조율, 제어 흐름, 작업 스케줄링을 맡는 구조라고 설명합니다. 칩의 설명서에 워크플로라는 말이 들어간 순간입니다. 에이전트 작업이 앱이 아니라 칩의 1급 워크로드가 됐다는 뜻입니다. 배터리와 열, 전력 예산을 에이전트의 일이 직접 차지하기 시작합니다.
퀄컴 스스로의 정리도 직설적이었습니다. 스마트폰 경쟁의 기준이 하드웨어 스펙에서, 에이전트가 사용자를 대신해 무엇을 실행할 수 있느냐로 이동한다고 말합니다. PC와 XR, 오디오, 웨어러블의 맥락을 스마트폰이 구심점으로 모은다는, 나의 생태계라는 비전도 함께 꺼냈습니다. 샤오미 18 프로가 세계 최초 탑재를 확정했고 주요 OEM의 조기 채택 경쟁은 이미 시작됐습니다.
NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.
같은 주, 사무실에서는 15배
다른 방에서는 이번 주, 또 다른 숫자가 나왔습니다. 마이크로소프트가 23일 공개한 자료에 따르면, MS365 생태계의 에이전트 수는 1년 새 15배 늘었습니다. 대기업은 18배를 기록했습니다. 조사 대상 AI 이용자의 66%는 AI 활용 덕분에 고부가가치 업무에 더 많은 시간을 쓸 수 있게 됐다고 답했습니다.
오픈AI는 이 변화를 한 단어로 짚었습니다. 위임, 즉 delegation입니다. 기업 AI 활용이 지원에서 위임으로 이동하고 있다는 분석입니다. 온보딩, 고객관리, 개발자 지원 같은 업무에 에이전트를 적용한 사례를 함께 공개했습니다. 표본 조사에서는 코덱스 이용자의 70.2%가 1시간 이상 걸릴 작업을, 25.6%가 8시간 초과 분량의 작업을 AI에 맡기는 것으로 나타났습니다. 8시간 분량의 일을 맡긴다, 이 표현이 오늘의 수준을 보여줍니다.
구글 클라우드는 한 발 더 갑니다. 분리된 업무 도구를 연결하고 데이터 접근 권한과 보안, 비용을 함께 관리해야 에이전트 확산이 완성된다고 지적합니다. 경쟁의 기준도 모델 벤치마크 점수에서, 복잡한 업무를 맡길 때 오류를 얼마나 줄이고 결과를 재현 가능하게 만드느냐로 옮겨갔다고 봅니다.
즉, 사무실 쪽의 이야기는 이렇습니다. 사람들이 에이전트에게 건네는 것이 더 이상 질문이 아니라, 업무가 됐습니다. 확인할 파일, 분석할 데이터, 실행할 프로그램, 호출할 도구. 한 단계가 아니라 여러 단계를 스스로 구성해 끝내는 일. 그리고 그 물량이 15배의 속도로 늘어나고 있다. 당분간 대규모 일자리 대체보다는, AI가 업무 일부 수행에 사람 쪽이 목표 설정과 의사결정, 예외 처리, 결과 검증을 맡는 분업이 확산될 것이란 게 업계 중론이다.

반대로 흐르는 두 개의 강
이 두 가지를 나란히 놓으면 묘한 그림이 나온다. 소비자 쪽의 에이전트는 주머니로 내려가고 기업 쪽의 에이전트는 플랫폼 위로 올라가고 있다. 같은 단어, 에이전트가 동시에 두 방향으로 흐르는 모양이다.
왜 그럴까. 주머니로 오는 쪽에는 이유가 분명합니다. 지연이 짧아야 하고 배터리 안에서 돌아가야 하며 대화라는 데이터가 밖으로 안 나가는 것이 장점입니다. 30B급 MoE가 내려오면 일정 관리나 예약 대행 같은 가벼운 에이전트 경험은 기기가 흡수합니다. 그리고 흥미로운 부수효과가 하나 있습니다. 소비자가 폰에서 에이전트 경험을 먼저 체득하면, 기업 고객의 심리적 장벽이 낮아집니다. 주머니에서 이미 써본 일을, 사무실에 다시 데려오는 일입니다.
올라가는 쪽에도 이유는 있습니다. 기업의 데이터는 한 기기에 있지 않고 권한은 사람별로 다르고 결과는 감사해야 합니다. 위임이 커질수록 필요한 것은 더 똑똑한 모델이 아니라, 더 설명 가능한 구조입니다. 두 흐름을 함께 보면 오늘의 경쟁 구도가 보입니다. 둘 다 지능을 팝니다. 실행을 팝니다. 스마트폰은 사용자를 대신해 실행할 수 있는 범위를 키우고 사무실은 에이전트가 끝낼 수 있는 업무의 범위를 키웁니다. 이 움직임에 단위를 붙여야 한다면, 그것은 일입니다. 주머니에서는 일의 단위가 개인용 실무이고, 사무실에서는 일의 단위가 업무 프로세스입니다. 단위의 크기는 달라도, 잣대는 같습니다. 기준이 하드웨어 스펙에서 실행으로 이동했다는 점은, 두 뉴스가 말하는 것이 결국 같은 것이라는 뜻입니다.
그런데 실행 환경만 보면, 둘은 완전히 다른 존재로 보입니다. 주머니에서는 데이터가 자기 것이요, 실수의 영향권도 자기 일상이요, 실패의 대가는 예약 취소 한 번입니다. 사무실에서는 다릅니다. 에이전트가 ERP와 고객 데이터, 결제 정보 앞에 서고 거기서 틀리면 질문은 실수했네가 아니라 무엇을, 누구의 권한으로, 어떤 기록 아래 했느냐가 됩니다.
이게 바로 오늘의 에이전트 지형을 가르는 선입니다. 모델 크기가 아닙니다. 매개변수 숫자도 아니지요. 어떤 데이터를 건드리느냐, 과정을 설명할 수 있느냐, 궁극적으로 책임이 누구에게 오느냐. 크기는 속도와 비용을 결정하지만 신뢰가 자리를 결정합니다.

자리를 가르는 것은 가격표이기도 합니다
그 선은 신뢰만으로 그려지지 않습니다. 가격표가 함께 그립니다. 추론 하드웨어가 비싸지고 있기 때문입니다. 비즈워치 분석에 따르면 HBM4 가격은 올해보다 약 65% 오를 관측입니다. 내년 HBM 수요 증가율은 56%로, 공급 증가율 50%를 웃돌 전망입니다. 트렌드포스는 3분기 범용 D램 고정거래가가 전 분기 대비 13~18% 오를 것으로 내다봤습니다.
HBM 구도도 빠르게 바뀝니다. 카운터포인트리서치 집계에서 삼성전자 점유율은 1분기 21%에서 2분기에 33%로 뛰었고, SK하이닉스는 50%를 기록했습니다. 삼성의 HBM4 수율은 양산 초기 60% 미만에서 최근 80% 안팎까지 올랐다고 합니다. 올해 글로벌 HBM 시장은 전년 대비 58% 늘어난 약 546억 달러 규모가 될 전망입니다. 메모리가 비싸질수록, 그 메모리를 쓰는 추론은 더 비싸집니다. 엔비디아는 내년 칩 판매량을 올해의 2배로 늘리겠다는 목표를 밝히기도 했습니다.
하드웨어가 비싸질수록, 이 작업을 한 번 돌리는 데 얼마가 들느냐는 경영진의 질문이 됩니다. 아카마이코리아 강상진 상무는 AI 인프라의 미래는 분산형 환경에 달려 있다고 말합니다. 이경준 대표는 AI 인프라를 코어에서 엣지까지, 즉 사용자와 데이터에 가까운 곳까지로 규정합니다. 추론이 중앙 데이터센터에서 끝나는 것이 아니라 사용자와 데이터 가까이로 퍼져 나가는 그림입니다. 아카마이가 AI 실질 운영의 핵심을 보안으로 꼽는 이유도 같은 지점에 있습니다. 구축과 확장성, 최적화를 지나, 실제 운영 단계로 갈수록 보안이 핵심이 된다는 것입니다.
기업에게 질문은 어느 모델을 쓸까에서, 어느 작업을 어디에서 돌릴까로 바뀝니다. 주머니에 어울리는 일은 주머니로, 설명돼야 하는 일은 거버넌스가 있는 플랫폼으로. 온디바이스가 가벼운 작업을 흡수하면, 클라우드 추론 비용 구조를 온디바이스 라우팅과 함께 설계해야 한다는 계산도 여기에서 나옵니다. 그 판단을 가능하게 하는 것은, 작업 단위로 라우팅하고 감사를 남길 수 있는 거버넌스입니다.

기업의 에이전트, 자리의 문제
그렇다면 기업의 자리는 어떤 모양일까요. 어떤 에이전트가 무엇을 할 수 있는지를 정의해 주는 곳입니다. 무엇을 했는지, 언제, 누구의 권한으로 했는지는 기록으로 남습니다. 실행 환경을 격리하고 작업마다 맞는 모델을 골라 줍니다. ThakiCloud의 Paxis는 이 질문에 맞춰 설계된 에이전트 네이티브 클라우드로, 정식 제품으로 이미 시장에 나와 있습니다.
Paxis에서 스킬, 툴, 정책, 감사 로그는 일급 리소스로 다뤄집니다. 에이전트의 자율도는 L0에서 L3까지 단계별로 거버넌스를 받습니다. 정책 게이트가 각 실행을 검증하고 감사 로그가 기록을 남깁니다. 실행은 격리된 샌드박스에서 이루어지고 MCP 커넥터와 스킬 마켓을 통해 기업 자체의 도구도 연결할 수 있습니다. 소버린이나 온프레미스 K8s 배포도 가능합니다. CostRouter는 작업별로 모델을 선택합니다. 주머니에 어울리는 일이 불필요하게 클라우드로 올라가지 않게, 그리고 클라우드로 가야 할 일이 싼 모델에 무조건 맡겨지지 않게.
금융, 제조, 공공처럼 데이터가 건물을 나가지 않는 조직에서는 이 질문이 한 뼘 더 커집니다. 그들에게 플랫폼은 선호의 문제가 아니라 요건의 문제이며, 온프레미스와 소버린 배포가 논의의 출발점이 됩니다.
에이전트의 경로도는 그려지고 있는 셈입니다. 주머니가 가볍고 빠른 일을 가져가고 플랫폼이 설명돼야 하는 일을 가져가는 그림입니다. 오늘 스펙시트가 보여준 것은, 이 분화가 이미 하드웨어 레벨에서 시작됐다는 것입니다. 30B가 내려오는 속도와 15배가 올라오는 속도는, 같은 에이전트 시대의 반대편입니다. 지금 기업이 정해야 할 것은, 어느 에이전트에게 어느 자리를 주느냐입니다. 주머니 쪽의 스펙시트는 이미 다시 써졌고 사무실 쪽의 자리는 다음 의제입니다.

참고 자료
이 글은 아래 뉴스를 종합해 작성했습니다.
- 디지털데일리, [스냅드래곤 서밋] 퀄컴, 2nm ‘스냅드래곤8 듀얼 엘리트’ 체제 전환… 5
- 비즈워치, [AI 슈퍼사이클 나비효과]上 삼성의 맹추격…HBM 왕좌 바뀌나
- THE Biz(더비즈), [THE Biz&CEO] ‘HBM 굴욕’ 씻은 전영현 삼성전자 부회장… 다음은 파운드리
- 비즈니스플러스, [요즘 테크+/④]AI에게 ‘업무’를 맡긴다…직장 현장을 바꾸는 ‘에이전트…’
- 파이낸셜포스트, [분석] “AI, ‘실질 운영’하려면 핵심은 ‘보안’“…아카마이의 4대 조언
NotebookLM이 소스를 종합해 생성한 인포그래픽입니다.