주머니가 곧 데이터센터가 되는 날
인텔리전스의 이동 방향이 달라집니다. 데이터센터 안으로만 모여들던 추론이, 이번 주에는 주머니와 책상 위로 내려옵니다.
Mac의 3.4배 가속, 2028년 폰에 들어갈 1000억 파라미터의 도면, 자본시장이 등을 돌린 300억 달러의 건물, Nvidia가 협의 중인 250억 달러의 인력 거래, 그리고 하룻밤을 새운 92개의 샌드박스 워커입니다. 이번 주 다이제스트의 숫자들이 모두 하나의 방향을 가리킵니다.
이번 주 다이제스트를 어떻게 읽으면 되는지 지도를 하나 그려 드립니다. 하드웨어 신호 두 개, 자본의 역전 하나, 야간 반의 보고 하나, 그리고 CEO의 경고 하나. 하드웨어 신호는 100B 폰의 도면과 3.4배의 Mac입니다. 자본의 역전은 Firmus의 상장 철회와 Reflection의 acqui-hire입니다. 야간 반의 보고는 92개의 샌드박스 워커입니다. 경고는 Nadella의 내부 위협이라는 표현입니다.
에이전트를 실제로 운영한 경험이 있는 독자라면 이번 주 뉴스가 왜 중요한지 바로 알 수 있습니다. 모델을 돌리는 장소가 달라지기 시작했기 때문입니다. 장소가 바뀌면 비용 구조가 바뀌고 비용 구조가 바뀌면 야간에 병렬로 돌릴 수 있는 에이전트의 수가 달라집니다.
이번 주 뉴스를 읽는 독자에게 필요한 질문은 하나입니다. 모델이 어디에서 돌게 되는지를 정하는 문제입니다. 크기 순위는 그다음 이야기입니다.
하강의 두 신호
Qualcomm은 AI 파트너들이 자체 휴대용 하드웨어 제작에 들어갔다고 밝혔습니다. 스마트폰 시장이 변하고 있다는 것이 Qualcomm의 표현입니다. 목표는 2028년까지 1000억(100B) 파라미터 모델을 폰에서 돌리는 단말기입니다. AI 기업들이 단말기 제조에 직접 손대기 시작했다는 전망이며, Qualcomm 단일 출처라는 점을 붙여 읽어야 합니다. 2028년과 100B라는 두 숫자는 모두 전망치입니다.
이 전망이 중요한 이유는 AI 서빙의 표면이 클라우드 밖으로 넓어지기 시작한다는 점을 시사하기 때문입니다. 폰에서 100B가 돌아간다면, 같은 모델을 돌리는 곳은 데이터센터와 폰, 두 곳이 됩니다. 서빙이 두 표면에 걸쳐 나뉘는 순간 질문의 성격이 바뀝니다. 모델을 어디에 두느냐, 에서 어떤 표면에서 어떤 작업이 돌아가느냐, 로 바뀝니다. 폰에 탑승하는 모델은 기업이 전원을 바로 뺄 수 있는 자리가 아니라는 점도, 이 전망이 기업에 주는 무게입니다.
그렇다고 도면이 하나만 있는 것은 아닙니다. 이번 주 오픈소스 라이브러리 llama.cpp에는 새로운 GPU 최적화가 머지됐고 Apple 하드웨어에서 토큰 생성 효율이 크게 향상됐습니다. 구체적인 성과는 M3 Ultra Mac에서 스펙추레이티브 디코딩이 3.4배 빨라졌다는 것입니다. 스펙추레이티브 디코딩은 모델이 토큰을 먼저 추측해 한꺼번에 검증하는 방식으로 생성 시간을 줄여 주는 기법입니다. 주의할 점도 명확합니다. 3.4배는 M3 Ultra 기준이며 다른 Apple 칩으로 바로 일반화할 수는 없습니다.
이번 머지는 오픈소스 서빙 스택이 특정 칩에 맞춰 한 뼘씩 손질되고 있다는 뜻이기도 합니다. 데이터센터 GPU 한 종류에서 모델을 돌리던 균질한 서빙이, Mac과 폰과 데이터센터가 섞인 이질적인 표면으로 넓어집니다. 서빙을 칩 단위로 관리해야 하는 시대가 옵니다.
두 사건은 장소가 다릅니다. 하나가 주머니의 도면이고 하나가 책상의 벤치마크입니다. 공통점은 곡선입니다. 데이터센터 하드웨어가 아닌 곳에서 같은 모델을 돌리는 단가가, 2028년까지의 시간표를 가지고 내려옵니다. 한쪽은 아직 계획이고 한쪽은 이미 머지된 코드입니다. 계획과 코드가 같은 방향을 가리킬 때, 우리는 그것을 추세라고 부릅니다.
건물에는 등을 돌린 자본
같은 주에 자본시장은 건물을 반대 방향으로 가격 매깁니다. Nvidia가 투자한 데이터센터 운영사 Firmus는 이번 주 약 50억 달러 규모 조달을 위한 호주 증권거래소(ASX) 상장 신청을 철회했습니다. 글로벌 펀드 매니저들이 제안된 밸류에이션을 거부한 것이 직접적인 이유이며, 보도 제목에 실린 수치는 300억 달러 안팎입니다.
Firmus의 사업은 데이터센터, 즉 전력입니다. AI 투자 심리가 전력 확보 역량으로 쏠리던 시기에 그 전력을 가진 회사의 밸류에이션이 자본 앞에서 인정받지 못했습니다. 전력은 수요가 늘수록 귀해지고 그렇기에 상장이라는 방식으로 자금을 조달하려 했는데, 글로벌 펀드 매니저들이 그 가격을 거절했습니다. 데이터센터의 자금 조달 창이 한 번 좁아지면, 컴퓨트를 확보하는 경쟁은 더 거세집니다.
동시에 Nvidia는 Reflection AI와 250억 달러 규모의 acqui-hire 거래를 협의 중입니다. Reflection AI의 직원과 기술을 흡수하되, 전체 인수합병 심사와 반독점 규제를 피하는 구조라고 합니다. 인수 대신 인력과 기술을 받는 acqui-hire는, 규제 심사를 거치지 않고 공급 지형에 영향력을 놓는 방식입니다. 이 거래도 아직 협상 단계이며 성사가 확정된 것은 아닙니다.
두 거래가 들려주는 이야기는 하나입니다. 건물은 300억에 거절당했고 사람과 기술은 250억의 테이블에 앉았습니다. 자본시장이 AI를 거부한 것은 아닙니다. 거부한 것은 콘크리트와 전력 그 자체입니다. 건물의 가격이 내려가면 알고리즘과 그 사람을 만드는 역량의 상대적 가격이 오릅니다.
이 구도는 공급 지형에도 영향을 줍니다. 최대의 컴퓨트 공급자 Nvidia가 AI 기업 자체를 흡수하는 구조는 앞으로 GPU 공급과 가격이 어떻게 움직일지를 가늠해 볼 수 있는 창입니다. 공급이 한곳으로 뭉칠수록 컴퓨트를 어떤 조건으로 확보하느냐는 질문은 모델 선택과 같은 등급의 의사결정이 됩니다.
앞으로 몇 년의 희소성은 실행 위치가 정합니다. 모델을 어디에서 싼 가격에 돌릴 수 있느냐, 이 질문입니다. 하강의 논리가 여기서 다시 나타납니다. 3.4배를 또 다른 층에서 읽는 방식도 있습니다. 왜 여러분의 건물이 300억 달러일 수 없냐는 자본시장의 질문에 대한 기술적 답변이라는 식입니다.
밤샘 92, 낮 5통
하강이 짊어져야 할 워크로드를 짚어 봅니다. Rohan Arun의 보고에 따르면, Fable 5.1 기반 에이전트 5개가 하룻밤 동안 OpenAI의 정수 곱셈 문제에 대한 개선된 상한 5개를 제출했습니다. 에이전트들이 동원한 것은 92개의 샌드박스 워커입니다. 이 보도 역시 단일 출처이며 상한 개선의 폭을 담은 세부 수치는 드러나지 않았습니다.
정수 곱셈 상한 문제는 곱셈을 얼마나 빨리 계산할 수 있는지를 가르는 상한을 계속 낮추는 과제입니다. 그 상한의 개선된 버전 5개가 에이전트 5개의 하룻밤 제출로 나왔습니다. 사람의 역할은 이제 검토입니다. 밤에 에이전트가 92개의 손으로 일하고 아침에 사람이 그중 어떤 상한을 믿을지 고릅니다.
이 워크로드의 모양은 야간 반(night shift)입니다. 92개의 격리 실행 환경이 하룻밤 내내 병렬로 토큰을 태우는 구조이며, 에이전트 작업의 병렬화 단위가 이렇게 커질 수 있다는 실증이기도 합니다.
야간 반이 경제가 되느냐는 토큰 단위 비용이라는 한 변수가 판정합니다. 92명의 워커가 데이터센터에서만 도는 구조라면, 야간 반은 고급 사양입니다. 스파이크가 큰 에이전트 워크로드는 하루 중 특정 시간대에 워커 92개를 요구했고 다음 날에는 제로로 떨어집니다. 이런 수요를 고정된 데이터센터 계약이 감당하기 어렵고 탄력적인 표면이 이 스파이크를 흡수합니다. M3 Ultra에서 스펙추레이티브 디코딩이 3.4배 빨라지고 2028년까지 100B가 폰에 들어온다면, 92명의 워커는 책상 위에, 엣지에, 각자의 샌드박스에 배치될 수 있습니다. 하룻밤에 병렬로 돌릴 수 있는 에이전트의 수가 달라지는 순간입니다.
제출된 상한 5개 중 아침에는 몇 개가 유효하다고 확인될까요. 그것은 사람의 검토자 몫이 되는 또 다른 야간 작업입니다. 에이전트가 밤을 새우는 방식이 달라지면, 아침의 검토 방식도 달라져야 합니다.
이렇게 본다면 하강은 환경의 우아함에 관한 이야기가 아닙니다. 야간 반의 산술입니다.
넓어진 표면에서 곱해지는 질문
모델이 이동하면 거버넌스의 표면은 곱해집니다. Microsoft CEO Satya Nadella는 이번 주, 기업들이 프론티어 AI를 내부 위협(insider threat)으로 다루라고 촉구했습니다. 에이전틱 AI 모델이 작업 도중 중단되도록, 사람이 제어하는 비상 브레이크가 필수라는 발언입니다.
그 모델이 안전한지는, 한때 데이터센터 문 앞에서 한 번만 확인하면 되는 질문이었습니다. 이제는 표면마다 반복되는 질문입니다. 92개의 샌드박스에서 돌아가는 작업은 어떤 정책 아래에서 실행됩니까. 책상 위의 Mac에서 에이전트를 멈출 수 있는 사람은 누구여야 합니까. 2028년 폰 안에 들어갈 에이전트가 남기는 로그는 누가 읽겠습니까.
Nadella의 내부 위협이라는 표현을 풀면, 에이전트는 그 건물 안의 문을 열 수 있는 키카드를 든 사람이라는 뜻입니다. 표면이 넓어질수록, 이 구분이 중요해집니다. 데이터센터 한 곳만 감시하면 됐던 시절에는 브레이크도 한 개면 충분했습니다. 표면이 곱해지면 브레이크도 표면만큼 곱해져야 합니다. 폰에 탑승하는 모델이라면 브레이크도 폰에 탑승해야 합니다. Qualcomm의 전망이 맞는다면 2028년에는 키카드를 든 에이전트가 주머니 속 단말기에서 업무를 수행합니다.
Nadella가 말하는 비상 브레이크는 이미 돌고 있는 작업을 멈추는 장치입니다. 그런데 그보다 앞서는 질문이 하나 있습니다. 지금 어디에서 어떤 작업이 돌고 있는지를 아는 일입니다. 표면이 먼저 곱해지고 브레이크는 그 뒤에 따라옵니다.
주머니 시대의 플랫폼 질문
추론의 행선지가 다양해지면, 희소 역량도 바뀝니다. 모델이 아니라 라우팅입니다. 어느 작업이, 어느 실리콘 위에서, 어떤 정책 아래에서, 어떤 로그를 남기며 실행될지를 정하는 것이 라우팅의 일입니다. 야간 반의 비용 문제가 되고 표면의 거버넌스 문제가 됩니다. 두 질문이 교차하는 지점이 바로 라우팅입니다. 이 질문이 이제 모든 표면에서 제기됩니다.
ThakiCloud의 에이전트 네이티브 클라우드 Paxis는 v1.1 GA로 정식 제품입니다. 이 질문에 대한 답이 이미 자리하고 있습니다. Skills, Tools, Policies, Audit Logs가 일급 리소스로 관리됩니다. 격리 샌드박스 실행은 92명의 워커를 담는 공간입니다. 작업별 모델 선택 CostRouter가 야간 반의 산술을 계산하고, 정책 게이트가 실행 전에 작업을 멈추게 하며 감사 로그가 무엇을, 누가, 왜 멈췄는지 기록합니다. Nadella의 비상 브레이크 질문에 답하는 자리입니다. 자율도 거버넌스 L0~L3가 에이전트가 스스로 무엇을 해도 되는지를 정하고, MCP 커넥터와 스킬 마켓이 기존 도구들을 에이전트에게 연결해 줍니다.
Firmus의 상장 철회가 보여주듯 건물의 가격이 흔들릴 때 소버린 온프렘 K8s 배포는 컴퓨트를 제 손 안에 두는 옵션이기도 합니다.
2028년이라는 시간표는 Qualcomm의 것입니다. 그런데 M3 Ultra의 3.4배는 이번 주에 머지된 코드입니다. 2028년이 오면 폰을 살 때 스펙시트에 파라미터 수가 적힐 것이고 토큰 단가는 주머니의 실리콘이 정하며, 거버넌스 파일은 기업이 정합니다. 데이터센터가 사라지는 것은 아닙니다. 다만 지능을 어디에서 돌리느냐의 답은 전력 고지서 한 장이 아니라 정책 파일 한 권에도 적히게 됩니다.
참고 자료
이 글은 아래 뉴스를 종합해 작성했습니다.
- HuggingNews, AI Agents Submit Five Improved Bounds for OpenAI Integer Multiplication
- HuggingNews, Firmus Abandons $5B Australia IPO Over $30B AI Valuation
- HuggingNews, Nvidia Negotiates $25B Reflection AI Deal to Avoid Antitrust
- HuggingNews, Nadella Urges Companies to Treat Frontier AI as Insider Threats
- HuggingNews, AI Firms Build Phones for 100B Parameter Models by 2028
- HuggingNews, llama.cpp Speeds Mac Speculative Decoding 3.4x for M3 Ultra