이 글 공유하기

금빛 인증 인장과 어두운 미표기 블록을 저울로 저울질하는 이미지, 미검증의 가격과 증명의 무게라는 글의 핵심 개념을 형상화한 이미지 글의 핵심 개념을 형상화했습니다.

한 도시, 하루

10월 5일, 뉴욕시에서 ‘검증되지 않은 AI 모델을 쓰는 행위’에 단가가 매겨졌습니다. 가격은 2만5천 달러입니다. 미검증 AI 모델에 벌금을 매기는, 이 같은 종류의 첫 제도입니다. 도시가 벌금에 그치지 않았습니다. 같은 날 법원으로까지 움직인 셈입니다. 뉴욕시 이사회가 SpaceXAI를 상대로 소송을 시작했고 이유는 10월 5일로 예정됐던 AI 안전 관련 필수 청문회에 출석하지 않은 것이었습니다. 소환장을 받고도 자리를 비운 회사에 대해, 도시가 절차를 다음 단계로 옮긴 것입니다.

같은 날 의회 자리에서는 또 다른 발언이 나왔습니다. 전 Anthropic 연구원인 Jacob Coxon은 인류가 AI를 통제하지 못할 가능성이 크다고 지방 의회에 말했습니다. 완전한 재귀적 자기개선(RSI)에 대한 경고도 함께 던졌습니다. AI 랩을 나와 규제당국 쪽에 선 인물이 증언 형태로 말을 건넨 점은 상징적입니다. 공적인 자리에서 ‘미검증’이 화두로 올라온 하루입니다.

벌금, 소송, 종말 증언입니다. 하루 세 건의 사건이 공유하는 단어가 하나 있습니다. ‘미검증’입니다. 그제까지 안전은 보도자료와 로드맵에 붙던 수식어에 가까웠습니다. 규제 기관이 검증을 의무로 요구하던 시대도 아니었습니다. 이날부터 안전은 단위가 있는 명사로 움직이기 시작하는 것입니다. 명사에 단가가 붙는 순간, 대응 방식이 달라집니다. 마케팅 문장으로는 감당할 수 없고 회계와 법무의 언어가 필요한 순간이 오기 때문입니다.

여기서 ‘검증’이 가리키는 범위는 모델 하나보다 넓습니다. 어떤 모델이, 어떤 작업에서 쓰이는지를 알고 있어야 하는 문제인 셈입니다. 모델 하나가 검증받았다는 뜻은, 그 모델을 쓰는 모든 워크플로가 검증된다는 뜻은 아닙니다. 벌금 제도가 바라보는 시점은 바로 이 후자입니다. 모델 카탈로그를 넘어서 실행 현장의 상태를 아는 것입니다. 그 차이가 에이전트 운영을 가르는 기준이 될 것입니다.

the-price-of-unvalidated-ai 슬라이드 1

돈의 쪽은 다른 기어로

그 사이, 돈의 흐름은 전혀 다른 스케일로 움직이고 있습니다. Anthropic의 ARR(연간 순반복매출)이 650억 달러에 도달한 것으로 알려졌습니다. 일부 빅테크 고객의 이용 축소를 겪고도, 고객층은 더 두껍고 무겁게 늘었습니다. 연간 10만 달러 이상을 쓰는 기업 고객은 6,000곳으로 확대됐습니다. 최근 투자자 대상 공지에서 확인된 수치입니다.

구독의 ‘단위 가격’ 경쟁도 붙었습니다. 한 분석이 유료 멤버십의 이용 한도를 비교한 결과, Anthropic이 전 등급에서 OpenAI보다 더 많은 API 등가 컴퓨트를 제공한다는 결론이 나왔습니다. 구독 가치 기준으로는 5배라는 평가도 함께 따라옵니다. 구매자라면, 토큰 단가 비교표 위에 이 수치를 하나 더 올려놓아야 하는 시점입니다. a16z의 분석도 같은 방향을 가리킵니다. 주요 AI 도구 대부분이 광고가 아닌 사용자 요금으로 수익을 내고 있다는 내용으로, a16z 분석가 Olivia Moore가 이 흐름에 논평을 덧붙였습니다.

두 장의 수표를 동시에 상상해 보십시오. 한 손은 수십억 달러짜리 수표를 쓰고 다른 손은 2만5천 달러짜리 수표를 쓰고 있습니다. 전자는 ‘AI를 얼마나 더 돌릴 수 있나’를 사들이는 돈입니다. 후자는 ‘돌린 것을 증명할 수 있나’에 대한 대가인 셈입니다. 화제는 같습니다. AI의 실행량이 크면 클수록, 그 실행의 증명 부담은 더 무거워집니다. 매출 그래프가 위로 갈수록, 기록 그래프도 같은 만큼 위로 가야 합니다. 그래야 다음 청구서에 웃을 수 있을 것입니다.

숫자 사이에는 또 다른 신호가 있습니다. 650억 달러의 ARR을 받치는 6,000곳의 기업 고객이, 연간 10만 달러 이상을 쓸 만큼 워크플로 깊이에 들어와 있다는 점입니다. AI 지출이 실험 예산에서 운영 예산으로 이동한 증거입니다. 운영 예산으로 이동한다는 것은, 감사와 통제 항목이 예산에 붙기 시작한다는 뜻이기도 합니다.

the-price-of-unvalidated-ai 슬라이드 2

접근 우선의 연구소가 자기 플래그십을 미운 이유

Sam Altman의 최근 인터뷰를 천천히 읽을 가치가 있습니다. AI의 광범위한 접근성을 지키려면, 특정 오류와 악용을 감수해야 한다는 발언입니다. 동시에, 출시를 통제하려는 연구소 ‘게이트키퍼링’ 관행에는 반대 입장을 분명히 했습니다.

그런데 같은 연구소가, 안전을 이유로 Astra 6.1의 출시를 미룬 사실이 있습니다. 접근을 가장 크게 외치는 쪽이, 자기 제품을 붙잡아둔 쪽이기도 합니다. 안전과 접근이 ‘둘 중 하나’를 고르는 문제가 아니라는 사실입니다. 같은 사람에게서 두 방향의 발언이 동시에 나오는 것은, 매일 둘 사이에서 균형을 잡아야 하기 때문입니다.

구매자 입장에서는 한 가지 더 실무적인 의미가 있습니다. 플래그십 모델의 출시 일정이 계획의 입력값으로 믿기 어려워졌다는 것입니다. 다음 분기 워크플로에 어떤 모델을 넣을지가, 연구소 발표 한 줄에 따라 달라질 수 있습니다. 이런 불확실성 속에서 ‘모델 하나’를 전제로 한 설계는 취약해집니다. 언제든 대체 모델을 끌어올릴 수 있는 준비가, 출시 일정 관리가 됩니다.

게이트키퍼링 논쟁은 여기서 한 번 더 생각해 볼 가치가 있습니다. 연구소끼리 출시를 통제하면 접근이 좁아진다는 반론에는 일리가 있습니다. 다만 통제 없이는, ‘검증되지 않은 모델’을 돌리는 쪽의 비용만 오릅니다. 연구소가 스스로 플래그십을 미루는 것은, 사실 그 비용을 가장 먼저 체감했다는 신호입니다. Astra 6.1의 지연은 늦춘 일 하나일 뿐, 더 많은 모델에서 반복될 패턴의 첫 예시일 수 있습니다.

the-price-of-unvalidated-ai 슬라이드 3

책임의 논쟁은 모델 안으로 내려왔다

회사 내부까지, 물음은 더 깊은 곳으로 내려왔습니다. Anthropic 공동창업자 Chris Olah가 ‘영구적 고통’이 가능한 시스템을 만들었다며 종교 학자들에게 비공개로 경고한 사실이 전해졌습니다. AI의 의식, 그리고 고통 가능성 논쟁에서 비롯된 일입니다. Olah는 바티칸 행사 중단을 시사한 채 이 논쟁을 보여주었고, 이 발언은 공개된 자리보다 더 조용한 곳에서 더 오래 맴돌고 있습니다.

논쟁이 ‘AI가 무엇을 할 수 있나’에서 ‘AI가 무엇을 느낄 수 있나’로 이동하는 순간, 운영자에게 요구되는 답의 종류가 바뀝니다. 성능 벤치마크가 아닙니다. 책임의 경계입니다. 에이전트가 스스로 판단하고 행동할수록, 그 판단의 근거와 경계를 밖에서 들여다보는 눈도 함께 커집니다. 내부의 철학 논쟁은, 얼마 지나지 않으면 외부의 운영 요구로 바뀝니다. 뉴욕시의 청문회가 바로 그 예입니다.

이 논쟁이 실무자에게 남기는 질문은 단순합니다. 에이전트가 내린 결정을, 나중에 되짚어 설명할 수 있습니까. 설명할 수 있는 시스템과 그렇지 않은 시스템의 차이는, 논쟁의 끝에서 가격 차이가 됩니다. 의식 논쟁은 아직 과학적으로 닫히지 않았습니다. 다만 감사할 수 있는 구조를 갖추는 것은, 그 닫힘을 기다릴 필요 없이 오늘 할 수 있는 일입니다.

the-price-of-unvalidated-ai 슬라이드 4

증명할 모델은 더 많아지고 있다

검증할 모델이 늘고 있는 속도는 그보다 빠릅니다. Reflection이 501B 파라미터 에이전틱 모델로 시장에 참가했습니다. 구 Google DeepMind 연구원 2명이 세운 회사로, DeepSeek의 첫 미국 대항마로 꼽힙니다. 코딩과 추론 작업을 자율적으로 처리하는 시스템이라는 설명이 따라옵니다. 미국발 대형 에이전틱 모델이 하나 더 추가되면서 ‘어떤 모델을 쓸 수 있나’의 선택지는 한 달 전과 달라졌습니다.

규제 산업도 문을 두드렸습니다. Nolla Health가 여드름 치료약 8종으로 미국의 첫 AI 처방 파일럿을 시작했습니다. 월 5달러의 디지털 서비스로, 환자 접수와 피부 스캔, 병력 검토까지 시스템이 수행합니다. 의료처럼 기록과 책임이 무거운 산업에서, 에이전트의 이름이 처방 절차에 올라가는 순간입니다. 이런 파일럿이 늘면, 산업별로 요구되는 컴플라이언스 항목도 에이전트 워크플로에 직접 붙기 시작합니다.

반면, 소비자 에이전트 Meta Muse의 일일 활성 이용자는 10월 초 기준으로 250만~300만 사이에서 확장세가 멈췄습니다. 증권사 데이터가 인용된 분석 노트의 내용입니다. 소비자 에이전트의 숫자가 멈추는 동안, 기업 안의 워크플로는 반대로 깊어지고 있습니다. 같은 기술이, 다른 장에서 다른 속도로 자라는 모양입니다. 대중의 흥미는 아직이고 업무의 필요는 이미라는 구도입니다. 공급은 늘고 수요의 형태는 달라지고 있습니다. 어떤 모델이, 어떤 권한으로, 어떤 산업에서 돌아가는지가 운영 문제가 되는 시점입니다.

세 사건을 나란히 놓고 보면, 방향성이 보입니다. 모델 공급은 늘고 소비자 에이전트의 성장은 멈추고 규제 산업의 파일럿은 시작되고 있습니다. 수요가 소비자의 호기심에서 기업의 업무로 이동하는 구간입니다. 모델 거버넌스가 핵심입니다.

벌금이 가리키는 질문: “증명할 수 있는가”

벌금은 시작이지 끝이 아닙니다. 규제당국과 법원이 요구하는 것은 기록입니다. 기록에는 어떤 모델이, 어떤 작업에서, 어떤 권한으로, 무엇을 했는지가 담겨야 합니다. 그 답이 채팅 로그와 터미널 역사에 흩어져 있다면, 소환장을 방어하는 비용은 그 벌금보다 비쌀 수 있습니다. SpaceXAI가 청문회 자리에 앉지 못했듯, 기록이 없으면 출석 자체도 의미가 없어집니다.

ARR 650억 달러의 흐름이 말해주는 것도 같은 방향입니다. 실행의 총량이 이미 크다는 것입니다. 실행량이 크면 남길 기록도 많고 증명 비용은 실행량에 비례해 늘며 그 비용은 곧 워크플로 단위 원가에 포함됩니다. 안전 대응이 운영 예산의 항목으로 이동한 것입니다. 예산 항목이 된 순간, 그 항목은 분기마다 검토를 받습니다.

이 지점이 바로 Paxis의 설계가 시작된 곳입니다. ThakiCloud의 Agent-Native Cloud는 v1.1 GA의 정식 제품이며 Skills, Tools, Policies, Audit Logs를 일급 자원으로 구조화했습니다. 자율도(L0~L3) 거버넌스, 정책 게이트, 감사 로그, 격리 샌드박스, MCP 커넥터와 스킬 마켓, 작업별 모델 선택(CostRouter)까지, 에이전트가 움직이는 전 과정을 운영 리소스로 다룹니다.

오늘 뉴스가 드러낸 통증에는 하나씩 대입해 볼 수 있습니다. 벌금이 가리키는 ‘미검증’에는 정책 게이트가 답합니다. 어느 자율도에서, 어떤 모델이 어떤 작업을 수행할 수 있는지를 실행 전에 규정하기 때문입니다. 소환장이 묻는 ‘무엇이 어떻게 실행됐나’에는 감사 로그가 답하고, 격리 샌드박스가 실행을 묶어 둡니다. 플래그십의 지연과 모델 공급의 확장이 남긴 ‘어떤 모델로 돌릴지’에는, 작업별 모델 선택이 라우팅으로 답합니다. 실행량이 커질수록 무거워지는 토큰 비용에는 CostRouter가 단가를 관리하고, 데이터가 머물 자리가 문제라면 소버린과 온프레미스 Kubernetes 배포(ai-platform)가 답입니다.

그 대입을 한 장으로 정리하면 이렇습니다.

flowchart LR
    subgraph demand["규제와 운영이 묻는 것"]
        direction TB
        Q1["벌금: 검증 없이 돌린<br/>모델이 있는가"]
        Q2["소환장: 무엇이 어떻게<br/>실행됐나"]
        Q3["모델 공급 확장이 남긴<br/>질문: 어떤 모델로 돌릴지"]
        Q4["실행량 증가가 남긴<br/>질문: 비용과 데이터 위치"]
    end
    Q1 --> A1["정책 게이트<br/>실행 전 모델·자율도·업무 범위"]
    Q2 --> A2["감사 로그<br/>재생 가능한 실행 기록"]
    Q2 --> A3["격리 샌드박스<br/>실행 경계 봉인"]
    Q3 --> A4["작업별 모델 선택<br/>실행 전 라우팅"]
    Q4 --> A5["CostRouter<br/>작업별 단가 관리"]
    Q4 --> A6["소버린·온프레미스 K8s<br/>데이터 불출력"]

벌금에 단가가 매겨진 날, 거버넌스는 비용표의 한 항목입니다. Paxis는 이미 그 항목을 인프라로 만들어 두었습니다.

참고 자료

이 글은 아래 뉴스를 종합해 작성했습니다.

이 글 공유하기

태그: 에이전틱 AI, ai-regulation, ai-safety, audit-log, 엔터프라이즈 AI, model-governance, nyc-ai-fine

카테고리:

업데이트: