LLM으로 법률을 물을 때 가짜 조문을 막는 법: 국가법령정보 Open API로 답을 근거에 묶기
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다. 문제는 모델의 지능이 아니라 답을 검증된 원문에 묶지 않은 설계입니다. 법제처 국가법령정보 Open API를 근거원으로 삼아 LLM 법률 답변을 인용 기반으로 바꾸는 방법을, 서빙 관점에서 정...
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다. 문제는 모델의 지능이 아니라 답을 검증된 원문에 묶지 않은 설계입니다. 법제처 국가법령정보 Open API를 근거원으로 삼아 LLM 법률 답변을 인용 기반으로 바꾸는 방법을, 서빙 관점에서 정...
허깅페이스가 공개한 hugging-voice와 그 엔진인 speech-to-speech는 VAD에서 STT, LLM, TTS까지 이어지는 실시간 음성 파이프라인을 OpenAI Realtime 호환 WebSocket으로 감쌌습니다. 클라이언트의 base URL 한 줄만 바꾸면 자체 ...
폐쇄형 모델이 정당한 보안·의료·법률 작업까지 거부하는 과잉 거부 문제가 다시 도마에 올랐습니다. Moonshot의 오픈웨이트 Kimi K3는 콘텐츠 필터를 아예 두지 않는다고 밝혔습니다. 이 설계가 운영자에게 무엇을 넘겨주는지, 그리고 그 부담을 어떻게 다뤄야 하는지를 정리했습니다.
Moonshot이 공개한 Kimi K3는 오픈웨이트 역사상 가장 큰 2.8조 파라미터 모델입니다. 점수는 화려하지만 곧바로 벤치마크 과적합 논쟁이 붙었습니다. 운영자가 이 모델을 도입하기 전에 무엇을 어떻게 검증해야 하는지를 정리했습니다.
레이어나 전문가 단위가 아니라 텐서 하나하나를 CPU와 GPU에 나눠 배치하면, RTX 4090 한 장으로 VRAM을 훌쩍 넘는 모델을 돌리면서 디코딩을 최대 3.29배 끌어올릴 수 있다는 논문 ATSInfer를 읽고, 그 원리와 우리 서빙 관점에서의 함의를 정리했습니다.
국내 사용자에게 250억 원이 청구된 사건부터 기업 60곳의 과다 청구 의혹까지, 최근 한 달의 AI 비용 뉴스는 하나의 공백을 가리킵니다. 한 번의 요청이 수백 번의 모델 호출로 번지는 에이전트 시대에, 청구서는 더 이상 무엇에 돈을 냈는지 설명해 주지 않습니다. 이 관측 공백을...
내 음성 에이전트의 어느 단계가 병목인지 벤더 SDK 없이 진단하는 공개 도구를 만들고, RunPod H200에서 우리 실제 스택(Qwen3-ASR·VoxCPM2·Qwen3-TTS)을 측정했습니다. STT는 빠르고, 비스트리밍 TTS가 진짜 병목이었습니다.
MoE 전문가를 CPU로 내려 24GB GPU 한 장으로 거대 모델을 돌린다는 ktransformers. 화제가 된 ‘28배’와 ‘40만 달러를 24GB로’를 RunPod에서 직접 쟀습니다. 트릭은 진짜였고, INT4 AMX 커널을 켜니 671B급이 디코딩 약 16 tok/s로 돌...
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.
Moonshot이 세계 최대 규모의 오픈웨이트 모델 Kimi K3를 공개했습니다. 프론트엔드 코딩 벤치마크에서 최상위 폐쇄 모델을 앞섰다는 점도 놀랍지만, 진짜 질문은 그 다음입니다. 2.8조 파라미터 모델을 자체 인프라에서 돌린다는 것은 실제로 무엇을 요구하는가. 타키클라우드 서...
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.
Google AI Edge의 Cormac Brick은 270M 파라미터의 FunctionGemma를 파인튜닝해 특정 에이전트 과제에서 정확도를 46%에서 90%로 끌어올린 사례를 발표했습니다. 핵심은 큰 모델을 부르는 대신, 작은 모델을 좁은 과제에 맞춰 폰 위에서 돌리는 것입니다...
Tencent이 공개한 Hy3 1-bit·4-bit GGUF 빌드는 295B MoE 모델을 598GB에서 85.5GiB까지 줄여 단일 GPU에서 돌립니다. 다만 여기서 말하는 단일 GPU는 128GB급 통합 메모리를 뜻하지, 16GB 소비자 카드가 아닙니다. 저희는 이 압축이 무엇...
PrismML이 공개한 Bonsai 27B는 Qwen3.6-27B를 새로 학습한 모델이 아니라, 아키텍처를 그대로 둔 채 가중치만 1-bit·ternary로 압축한 결과물입니다. Ternary 빌드는 5.9GB에서 FP16 품질의 94.6%를, 1-bit 빌드는 3.9GB에서 89...
지금까지 새 모델 아키텍처는 두 번 만들어야 했습니다. 한 번은 학습·연구를 위한 Transformers에서, 또 한 번은 프로덕션 추론을 위한 vLLM에서요. vLLM v0.25.0의 네이티브 속도 Transformers 백엔드는 이 이중화를 끝냅니다. 원리는 torch.fx로 ...
Unsloth로 모델을 4비트로 줄이는 방법을 아는 팀은 많습니다. 그런데 그 파일을 실제로 EC2에 올릴지, SageMaker 엔드포인트로 감쌀지, EKS 파드로 띄울지 정하는 순간 대부분 막힙니다. AWS가 Unsloth와 함께 낸 배포 가이드는 이 질문에 명확한 지도를 제시합...
누군가 GLM-5.2에서 1403GB를 980GB로 줄였다고 했습니다. 양자화도, 프루닝도 아니고, 비트 단위로 완전히 동일한 무손실 압축이라고요. 처음엔 믿기 어려웠습니다. 그래서 직접 Qwen2.5-0.5B의 가중치 4억 9천만 개를 열어 BF16 지수 필드의 엔트로피를 측정했...
Claude Code와 Codex 같은 코딩 에이전트는 Anthropic API에 묶여 있습니다. free-claude-code는 그 사이에 Anthropic 호환 프록시를 끼워, 같은 에이전트 UI를 그대로 쓰면서 요청을 Ollama, llama.cpp, vLLM 같은 자체 호스...
허깅페이스에서 GGUF 파일을 받아 실행 버튼만 누르는 사람과, 그 파일 안에 어떤 텐서가 몇 비트로 들어 있는지 아는 사람 사이에는 큰 차이가 있습니다. Qwen2.5-0.5B의 Q4_K_M 파일을 실제로 다운로드해 텐서 단위로 열어 보니, 이름과 달리 4비트 Q4_K는 전체의 ...
마이크로소프트는 엑셀과 아웃룩의 대량 AI 요청을 자사 모델로 돌리기 시작했고, 중국 오픈 모델은 미국 기업 AI 사용량의 절반 가까이를 잠식했으며, 시장에서는 1조 달러가 넘는 시가총액이 하루아침에 사라졌습니다. 프리미엄 프론티어 모델을 영원히 결제한다는 가정이 무너지는 중입니다...
SpaceXAI가 공개한 Grok 4.5는 Opus 4.8과 GPT-5.5에 근접한 성능을 절반 이하 가격에 내놓았습니다. 벤치마크 몇 점 차이보다 태스크당 비용과 토큰 효율이 실무 선택을 좌우하는 국면이 왔습니다. 실제 공개 수치로 그 경제학을 뜯어보고, ThakiCloud의 모...
거대 LLM과 에이전트 스킬이 좋아질수록 파인튜닝은 필요 없어진다는 체감이 업계에 퍼지고 있습니다. 실제로 OpenAI는 셀프서브 파인튜닝 API를 접는 중입니다. 그런데 같은 한 달 동안 정반대 방향의 신호도 쏟아졌습니다. 19일간의 프론티어 모델 셧다운, 파인튜닝을 전제로 설계...
284B DeepSeek V4 Flash가 35B Qwen3.6보다 output 토큰이 5배 저렴한 역설을 roofline 모델로 해부합니다. KV 캐시 읽기, MoE 배치 경제학, 8xH100 서빙 형태 계산까지 추론 원가의 실제 구조를 숫자로 설명합니다.
GLM-5.2 743B MoE를 AMD MI355X 한 노드에서 2,626 tok/s/node로 서빙하고 Blackwell 대비 2배 이상 저렴하게 만든 사례를, MXFP4 양자화와 SGLang MoE 병렬화 관점에서 검증하고 ThakiCloud ai-platform의 멀티벤더 서...
tom_doerr가 공유한 최대 384GB VRAM Personal AI Computer 빌드 가이드를 출발점으로, VRAM이 어떻게 실행 가능한 모델을 결정하는지 계산으로 따져보고, 이 개인용 한 대를 조직 규모의 온프렘 서빙으로 올릴 때 무엇이 필요한지 ThakiCloud ai...
대부분의 에이전트 업무는 프론티어 모델이 필요 없습니다. 스킬을 비싼 모델로 한 번 완성한 뒤 포맷을 코드로 내리면, 같은 품질을 싼 모델로 돌릴 수 있습니다. 팩시스는 이 판단을 매일 밤 자동으로 측정하고, 안전할 때만 모델을 내리며, 품질이 흔들리면 되돌립니다. 실제 측정치와 ...
NVIDIA B200 두 장에서 Qwen3.6-27B-NVFP4와 gemma-4-26B-A4B를 대상으로 텐서병렬, 데이터병렬, Prefill/Decode 분리(1P1D)의 초당 생성 토큰을 실제로 측정했습니다. 두 장뿐일 때 총 처리량의 승자는 분리가 아니라 데이터병렬이었고, 이...
NVIDIA가 Qwen3.6-27B를 NVFP4로 재양자화해 단일 Blackwell GPU에서 vLLM으로 바로 서빙할 수 있게 했습니다. MLP는 NVFP4로 내리고 어텐션과 KV 캐시는 FP8로 남기는 혼합 정밀도가 어떻게 22GB 안에 27B 모델을 담는지, 그리고 이 방식이...
앤트로픽이 공개한 Claude Fable 5 프롬프트 가이드를 뜯어봅니다. 이전 모델용 지시를 덜어내고, 진행을 도구 결과로 감사하고, 서브에이전트를 적극 쓰고, 지난 실행에서 배우고, 제약을 명시하라는 다섯 원칙을 ThakiCloud 에이전트 운영 관점에서 정리합니다.
LLM을 운영하면서도 KV 캐시가 왜 메모리를 잡아먹는지, GQA가 무엇을 절약하는지 설명하지 못한다면 최적화는 감에 의존하게 됩니다. amitshekhariitbhu/llm-internals는 토큰화, 어텐션 수식, 트랜스포머 블록, KV 캐시, MoE, GQA를 순서대로 엮은 ...
짧은 응답 요청이 긴 응답 요청에 밀려 기다리는 HoL 블로킹은 GPU 시간을 낭비하는 조용한 적입니다. 요청을 short-context 풀과 long-context 풀로 나눠 라우팅하는 Dual-Pool Token-Budget Routing은 arXiv 2604.08075에서 G...
2026년 중반 오픈웨이트 모델은 프런티어와 3~6개월 격차로 좁혀졌고, 그 격차는 더 벌어지지 않고 있습니다. 이제 진짜 의사결정은 모델 성능이 아니라 어디서 어떻게 돌릴 것인가, 즉 self-hosting 경제학으로 옮겨갑니다. ThakiCloud의 K8s 서빙 관점에서 정리합...
NVIDIA가 공개한 GLM-5.2-NVFP4 체크포인트는 469B MoE 모델을 단일 Blackwell 노드(8× RTX PRO 6000)에서 vLLM으로 서빙할 수 있게 합니다. 혼합 정밀도 양자화 구조와 공식 서빙 명령을 정리하고, 공개 수치 기반 메모리 사이징을 직접 계산해...
Z.ai의 1M 컨텍스트 오픈웨이트 모델 GLM-5.2의 후처리 학습을 떠받친 비동기 강화학습 인프라 slime이 완전 오픈소스로 공개되었습니다. Megatron 학습과 SGLang 롤아웃을 Data Buffer로 잇는 3-컴포넌트 구조, colocated/disaggregated...
코인베이스 CEO 브라이언 암스트롱이 공개한 AI 비용 통제법은 사용량 제한이나 경고 알림이 아니라 더 나은 기본값, 라우팅, 캐싱이었습니다. 직원의 91%가 애초에 사용 한도에 닿지도 않았다는 데이터를 근거로, 마찰을 늘리는 대신 LLM 게이트웨이의 기본 모델을 오픈웨이트로 바꾼...
DeepReinforce가 2026년 6월 25일 공개한 Ornith-1.0은 모델이 자신의 강화학습 훈련 스캐폴드를 직접 작성하는 자가-스캐폴딩(self-scaffolding) 메커니즘으로 만든 오픈소스 코딩 모델 패밀리입니다. 9B/31B 밀집과 35B/397B MoE 네 가지...
NVIDIA가 ZAI의 753B MoE 추론 모델 GLM-5.2를 NVFP4(4비트)로 양자화해 Hugging Face에 공개했습니다. 모든 가중치를 일괄로 깎는 대신 MoE 전문가의 선형 연산자만 4비트로 줄이고 공유 전문가와 어텐션은 BF16으로 남기는 선택적 양자화로, FP8...
NVIDIA가 6백만 개의 다국어 추론 데이터셋을 공개하며 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 확장된 고품질 훈련 데이터를 제공합니다.
RedNote가 공개한 dots.ocr로 다국어 문서 레이아웃 분석과 OCR을 단일 비전-언어 모델에서 구현하는 방법을 알아봅니다.