월 2,000 커밋에도 vLLM이 무너지지 않는 법: CI·벤치마크·릴리스의 세 가지 장치
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다. 그 비결은 ‘더 많은 테스트’가 아니라 벤치마크 게이트, 릴리스 브랜치 고정, 커밋 단위 이등분이라는 세 가지 결정론적 장치입니다. vLLM 유지관리팀이 공개한 운영기를 타키클라우드 서빙 관...
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다. 그 비결은 ‘더 많은 테스트’가 아니라 벤치마크 게이트, 릴리스 브랜치 고정, 커밋 단위 이등분이라는 세 가지 결정론적 장치입니다. vLLM 유지관리팀이 공개한 운영기를 타키클라우드 서빙 관...
Claude Code 데스크톱이 iOS 시뮬레이터를 대화 옆 패널에 띄우는 기능을 공개 베타로 내놨습니다. 앱을 빌드해 실행하고, Claude가 실행 중인 화면을 직접 보며 고쳐 나가는 이 닫힌 루프가 무엇을 바꾸는지, 어떻게 켜는지, 그리고 에이전트 네이티브 클라우드 관점에서 왜...
Archify는 Mermaid 문법을 배우지 않고도 평범한 문장 설명만으로 자기완결형 HTML 아키텍처 다이어그램을 만드는 에이전트 스킬입니다. 실제로 설치해 타키클라우드 ai-platform 구조를 그려 보니, 핵심은 그림이 아니라 레이아웃을 강제로 검증하는 렌더러였습니다. 그 ...
Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다. claude --ax-screen-reader 한 줄이 무엇을 바꾸는지, 어떤 원리로 동작하는지, 그리고 에이전트 인터페이스의 접근성이 왜 타키클라우드 같은 플랫폼에 중요한 문제...
오픈소스 마케팅 플러그인 Digital Marketing Pro는 스킬 158개와 전문 에이전트 24개를 하나로 묶고도 무너지지 않습니다. 비결은 12단계 고정 흐름이라는 결정론적 골격입니다. 이 설계를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어떻게 제품화하는지 정리했습니다.
AI 코딩 도구가 매 세션 규칙을 잊어버리는 문제를, 한 해커톤 우승자가 실제 TypeScript 마이크로서비스를 6개월 돌리며 쌓은 설정으로 풀었습니다. everything-claude-code의 얇은 하네스·두꺼운 스킬 구조를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어...
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.
Claude Code가 v2.1.101에서 /simplify를 /code-review로 바꾸면서 리뷰에 노력 단계를 붙였습니다. low와 medium은 확신 높은 소수의 지적만, high와 max는 넓은 커버리지와 불확실한 발견까지, ultra는 클라우드에서 여러 에이전트가 병렬로...
대규모 모델을 여러 가속기에 나눠 학습하거나 서빙할 때, 실제 병목은 연산이 아니라 가속기 사이를 오가는 데이터입니다. 이 글은 all-reduce, all-gather, reduce-scatter, all-to-all 같은 컬렉티브 연산이 무엇인지, 그리고 이 연산들이 GPU 클...
vLLM v0.25.0이 232명의 기여자가 보낸 558개의 커밋과 함께 나왔습니다. 이번 릴리스의 핵심은 두 가지입니다. 첫째, Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 되었습니다. 둘째, vLLM을 처음 유명하게 만든 PagedAttention의 레거시...
Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다. serve-sim은 시뮬레이터의 프레임버퍼를 브라우저로 스트리밍하고 WebSocket으로 제어까지 열어, AI 코딩 에이전트가 헤드리스 환경에서 iOS 앱을 빌드하고 실제로 조작하며 테스트하게 합...
Anthropic의 Claude Fable 5가 프런트엔드 생성에서 새로운 기준을 세우고 있습니다. 스크롤로 제어되는 3D 씬, GLSL 셰이더, 스크린샷 기반 리디자인을 단일 프롬프트에서 뽑아내는 워크플로를 실제 공개 가이드와 오픈소스 갤러리를 근거로 정리하고, 코딩 에이전트를 ...
Anthropic이 2026년 7월 7일 ‘Getting started with loops’라는 첫 공식 루프 엔지니어링 문서를 공개했습니다. 매 단계를 사람이 프롬프트로 지시하는 방식에서, 에이전트를 대신 프롬프트해 주는 시스템을 설계하는 방식으로 넘어가는 전환입니다. 수동 루프...
모노레포에서 라이브러리 디렉터리와 소비 서비스 디렉터리를 오갈 때, 세션을 재시작하면 대화 맥락도 프롬프트 캐시도 함께 날아갑니다. Claude Code v2.1.169에 들어온 /cd 명령은 실행 중인 세션을 다른 디렉터리로 옮기면서 캐시를 그대로 유지합니다. 캐시 읽기(0.1배...
T3 창시자 Theo가 공유한 Claude Fable 5 운용 팁을 뜯어봅니다. effort 레벨 선택, Codex 오케스트레이션, CLAUDE.md 모델 우선순위, 토큰 무거운 작업 위임까지. ThakiCloud가 Paxis와 ai-platform에서 쓰는 모델 라우팅 규율과 나...
교수의 논문 작성 노하우를 Codex, Claude Code, Gemini 어디서나 불러 쓰는 Skill 패키지로 묶은 오픈소스 프로젝트가 화제입니다. 단순 프롬프트 모음과 무엇이 다른지, Agent Skill이라는 형식이 왜 중요한지, 그리고 수백 개의 Skill로 에이전트 플랫...
Ollama는 쉽고 vLLM은 빠르다는 통념을 2026년 RTX 4090 공개 벤치마크로 다시 검증합니다. 단일 사용자에서는 격차가 13% 안팎이지만, 동시 50명에서는 vLLM이 약 6배 처리량을 냅니다. PagedAttention과 연속 배칭이 만드는 확장 곡선의 차이, 그리고...
AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다. 정작 프로덕션에서 무너지는 지점은 루프를 멈추는 가드레일입니다. 외부 LLM 없이 순수 파이썬으로 가드레일이 붙은 최소 ReAct 루프를 직접 돌려, 단계 상한과 반복 탐...
docker-android는 Android 에뮬레이터를 단일 컨테이너로 패키징해 헤드리스로 띄우는 오픈소스 프로젝트입니다. 이미지 크기와 KVM 요구사항을 실제 문서 기준으로 확인하고, ThakiCloud K8s 플랫폼에서 디바이스 패스스루 워크로드를 운용하는 관점을 정리합니다.
Vibe Coding과 Agentic Coding이 가져온 새로운 개발 문화를 어떻게 받아들이고 발전시킬 것인가? 과거의 관습에서 벗어나 AI와 함께하는 협업 문화 구축 가이드