개발

Claude Code 스크린 리더 모드: 터미널 AI 코딩을 모두에게 여는 한 줄

Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다. claude --ax-screen-reader 한 줄이 무엇을 바꾸는지, 어떤 원리로 동작하는지, 그리고 에이전트 인터페이스의 접근성이 왜 타키클라우드 같은 플랫폼에 중요한 문제...

AI 운영비는 ‘반복 작업’에서 새어나갑니다: 온프레미스 전용 모델로 구조적으로 줄이는 방법

AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.

vLLM은 어떻게 동작하고, 프로덕션에서 어떻게 쓰이는가

LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.

GUI 없는 클라우드 맥에서 iOS 앱을 브라우저로 테스트하기: serve-sim

Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다. serve-sim은 시뮬레이터의 프레임버퍼를 브라우저로 스트리밍하고 WebSocket으로 제어까지 열어, AI 코딩 에이전트가 헤드리스 환경에서 iOS 앱을 빌드하고 실제로 조작하며 테스트하게 합...

vLLM vs Ollama - 로컬 LLM 추론, 언제 무엇을 골라야 하는가

Ollama는 쉽고 vLLM은 빠르다는 통념을 2026년 RTX 4090 공개 벤치마크로 다시 검증합니다. 단일 사용자에서는 격차가 13% 안팎이지만, 동시 50명에서는 vLLM이 약 6배 처리량을 냅니다. PagedAttention과 연속 배칭이 만드는 확장 곡선의 차이, 그리고...

첫 AI 에이전트를 만든다면 - 가드레일이 붙은 최소 루프부터

AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다. 정작 프로덕션에서 무너지는 지점은 루프를 멈추는 가드레일입니다. 외부 LLM 없이 순수 파이썬으로 가드레일이 붙은 최소 ReAct 루프를 직접 돌려, 단계 상한과 반복 탐...