에이전트가 스스로 만든 스킬로 자기를 가르친다: SEED가 희소 보상 문제를 푸는 방법
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다. SEED는 에이전트가 자기 궤적에서 스스로 뽑은 자연어 스킬을 다시 자기에게 증류해, 그 희소한 신호를 토큰마다 촘촘한 신호로 바꿉니다.
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다. SEED는 에이전트가 자기 궤적에서 스스로 뽑은 자연어 스킬을 다시 자기에게 증류해, 그 희소한 신호를 토큰마다 촘촘한 신호로 바꿉니다.
긴 추론의 진짜 비용은 상태가 무한정 커지는 데서 옵니다. 마르코프 사고는 사고를 고정 크기 청크로 끊고, 청크 경계에서 짧은 상태만 넘겨 이어 가게 해 비용을 제곱에서 선형으로 바꿉니다.
무인 에이전트 루프에 검증 게이트를 넣으면 안전해진다는 통념을 실측으로 뜯어본 결과, 게이트 혼자서는 오히려 반복 소진율을 급증시키는 함정이 있었습니다.
그림 속 글자는 또박또박, 근데 그 붓은 남의 클라우드에 꽂혀 있다ㅋ
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다. 문제는 모델의 지능이 아니라 답을 검증된 원문에 묶지 않은 설계입니다. 법제처 국가법령정보 Open API를 근거원으로 삼아 LLM 법률 답변을 인용 기반으로 바꾸는 방법을, 서빙 관점에서 정...
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다. 그 비결은 ‘더 많은 테스트’가 아니라 벤치마크 게이트, 릴리스 브랜치 고정, 커밋 단위 이등분이라는 세 가지 결정론적 장치입니다. vLLM 유지관리팀이 공개한 운영기를 타키클라우드 서빙 관...
Claude Code 데스크톱이 iOS 시뮬레이터를 대화 옆 패널에 띄우는 기능을 공개 베타로 내놨습니다. 앱을 빌드해 실행하고, Claude가 실행 중인 화면을 직접 보며 고쳐 나가는 이 닫힌 루프가 무엇을 바꾸는지, 어떻게 켜는지, 그리고 에이전트 네이티브 클라우드 관점에서 왜...
Archify는 Mermaid 문법을 배우지 않고도 평범한 문장 설명만으로 자기완결형 HTML 아키텍처 다이어그램을 만드는 에이전트 스킬입니다. 실제로 설치해 타키클라우드 ai-platform 구조를 그려 보니, 핵심은 그림이 아니라 레이아웃을 강제로 검증하는 렌더러였습니다. 그 ...
7월 22일, 오픈웨이트 릴리스 두 건이 거울처럼 마주 섰습니다. 하나는 코드를 생성하고 하나는 그 코드의 취약점을 찾습니다. 그런데 둘 다 답하지 못하는 질문이 하나 남습니다. 그 코드는 실제로 누구의 인프라에서, 어떤 권한으로 돌아가는가.
VRAM 있는 만큼 골라 담았더니, 클라우드 청구서만 굶었다ㅋ
버스트성 테넌트가 놀릴 때 정적 균등 분배는 그 몫을 낭비합니다. 고정 예산을 수요 쪽으로 옮기는 동적 컨트롤러는 실제 H200에서 총 처리량을 14% 끌어올렸습니다.
알리바바 Qwen 팀이 이미지 생성 3세대 모델 Qwen-Image-3.0을 발표했습니다. 4.5k 토큰 입력, 10px 초소형 텍스트, 12개 언어 렌더링을 앞세웠지만 지금 쓸 수 있는 경로는 Qwen Chat 호스팅뿐이고 가중치도 벤치마크도 공개되지 않았습니다. 확인된 사실과 ...
허깅페이스가 2026년 7월 자율 AI 에이전트에 의한 내부 침해를 공개했습니다. 진입로는 악성 데이터셋 하나였고, 데이터셋 처리 파이프라인의 두 취약점이 코드 실행으로 이어졌습니다. 확인된 사실과 아직 조사 중인 부분을 나누고, 데이터셋 처리를 신뢰 경계로 다뤄야 하는 이유를 정...
허깅페이스가 공개한 hugging-voice와 그 엔진인 speech-to-speech는 VAD에서 STT, LLM, TTS까지 이어지는 실시간 음성 파이프라인을 OpenAI Realtime 호환 WebSocket으로 감쌌습니다. 클라이언트의 base URL 한 줄만 바꾸면 자체 ...
Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다. claude --ax-screen-reader 한 줄이 무엇을 바꾸는지, 어떤 원리로 동작하는지, 그리고 에이전트 인터페이스의 접근성이 왜 타키클라우드 같은 플랫폼에 중요한 문제...
오픈소스 마케팅 플러그인 Digital Marketing Pro는 스킬 158개와 전문 에이전트 24개를 하나로 묶고도 무너지지 않습니다. 비결은 12단계 고정 흐름이라는 결정론적 골격입니다. 이 설계를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어떻게 제품화하는지 정리했습니다.
Cursor가 835쪽 매뉴얼만 보고 SQLite를 Rust로 재구현한 에이전트 스웜을 공개했습니다. 홀드아웃 테스트 100% 통과, 모델 조합에 따라 15배 벌어진 비용, 초당 1,000커밋을 감당하려 새로 만든 버전관리 시스템까지, 홍보 문구가 아니라 공식 블로그 수치로 검증하...
리더보드 1등 먹었는데, 그게 남의 시험지였다ㅋ
도구를 쓰는 LLM 에이전트는 모델을 감싸는 하네스 위에서 돕니다. 최근 arXiv 논문은 이 하네스 설계와 사후학습을 분리해서 다루면 성능이 무너진다는 점을, 특히 도구 환경이 바뀌는 상황에서 실증합니다. 하네스를 일급 리소스로 다루는 관점에서 이 결과를 풀어봅니다.
밤새 스스로 코드를 고치는 에이전트 하네스가 다음 날 그 결과물을 어떻게 배포해야 안전할까요. 카나리와 자동 롤백을 끼운 실험이 장애 반경과 복구시간의 트레이드오프를 구체적으로 보여줍니다.
알리바바가 2.4조 파라미터 규모의 Qwen3.8을 곧 오픈웨이트로 공개하겠다고 예고했습니다. 프리뷰는 이미 테스트할 수 있지만 가중치도 벤치마크도 아직 공개되지 않았습니다. 발표에서 확인된 사실과 아직 주장에 머무는 부분을 구분해 정리했습니다.
폐쇄형 모델이 정당한 보안·의료·법률 작업까지 거부하는 과잉 거부 문제가 다시 도마에 올랐습니다. Moonshot의 오픈웨이트 Kimi K3는 콘텐츠 필터를 아예 두지 않는다고 밝혔습니다. 이 설계가 운영자에게 무엇을 넘겨주는지, 그리고 그 부담을 어떻게 다뤄야 하는지를 정리했습니다.
Moonshot이 공개한 Kimi K3는 오픈웨이트 역사상 가장 큰 2.8조 파라미터 모델입니다. 점수는 화려하지만 곧바로 벤치마크 과적합 논쟁이 붙었습니다. 운영자가 이 모델을 도입하기 전에 무엇을 어떻게 검증해야 하는지를 정리했습니다.
레이어나 전문가 단위가 아니라 텐서 하나하나를 CPU와 GPU에 나눠 배치하면, RTX 4090 한 장으로 VRAM을 훌쩍 넘는 모델을 돌리면서 디코딩을 최대 3.29배 끌어올릴 수 있다는 논문 ATSInfer를 읽고, 그 원리와 우리 서빙 관점에서의 함의를 정리했습니다.
국내 사용자에게 250억 원이 청구된 사건부터 기업 60곳의 과다 청구 의혹까지, 최근 한 달의 AI 비용 뉴스는 하나의 공백을 가리킵니다. 한 번의 요청이 수백 번의 모델 호출로 번지는 에이전트 시대에, 청구서는 더 이상 무엇에 돈을 냈는지 설명해 주지 않습니다. 이 관측 공백을...
AI 코딩 도구가 매 세션 규칙을 잊어버리는 문제를, 한 해커톤 우승자가 실제 TypeScript 마이크로서비스를 6개월 돌리며 쌓은 설정으로 풀었습니다. everything-claude-code의 얇은 하네스·두꺼운 스킬 구조를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어...
일론 머스크가 다보스에서 던진 세 가지 예측이 ‘3년 뒤 급여의 시대가 끝난다’는 경고로 번졌습니다. 실제 인터뷰 영상을 받아 적어 그가 정확히 무엇을 말했는지 확인하고, 노동에서 자산으로 넘어가는 흐름의 밑바닥에서 도는 컴퓨트 인프라가 왜 진짜 관건인지 짚습니다.
문샷AI가 MIT 라이선스로 공개한 오픈소스 코딩 CLI를 공식 문서 기준으로 분석합니다. 서브에이전트와 MCP 편의성은 클로드 코드와 겹치지만, 진짜 차별점은 Agent Client Protocol 네이티브 지원과 모델 개방성입니다.
Anthropic이 Claude Code의 시스템 프롬프트를 80% 걷어냈다는 소식이 개발자 사이에서 화제가 됐습니다. 담당자는 새 모델이 ‘더 작은 시스템 프롬프트를 원하고’, 오히려 우리가 준 지침보다 더 상상력이 풍부하다고 설명했습니다. 모델이 강해질수록 하네스는 얇아지고 규...
똑똑한 한 놈은 벽에서 막힌대. 그래서 파시스가 떼로 풀었다ㅋ
GPT-5.6이 사이즈마다 대여섯 개의 추론 노력 설정을 달고 나오면서, effort 조절은 이제 리즈닝 모델의 기본기가 됐습니다. 같은 라벨 뒤에 어떤 학습 레시피가 숨어 있는지, 오픈웨이트 6개 모델의 기술 리포트를 뜯어 공통 골격을 정리합니다.
상탕(SenseTime)이 日日新 SenseNova U1을 Apache 2.0으로 공개했습니다. 비주얼 인코더와 VAE를 모두 없앤 NEO-Unify 아키텍처로 이해·생성·편집·인터리브를 한 모델에서 처리합니다. 오픈 가중치(8B-MoT/A3B-MoT)와 호스티드 U1 Pro의 차...
메모리 쇼크로 AI 인프라를 소유하는 값은 사상 최고로 치솟는데, 키미 K3와 중국 오픈웨이트가 AI를 쓰는 값을 사상 최저로 끌어내렸습니다. 벌어지는 이 가위 사이에서 승부처는 모델이 아니라 활용률로 옮겨갑니다.
OpenAI가 GPT-5.6 Sol을 두고 사이버 레인지에서 새 기록을 세웠다고 발표했습니다. 프런티어 모델이 실제 공격 체인을 자율로 밟기 시작하면, 승부처는 모델의 성능이 아니라 그 모델을 어디에서 어떤 통제 아래 돌리느냐로 옮겨갑니다.
내 음성 에이전트의 어느 단계가 병목인지 벤더 SDK 없이 진단하는 공개 도구를 만들고, RunPod H200에서 우리 실제 스택(Qwen3-ASR·VoxCPM2·Qwen3-TTS)을 측정했습니다. STT는 빠르고, 비스트리밍 TTS가 진짜 병목이었습니다.
MoE 전문가를 CPU로 내려 24GB GPU 한 장으로 거대 모델을 돌린다는 ktransformers. 화제가 된 ‘28배’와 ‘40만 달러를 24GB로’를 RunPod에서 직접 쟀습니다. 트릭은 진짜였고, INT4 AMX 커널을 켜니 671B급이 디코딩 약 16 tok/s로 돌...
랙 빌릴 돈이, 서랍 속 카드 한 장에 날아갔다ㅋ
Fable 5급이라 불리는 2.8T 오픈 모델 Kimi K3를 프로프라이어터리 IDE가 아니라 오픈소스 터미널 에이전트에 붙이는 실전 방법을 봅니다. OpenCode를 직접 설치해 프로바이더 연결 흐름까지 확인했습니다.
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.
Moonshot이 세계 최대 규모의 오픈웨이트 모델 Kimi K3를 공개했습니다. 프론트엔드 코딩 벤치마크에서 최상위 폐쇄 모델을 앞섰다는 점도 놀랍지만, 진짜 질문은 그 다음입니다. 2.8조 파라미터 모델을 자체 인프라에서 돌린다는 것은 실제로 무엇을 요구하는가. 타키클라우드 서...
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.
중국 키미 K3가 코딩 리더보드에서 클로드를 제쳤는데 실리콘밸리는 냉담합니다. 같은 주에 구글은 제미나이 3.5를 세 번째로 미뤘습니다. 성능 정점에서 산업이 깨닫는 진실은 하나입니다. 벤치마크 점수는 배포 신뢰를 사주지 못합니다.
노력 눈금 최대로 땡겼더니, 청구서만 최대치더라ㅋ
에이전트 스킬이나 MCP 도구 카탈로그를 계속 늘려온 팀이라면 라우팅 정확도가 어느 순간부터 떨어지는 걸 체감했을 겁니다. 리트리버를 더 잘 만드는 대신 코퍼스 자체를 줄이면 어떻게 될까요. 2,164개 유닛을 가진 실제 프로덕션 하네스에서 회귀 없이 160개 스킬을 폐기한 실험을...
Google AI Edge의 Cormac Brick은 270M 파라미터의 FunctionGemma를 파인튜닝해 특정 에이전트 과제에서 정확도를 46%에서 90%로 끌어올린 사례를 발표했습니다. 핵심은 큰 모델을 부르는 대신, 작은 모델을 좁은 과제에 맞춰 폰 위에서 돌리는 것입니다...
Tencent이 공개한 Hy3 1-bit·4-bit GGUF 빌드는 295B MoE 모델을 598GB에서 85.5GiB까지 줄여 단일 GPU에서 돌립니다. 다만 여기서 말하는 단일 GPU는 128GB급 통합 메모리를 뜻하지, 16GB 소비자 카드가 아닙니다. 저희는 이 압축이 무엇...
Claude Code가 v2.1.101에서 /simplify를 /code-review로 바꾸면서 리뷰에 노력 단계를 붙였습니다. low와 medium은 확신 높은 소수의 지적만, high와 max는 넓은 커버리지와 불확실한 발견까지, ultra는 클라우드에서 여러 에이전트가 병렬로...
AI가 AI를 하루만에 우등생 만듦ㅋ 근데 밤새 돌린 GPU는 누구 거임?
정적 마크다운으로 끝나던 아티팩트가 커넥터를 호출하는 살아 있는 앱이 됐습니다. 열 때마다 스스로 최신 데이터를 다시 긁어 오는 대시보드를 어떻게 만드는지 봅니다.
LLM 에이전트에게 K8s GPU 인시던트 원격조치를 맡기려는 팀이라면 결국 이 질문과 마주칩니다. 언제까지는 에이전트 혼자 고치게 두고, 언제부터는 사람을 불러야 하는가. 이 경계선을 감으로 정하지 않고 위험도 공식과 안전 상한선으로 계산해낸 논문을 소개합니다.
수직계열화의 상징 애플이 자체 칩을 포기하고 구글 GPU와 중국 라이벌 모델까지 빌립니다. 같은 날 한국은 정반대로 15GW 데이터센터를 소유하려 수십조를 쏟습니다. 두 방향이 가리키는 하나의 결론을 읽습니다.
PrismML이 공개한 Bonsai 27B는 Qwen3.6-27B를 새로 학습한 모델이 아니라, 아키텍처를 그대로 둔 채 가중치만 1-bit·ternary로 압축한 결과물입니다. Ternary 빌드는 5.9GB에서 FP16 품질의 94.6%를, 1-bit 빌드는 3.9GB에서 89...
터미널 6개를 띄워 놓고 응답을 기다리다 엔터만 누르는 하루. ‘멀티 클로딩’이라 불리는 이 새로운 노동이 개발자의 집중력을 갉아먹는 이유를 짚고, 감시자에서 오케스트레이터로 옮겨 가는 위임의 기술을 이야기합니다.
자가진화 하네스가 냈다는 이득은 ‘갱신을 잘 만드는 능력’과 ‘갱신을 잘 쓰는 능력’이 한 루프 안에서 뒤섞인 값입니다. 둘을 분리하면 어디에 예산을 써야 하는지가 뒤집힙니다.
에이전트가 코드베이스에서 생산적으로 일하지 못한다면, 그건 모델의 실패가 아니라 자동화의 실패입니다. 도메인 지식을 인프라로 옮기는 일은 엔지니어가 늘 해온 일의 자연스러운 확장입니다.
코딩 에이전트에게 자연어 프롬프트 두 개를 주면 비전 파운데이션 모델의 포스트트레이닝이 하루 만에 끝납니다. NVIDIA의 에이전트 스킬을 해부하고, 스킬을 일급 리소스로 다루는 우리 플랫폼에 무엇이 옮겨지는지 봅니다.
후보를 갈구던 AI, 자기부터 갈궈봤더니ㅋ
파인튜닝이 이길 줄 알고 시작했는데 데이터가 뒤집었습니다. 학습 없이 TDS를 지키는 생성기를 얻은 과정과, 유효한 화면이 좋은 화면은 아니라는 다음 숙제까지 정리합니다.
지금까지 새 모델 아키텍처는 두 번 만들어야 했습니다. 한 번은 학습·연구를 위한 Transformers에서, 또 한 번은 프로덕션 추론을 위한 vLLM에서요. vLLM v0.25.0의 네이티브 속도 Transformers 백엔드는 이 이중화를 끝냅니다. 원리는 torch.fx로 ...
대규모 모델을 여러 가속기에 나눠 학습하거나 서빙할 때, 실제 병목은 연산이 아니라 가속기 사이를 오가는 데이터입니다. 이 글은 all-reduce, all-gather, reduce-scatter, all-to-all 같은 컬렉티브 연산이 무엇인지, 그리고 이 연산들이 GPU 클...
한 개발자가 Codex에 어려운 /goal을 줄 때 ‘다른 스레드가 이 목표를 달성하도록 목표를 대신 써달라’고 먼저 요청한다는 팁을 공유했습니다. 얼핏 말장난처럼 들리지만, 그 안에는 검증 가능한 목표 명세를 모델에게 먼저 작성시키고 그 명세를 새 스레드에 위임한다는 실질적인 에...
괴물 한 대를 못 사서, 갖고 있는 잡동사니를 다 엮어버림ㅋ
문서 OCR 파이프라인에 두 크기의 VLM을 얹은 엔지니어를 위한 글입니다. H200에서 실측한 결과, 신뢰도 임계값 하나로 어려운 문서만 대형 모델로 올려보내는 캐스케이드는 대형 모델과 같거나 조금 낮은 오류율을 그 비용의 약 60~67%에 달성했습니다.
GPT-5.6이 더 똑똑하냐가 아니라, 그 토큰을 누가 더 싸고 빠르게 서빙하느냐가 마진을 가릅니다. 모델을 나열하는 지도가 건너뛴 다섯 개의 스택 층 - 추론 실리콘, 서빙, 평가, 라이선스, 하니스 - 을 실제 수치로 지도화합니다.
Unsloth로 모델을 4비트로 줄이는 방법을 아는 팀은 많습니다. 그런데 그 파일을 실제로 EC2에 올릴지, SageMaker 엔드포인트로 감쌀지, EKS 파드로 띄울지 정하는 순간 대부분 막힙니다. AWS가 Unsloth와 함께 낸 배포 가이드는 이 질문에 명확한 지도를 제시합...
누군가 GLM-5.2에서 1403GB를 980GB로 줄였다고 했습니다. 양자화도, 프루닝도 아니고, 비트 단위로 완전히 동일한 무손실 압축이라고요. 처음엔 믿기 어려웠습니다. 그래서 직접 Qwen2.5-0.5B의 가중치 4억 9천만 개를 열어 BF16 지수 필드의 엔트로피를 측정했...
은행연합회는 더 똑똑한 모델이 아니라 도입의 순서를 발주했습니다. 오늘 규제 산업의 움직임을 뜯어보면, AI 도입의 진짜 승부처는 능력이 아니라 통제라는 사실이 드러납니다.
프로젝트만 던졌더니 알아서 다 깔아줌 — 근데 취향은 남의 취향이었다ㅋ
완전 자율로 매일 밤 논문을 만들어내는 파이프라인을 최종 결과물이 아니라 실제 운영 로그로 감사한 연구입니다. 8일 중 2026-07-08을 기점으로 언어 순도와 리뷰 통과율이 동시에 개선된 뚜렷한 전후 변화를 발견하고, 이를 6가지 최소 가드레일로 정리합니다.
코딩 에이전트는 오랫동안 텍스트만 읽어 왔습니다. claude-video는 yt-dlp·ffmpeg·Whisper를 얇게 엮어, 유튜브·Zoom·Loom·로컬 파일을 프레임 이미지와 타임스탬프 전사로 바꿔 Claude의 멀티모달 Read 컨텍스트에 넣습니다. GitHub 5,400...
62만 개 화면을 다 참고했더니, 세상 앱이 다 한 앱이 됐다ㅋ
회사의 반복 업무를 스킬로 정의하면, 각 스킬이 실제로 어느 모델 티어까지 내려가도 되는지를 감이 아니라 측정으로 답할 수 있습니다. 가장 비싼 모델은 일을 시키는 데가 아니라 강등을 판정하는 데 씁니다. 16개 스킬 함대에서 10개를 중간 티어로 내린 실제 운영 기록입니다.
H200이나 Blackwell급 클러스터에서 MoE를 서빙하는 엔지니어라면, 어떤 전문가를 전정밀도로 지켜야 하는지가 핵심입니다. 실제 OLMoE-1B-7B 측정으로 답은 명확했습니다. 트래픽 많은 핫 전문가를 지키면 됩니다.
Claude Code와 Codex 같은 코딩 에이전트는 Anthropic API에 묶여 있습니다. free-claude-code는 그 사이에 Anthropic 호환 프록시를 끼워, 같은 에이전트 UI를 그대로 쓰면서 요청을 Ollama, llama.cpp, vLLM 같은 자체 호스...
vLLM v0.25.0이 232명의 기여자가 보낸 558개의 커밋과 함께 나왔습니다. 이번 릴리스의 핵심은 두 가지입니다. 첫째, Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 되었습니다. 둘째, vLLM을 처음 유명하게 만든 PagedAttention의 레거시...
값이 내려가면 덜 쓸까요. 추론 시장에서는 정반대의 일이 벌어지고 있습니다. 토큰 반값 경쟁과 삼바노바 5배 몸값이라는 모순을 제번스 역설로 읽고, 기업의 진짜 병목이 어디로 옮겨가는지 짚어봅니다.
에이전트 스킬을 프런티어 API로만 돌리면 호출 수천 번에 비용이 폭증합니다. 2026년 상반기 연구는 이 스킬을 1B~35B급 소형 모델에 증류해 로컬에서 자동 실행하는 길을 실전 단계로 끌어올렸습니다. 온폴리시 스킬 증류, 다교사 증류, 학습 없는 에이전트 증류 같은 최근 기법...
한 사람이 한 에이전트를 쓰던 구조에서, 여러 사람과 여러 에이전트가 같은 작업 공간에서 서로 대화하는 구조로 넘어가고 있습니다. 멀티플레이어 Claude Code를 계기로 협업 에이전트의 동시성·충돌·신뢰 경계 문제를 짚고 ThakiCloud 운영 관점에서 검증합니다.
약점 콕 집어 고치면 이긴대. 근데 파시스 약점은 ‘그만 풀기’였음ㅋ
모든 fan-out은 적대적 검증으로 닫아야 한다는 원칙은 널리 퍼져 있지만, 검증자 등급과 스켑틱 수를 얼마나 써야 하는지는 실측 없이 관행으로 정해져 왔습니다. 12개 findings와 180회 실제 API 호출로 이 가정을 검증한 결과를 소개합니다.
긴 호흡의 에이전트 작업을 RL로 학습할 때 GRPO의 그룹 샘플링은 가장 느린 롤아웃을 기다리느라 GPU를 놀립니다. 칭화대와 Z AI가 GLM-5.2 학습에 실제로 투입한 SAO는 그룹을 통째로 버리고 롤아웃 하나로 학습하며, 대신 양방향 토큰 클리핑으로 안정성을 지킵니다.
장기 실행 에이전트는 제한된 메모리 안에서 움직이지만, 지금까지의 메모리 기법은 관련성이나 요약 품질 같은 묘사적 기준으로 과거를 조직했습니다. Meta AI 연구자가 참여한 이 논문은 그 기준 자체가 틀렸다고 말합니다. 메모리의 가치는 과거를 충실히 묘사하는 데 있지 않고, 서로...
허깅페이스에서 GGUF 파일을 받아 실행 버튼만 누르는 사람과, 그 파일 안에 어떤 텐서가 몇 비트로 들어 있는지 아는 사람 사이에는 큰 차이가 있습니다. Qwen2.5-0.5B의 Q4_K_M 파일을 실제로 다운로드해 텐서 단위로 열어 보니, 이름과 달리 4비트 Q4_K는 전체의 ...
Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다. serve-sim은 시뮬레이터의 프레임버퍼를 브라우저로 스트리밍하고 WebSocket으로 제어까지 열어, AI 코딩 에이전트가 헤드리스 환경에서 iOS 앱을 빌드하고 실제로 조작하며 테스트하게 합...
OpenAI Codex 팀 엔지니어 jxnl이 공개한 personal-monorepo-template은 벡터DB 없이 폴더 구조와 AGENTS.md만으로 에이전트에 영구 기억을 부여합니다. 이 설계를 분해하고 스킬을 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
Claude Fable 5가 스펙 작성과 diff 리뷰를 지휘하고, 실제 코드 타이핑은 Grok 4.5가 전담하는 fable-advisor 플러그인의 지휘자-워커 분리 구조를 분해하고, 멀티에이전트를 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
1년째 ‘언젠가’ 리스트에 박아둔 에이전트, 열어보니 커피 식기 전에 끝남ㅋ
예일과 시카고대 연구진이 11,683편의 실제 논문으로 인간과 LLM의 연구 아이디어를 비교했습니다. 결론은 뜻밖입니다. LLM 아이디어의 문제는 품질이 아니라 폭입니다. 인간보다 훨씬 좁은 영역, 특히 ‘기존 연구 연결’에 4~5배 쏠려 있었습니다.
ARC-AGI-3는 설명서 없는 대화형 게임에서 에이전트가 스스로 상황을 파악하고 적응하는지를 측정합니다. GPT-5.6 Sol은 이 벤치마크를 7.78%로 처음 돌파했는데, 그 원동력은 더 나은 실행이 아니라 낯선 환경에서 먼저 방향을 잡는 정향 능력이었습니다.
요즘 RL 포스트트레이닝의 대세는 critic을 버리는 GRPO 계열입니다. 그런데 GLM-5.2는 value model을 되살린 PPO로 돌아가고, IcePop으로 학습-추론 불일치를 잡았습니다. 이 선택의 근거와 ThakiCloud 훈련 인프라 관점의 시사점을 정리합니다.
대규모 스킬 생태계를 운영하는 에이전트 하네스에서 라우팅 실패의 진짜 원인이 분해가 아니라 검색기라는 진단이 나온 뒤, 그 고치는 손을 사람에서 무인 루프로 옮기면 실제로 병목이 좁혀지는지를 실측한 연구입니다.
SpaceXAI가 Grok 4.5를 공개했습니다. 코딩과 에이전트를 위해 처음부터 훈련됐고, Opus급 성능을 백만 토큰당 입력 2달러·출력 6달러에 제공합니다. 값싼 에이전트 지능이 만드는 계산의 변화를 ThakiCloud 관점에서 짚습니다.
HBM4가 서버 랙 한 대 값을 2100만 달러로 밀어올리고, SK하이닉스는 하루 만에 40조를 조달했습니다. 자본과 전력이 진짜 병목이 된 지금, 승부는 비싼 컴퓨트에서 증명 가능한 일을 뽑아내는 소프트웨어 층으로 내려가고 있습니다.
같은 날 발표된 두 개의 숫자가 정반대로 움직였습니다. 2100만 달러짜리 AI 랙과 34배 싸진 추론 요금입니다. 이 벌어지는 가위의 한가운데에서 기업이 쥐어야 할 손잡이를 짚어봅니다.
마이크로소프트는 엑셀과 아웃룩의 대량 AI 요청을 자사 모델로 돌리기 시작했고, 중국 오픈 모델은 미국 기업 AI 사용량의 절반 가까이를 잠식했으며, 시장에서는 1조 달러가 넘는 시가총액이 하루아침에 사라졌습니다. 프리미엄 프론티어 모델을 영원히 결제한다는 가정이 무너지는 중입니다...
자연어 요청 한 번으로 프리미엄 랜딩페이지를 만든다는 Claude Code 스킬이 실제로 어떤 구조로 동작하는지 분해하고, 스킬을 일급 리소스로 다루는 ThakiCloud Paxis 관점에서 검증합니다.
기억이 ‘행동’이 됐다는데, 안 잊는 건 왜 요금뿐이냐ㅋ
뇌가 다 같으면, 비싼 뇌를 굳이 빌릴 이유가요?
수백 개 스킬을 라우팅하는 하네스에서 다음 투자를 분해에 할지 리트리버에 할지 두 숫자로 판별하는 진단법을 소개합니다. 실측 결과 병목은 둘 다 아니라 코퍼스 중복이었습니다.
장기 기억과 단기 기억을 서로 다른 휴리스틱으로 다루던 관행을 깨고, 저장·검색·요약·삭제를 에이전트의 행동 공간으로 통합한 AgeMem 논문을 분석하고 ThakiCloud 에이전트 플랫폼 관점에서 시사점을 정리합니다.
SpaceXAI가 공개한 Grok 4.5는 Opus 4.8과 GPT-5.5에 근접한 성능을 절반 이하 가격에 내놓았습니다. 벤치마크 몇 점 차이보다 태스크당 비용과 토큰 효율이 실무 선택을 좌우하는 국면이 왔습니다. 실제 공개 수치로 그 경제학을 뜯어보고, ThakiCloud의 모...
Anthropic의 Claude Fable 5가 프런트엔드 생성에서 새로운 기준을 세우고 있습니다. 스크롤로 제어되는 3D 씬, GLSL 셰이더, 스크린샷 기반 리디자인을 단일 프롬프트에서 뽑아내는 워크플로를 실제 공개 가이드와 오픈소스 갤러리를 근거로 정리하고, 코딩 에이전트를 ...
AI가 감각을 넓히고 손을 얻는 뉴스가 쏟아진 하루입니다. 그런데 도입을 실제로 가르는 질문은 성능이 아니라 ‘증거’로 옮겨가고 있습니다. 오늘 다이제스트를 그 렌즈로 다시 읽어봤습니다.
Claude Code를 사람이 매번 붙어 있지 않아도 돌아가게 만드는 네 가지 메커니즘을 정리하고, ThakiCloud가 실제 운용 중인 헤드리스 파이프라인·훅·서브에이전트·스킬 사례로 검증합니다.
11억 파라미터가 70억을 이기고 최고 모델이 공짜로 풀리는 날, 정작 기업을 멈칫하게 만든 뉴스는 지능이 아니라 ‘행동 기록’이었습니다. 오늘 시장이 갈라선 두 방향을 읽습니다.
남 칩 찍어주다 몇 년 만에 흑자. 빌린 흑자는 남의 통장에 찍힌다.
서로 다른 데이터로, 서로 다른 목적으로 학습한 비전 모델과 언어 모델이 시간이 갈수록 데이터를 같은 방식으로 표현하기 시작합니다. MIT의 플라토닉 표현 가설(Platonic Representation Hypothesis)은 이 수렴이 우연이 아니라 규모와 능력이 커질수록 나타나...
온프렘 AI 플랫폼을 쓰는 병원이나 은행, 정부기관은 데이터가 엔클레이브 밖으로 새지 않았다는 것과 서빙된 모델 가중치가 감사받은 그 파일이 맞다는 것, 이 두 가지를 규제기관에게 증명해야 합니다. GPU 기밀 컴퓨팅의 원격 증명과 모델 프로버넌스는 지금까지 따로 발전해 온 두 기...
Anthropic이 2026년 7월 7일 ‘Getting started with loops’라는 첫 공식 루프 엔지니어링 문서를 공개했습니다. 매 단계를 사람이 프롬프트로 지시하는 방식에서, 에이전트를 대신 프롬프트해 주는 시스템을 설계하는 방식으로 넘어가는 전환입니다. 수동 루프...
LLM을 채점자로 쓰는 ‘LLM-as-a-judge’는 이제 모델 개발의 기본값이지만, 2026년 들어 쌓인 증거는 단일 점수를 내는 스칼라 심판이 프롬프트와 위치에 취약하고 중간값으로 쏠리며 적대적 입력 앞에서 동전 던지기 수준으로 무너진다는 사실을 보여줍니다. 병원이나 은행, ...
모노레포에서 라이브러리 디렉터리와 소비 서비스 디렉터리를 오갈 때, 세션을 재시작하면 대화 맥락도 프롬프트 캐시도 함께 날아갑니다. Claude Code v2.1.169에 들어온 /cd 명령은 실행 중인 세션을 다른 디렉터리로 옮기면서 캐시를 그대로 유지합니다. 캐시 읽기(0.1배...
대부분의 개발자는 세팅을 건너뛰고 바로 프롬프트를 칩니다. 그게 실수입니다. CLAUDE.md·rules·commands·skills·agents·hooks로 이어지는 .claude/ 폴더의 구조를, 스킬 1,671개가 도는 실제 프로덕션 프로젝트를 직접 측정해 뜯어봅니다. Tha...
dair.ai 주간 논문 정리에서 ThakiCloud 관점으로 세 편을 깊게 읽습니다. 메타인지 피드백으로 표준 RL을 최대 63% 넘어선 RLMF, 메모리를 학습 가능한 스킬로 다뤄 Qwen2.5-32B를 Opus 4.5급으로 끌어올린 AutoMem, LLM 통합 애플리케이션의 ...
AI control의 핵심 방어선인 ‘신뢰 못 하는 강한 모델을 약한 감시 모델로 통제한다’는 전제는 감시자와 정책 모델이 같은 텍스트를 읽는다는 가정 위에 서 있습니다. 온프렘 멀티테넌트 클러스터에서는 이 가정이 조용히 무너집니다. 서로 다른 토크나이저와 정규화 규칙이 감시자는 ...
구글 딥마인드가 공개한 약 57페이지 보고서 From AGI to ASI는 초지능을 먼 사고실험이 아니라 지금 준비해야 할 계획 문제로 다룹니다. 스케일링, 알고리즘 전환, 재귀적 자기개선, 다중 에이전트 집단 형성이라는 네 갈래 경로와 그 각각을 가로막는 물리적 한계를 짚습니다....
오픈 언어 모델의 다운로드와 추론 사용량을 한자리에서 측정한 ATOM 리포트는, 중국 오픈 모델이 2025년 여름 미국 진영을 추월한 뒤 격차를 벌려 왔다는 사실을 데이터로 보여 줍니다. Qwen 계열은 허깅페이스 누적 다운로드 약 10억 건을 넘겼고, OpenRouter 추론 시...
몸에 좋은 조합만 골라 담았는데, 냉장고 열쇠는 왜 쟤가 쥐고 있냐.
거대 LLM과 에이전트 스킬이 좋아질수록 파인튜닝은 필요 없어진다는 체감이 업계에 퍼지고 있습니다. 실제로 OpenAI는 셀프서브 파인튜닝 API를 접는 중입니다. 그런데 같은 한 달 동안 정반대 방향의 신호도 쏟아졌습니다. 19일간의 프론티어 모델 셧다운, 파인튜닝을 전제로 설계...
284B DeepSeek V4 Flash가 35B Qwen3.6보다 output 토큰이 5배 저렴한 역설을 roofline 모델로 해부합니다. KV 캐시 읽기, MoE 배치 경제학, 8xH100 서빙 형태 계산까지 추론 원가의 실제 구조를 숫자로 설명합니다.
GLM-5.2 743B MoE를 AMD MI355X 한 노드에서 2,626 tok/s/node로 서빙하고 Blackwell 대비 2배 이상 저렴하게 만든 사례를, MXFP4 양자화와 SGLang MoE 병렬화 관점에서 검증하고 ThakiCloud ai-platform의 멀티벤더 서...
작동하는 기계와 이해한 원리 사이의 간극은 과학사에서 늘 반복된 장면입니다. 컴퓨팅 파워로 모든 것을 밀어붙이는 지금, 에너지와 파동의 눈으로 딥러닝 시대를 다시 읽고 과학자가 가져야 할 겸손을 이야기합니다.
로켓 CEO의 창업 특강, 마지막 원칙이 곧 온프렘이었다.
Anthropic이 최신 모델용 프롬프팅 베스트 프랙티스를 정리한 공식 가이드를 뜯어봅니다. 모델별 차이, 핵심 기법(명료성·예시·XML·사고연쇄·역할·체이닝·확장 사고), 마이그레이션까지. ThakiCloud가 Paxis 스킬 하니스에서 프롬프트를 계약으로 굳히는 방식과 연결합니다.
tom_doerr가 공유한 최대 384GB VRAM Personal AI Computer 빌드 가이드를 출발점으로, VRAM이 어떻게 실행 가능한 모델을 결정하는지 계산으로 따져보고, 이 개인용 한 대를 조직 규모의 온프렘 서빙으로 올릴 때 무엇이 필요한지 ThakiCloud ai...
T3 창시자 Theo가 공유한 Claude Fable 5 운용 팁을 뜯어봅니다. effort 레벨 선택, Codex 오케스트레이션, CLAUDE.md 모델 우선순위, 토큰 무거운 작업 위임까지. ThakiCloud가 Paxis와 ai-platform에서 쓰는 모델 라우팅 규율과 나...
Claude Code의 아티팩트 기능이 Team·Enterprise를 넘어 Pro·Max 요금제까지 확대됐습니다. 세션의 작업을 실시간으로 갱신되는 공유 가능한 웹페이지로 바꾸는 이 기능을 뜯어보고, ThakiCloud의 Paxis와 ai-platform 관점에서 어떻게 쓸 수 있...
대부분의 에이전트 업무는 프론티어 모델이 필요 없습니다. 스킬을 비싼 모델로 한 번 완성한 뒤 포맷을 코드로 내리면, 같은 품질을 싼 모델로 돌릴 수 있습니다. 팩시스는 이 판단을 매일 밤 자동으로 측정하고, 안전할 때만 모델을 내리며, 품질이 흔들리면 되돌립니다. 실제 측정치와 ...
NVIDIA B200 두 장에서 Qwen3.6-27B-NVFP4와 gemma-4-26B-A4B를 대상으로 텐서병렬, 데이터병렬, Prefill/Decode 분리(1P1D)의 초당 생성 토큰을 실제로 측정했습니다. 두 장뿐일 때 총 처리량의 승자는 분리가 아니라 데이터병렬이었고, 이...
87% 싸진 건 축하할 일인데, 주인만 바꾼 건 아니고요?
Claude Code 2.1.198에 추가된 /dataviz 스킬은 차트와 대시보드 설계 지침을 컨텍스트에 직접 로드합니다. 폼 휴리스틱, 색 공식, 실행 가능한 팔레트 검증기를 뜯어보고 ThakiCloud 플랫폼 관점에서 어떻게 활용할지 정리합니다.
NVIDIA가 Qwen3.6-27B를 NVFP4로 재양자화해 단일 Blackwell GPU에서 vLLM으로 바로 서빙할 수 있게 했습니다. MLP는 NVFP4로 내리고 어텐션과 KV 캐시는 FP8로 남기는 혼합 정밀도가 어떻게 22GB 안에 27B 모델을 담는지, 그리고 이 방식이...
앤트로픽이 공개한 Claude Fable 5 프롬프트 가이드를 뜯어봅니다. 이전 모델용 지시를 덜어내고, 진행을 도구 결과로 감사하고, 서브에이전트를 적극 쓰고, 지난 실행에서 배우고, 제약을 명시하라는 다섯 원칙을 ThakiCloud 에이전트 운영 관점에서 정리합니다.
LLM을 운영하면서도 KV 캐시가 왜 메모리를 잡아먹는지, GQA가 무엇을 절약하는지 설명하지 못한다면 최적화는 감에 의존하게 됩니다. amitshekhariitbhu/llm-internals는 토큰화, 어텐션 수식, 트랜스포머 블록, KV 캐시, MoE, GQA를 순서대로 엮은 ...
엔지니어·PM·디자이너가 프로토타이퍼·빌더·스위퍼·그로워·메인테이너로 녹아든다는데, 아무도 안 하려는 6번째가 있다.
스택이 통째로 남의 손에 넘어간 날, 파시스와 메티스의 대처법.
NVIDIA가 공개한 Qwen3.6-27B-NVFP4는 27B 하이브리드 어텐션 추론 모델을 4비트로 눌러 메모리를 약 2.5배 줄이면서도 FP8 대비 벤치마크 차이를 1%p 이내로 유지합니다. 지난 Gemma NVFP4가 Blackwell 전용이었던 것과 달리 이번 빌드는 Hop...
짧은 응답 요청이 긴 응답 요청에 밀려 기다리는 HoL 블로킹은 GPU 시간을 낭비하는 조용한 적입니다. 요청을 short-context 풀과 long-context 풀로 나눠 라우팅하는 Dual-Pool Token-Budget Routing은 arXiv 2604.08075에서 G...
엔지니어링·제품·디자인·데이터가 한 덩어리로 녹아드는 지금, Claude Code를 만든 보리스 체르니가 제안한 다섯 가지 역할 원형과 제품 생애주기별 팀 구성 공식을 살펴봅니다.
2026년 중반 오픈웨이트 모델은 프런티어와 3~6개월 격차로 좁혀졌고, 그 격차는 더 벌어지지 않고 있습니다. 이제 진짜 의사결정은 모델 성능이 아니라 어디서 어떻게 돌릴 것인가, 즉 self-hosting 경제학으로 옮겨갑니다. ThakiCloud의 K8s 서빙 관점에서 정리합...
NVIDIA가 공개한 GLM-5.2-NVFP4 체크포인트는 469B MoE 모델을 단일 Blackwell 노드(8× RTX PRO 6000)에서 vLLM으로 서빙할 수 있게 합니다. 혼합 정밀도 양자화 구조와 공식 서빙 명령을 정리하고, 공개 수치 기반 메모리 사이징을 직접 계산해...
midudev이 공유해 화제가 된 browser-use의 video-use는 폴더에 원본 영상을 넣고 한 문장을 입력하면 컷 편집, 필러 제거, 자막, 색보정, 애니메이션, 렌더링까지 코딩 에이전트가 자동으로 끝내는 무료 오픈소스 스킬입니다. 컷마다 병렬 서브에이전트를 띄우는 이 ...
Z.ai의 1M 컨텍스트 오픈웨이트 모델 GLM-5.2의 후처리 학습을 떠받친 비동기 강화학습 인프라 slime이 완전 오픈소스로 공개되었습니다. Megatron 학습과 SGLang 롤아웃을 Data Buffer로 잇는 3-컴포넌트 구조, colocated/disaggregated...
코인베이스 CEO 브라이언 암스트롱이 공개한 AI 비용 통제법은 사용량 제한이나 경고 알림이 아니라 더 나은 기본값, 라우팅, 캐싱이었습니다. 직원의 91%가 애초에 사용 한도에 닿지도 않았다는 데이터를 근거로, 마찰을 늘리는 대신 LLM 게이트웨이의 기본 모델을 오픈웨이트로 바꾼...
DeepReinforce가 2026년 6월 25일 공개한 Ornith-1.0은 모델이 자신의 강화학습 훈련 스캐폴드를 직접 작성하는 자가-스캐폴딩(self-scaffolding) 메커니즘으로 만든 오픈소스 코딩 모델 패밀리입니다. 9B/31B 밀집과 35B/397B MoE 네 가지...
NVIDIA가 ZAI의 753B MoE 추론 모델 GLM-5.2를 NVFP4(4비트)로 양자화해 Hugging Face에 공개했습니다. 모든 가중치를 일괄로 깎는 대신 MoE 전문가의 선형 연산자만 4비트로 줄이고 공유 전문가와 어텐션은 BF16으로 남기는 선택적 양자화로, FP8...
교수의 논문 작성 노하우를 Codex, Claude Code, Gemini 어디서나 불러 쓰는 Skill 패키지로 묶은 오픈소스 프로젝트가 화제입니다. 단순 프롬프트 모음과 무엇이 다른지, Agent Skill이라는 형식이 왜 중요한지, 그리고 수백 개의 Skill로 에이전트 플랫...
Ollama는 쉽고 vLLM은 빠르다는 통념을 2026년 RTX 4090 공개 벤치마크로 다시 검증합니다. 단일 사용자에서는 격차가 13% 안팎이지만, 동시 50명에서는 vLLM이 약 6배 처리량을 냅니다. PagedAttention과 연속 배칭이 만드는 확장 곡선의 차이, 그리고...
AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다. 정작 프로덕션에서 무너지는 지점은 루프를 멈추는 가드레일입니다. 외부 LLM 없이 순수 파이썬으로 가드레일이 붙은 최소 ReAct 루프를 직접 돌려, 단계 상한과 반복 탐...
Google DeepMind가 2026년 4월 공개한 Gemma 4는 E2B부터 31B까지 5종으로 구성된 멀티모달 오픈웨이트 패밀리입니다. Apache 2.0 라이선스, 256K 컨텍스트, 26B MoE와 31B Dense의 차이, 그리고 온프렘 서빙 관점에서 각 모델을 어떻게 ...
NVIDIA가 공개한 Gemma-4-26B-A4B-NVFP4를 DGX Spark 한 대에서 16배 병렬로 돌리면 스트림당 약 18토큰/초, 합산 약 300토큰/초가 나옵니다. 25.2B MoE를 4비트로 압축해 14GB대에 올리는 NVFP4의 원리, 단일 스트림 대 동시성의 트레이...
docker-android는 Android 에뮬레이터를 단일 컨테이너로 패키징해 헤드리스로 띄우는 오픈소스 프로젝트입니다. 이미지 크기와 KVM 요구사항을 실제 문서 기준으로 확인하고, ThakiCloud K8s 플랫폼에서 디바이스 패스스루 워크로드를 운용하는 관점을 정리합니다.
Claude Code 안에서 슬래시 명령 한두 개로 1080p 영상을 렌더링하는 오픈소스 toolkit입니다. API 키 없이 examples/hello-world를 실제로 클론해 렌더했더니 750프레임 25초짜리 1080p 영상이 18초 만에 나왔습니다. 구조와 실측, 그리고 T...
웹 디자이너 빅터 오디가 공개한 16분 튜토리얼은 Gemini 3.1로 사이트 구조를 짜고 Seedance 2.0으로 시네마틱 영상을 입혀, 과거 1만 달러를 받던 마케팅 사이트를 한 사람이 만드는 과정을 보여줍니다. 이 단일 운영자 워크플로가 무엇을 압축했는지, 그리고 멀티모달 ...
Anthropic이 Fable 5를 6월 22일까지만 구독 플랜에 무료로 포함하고, 23일부터는 종량제 크레딧으로 돌립니다. 프런티어 모델의 용량 경제학과, 그것이 LLM 소싱 전략과 소버린 AI에 주는 교훈을 ThakiCloud 관점에서 정리합니다.
AGI·인프라·노동이라는 세 렌즈로 AI의 미래를 달리 보는 허사비스, 황, 아모데이의 세계관을 비교하고, 불확실성이 겹치는 지금 빌더 조직이 각자에게서 무엇을 취해야 하는지 종합한다.
NVIDIA CEO 젠슨 황의 ‘엔지니어 1인당 수백 개 에이전트’ 비전이 현실화될 때 조직 구조와 일하는 방식은 어떻게 바뀌어야 하는가.
DeepMind CEO 허사비스의 ‘AGI와 거리가 멀다’ 발언을 출발점으로, AI 조직이 과대광고 대신 정직한 기대치 설정을 문화로 삼아야 하는 이유를 살핀다.
젠슨 황의 ‘시장이 붙인 별명’을 출발점으로, Moneyball 계승 심화, 데이터가 직관을 이기는 의사결정 문화를 어떻게 조직에 뿌리내릴 것인가
코드의 한계비용이 0에 수렴할 때, 엔지니어링 팀의 가치는 ‘무엇을 만드는가’에서 ‘무엇을 만들어야 하는가를 아는가’로 옮겨간다.
Moonshot AI의 Kimi K2.6은 1T 총 파라미터 중 32B만 활성화하는 MoE 구조로 dense 32B급 추론 비용을 유지하면서 256K 컨텍스트와 멀티모달을 지원한다. 300 서브에이전트 스웜 기능이 K8s 멀티테넌트 에이전트 환경과 자연스럽게 연결된다.
Z.ai의 GLM-5.2는 DSA(Dynamic Sparse Attention)로 1M 컨텍스트를 2.9x FLOPs 절감하며 처리한다. MIT 라이선스로 온프렘 배포가 자유롭고, GGUF 29종 양자화로 소비자급 GPU에서도 실행된다.
Microsoft가 공개한 FastContext-1.0-4B-SFT는 Qwen3-4B를 파인튜닝한 코딩 에이전트 서브에이전트 모델이다. READ/GLOB/GREP 세 가지 도구만 써서 저장소를 탐색하고 근거를 찾는다. 262K 컨텍스트, MIT 라이선스.
Google DeepMind가 공개한 DiffusionGemma-26B-A4B-it는 MoE 기반 VLM이되, 텍스트 생성을 autoregressive가 아니라 이산 확산(discrete diffusion)으로 수행한다. 25.2B 총 파라미터, 3.8B 활성, 256K 컨텍스트,...
lazarus19가 공개한 Vibe-Coding-Instruct는 Apache-2.0, 110만 개 코딩 instruction-response 쌍 데이터셋이다. 이미 7개 Gemma/Qwen 파생 모델을 훈련한 실적이 있으며, 커스텀 코드 에이전트 SFT 파이프라인 구축에 바로 쓸...
Glint-Research가 공개한 Fable 5(Claude Code) 에이전트 trace 4,665개. AGPL-3.0, HF Agent Traces 포맷, tool-use 81% 구성. 소형 모델 distillation과 자가호스팅 코드 에이전트 구축에 활용하는 실전 가이드.
agents-last-exam은 153개 장기 과제로 컴퓨터 사용 에이전트를 평가하는 벤치마크 데이터셋이다. Business, Computing, Engineering, Legal 등 5개 도메인, CC-BY-4.0 라이선스. 자체 모델 벤치마킹 파이프라인 구축 가이드.
HTML, CSS, JavaScript, 이미지를 포함한 전체 웹사이트를 로컬 머신에 다운로드할 수 있는 강력한 Go 기반 웹사이트 클로너 Goclone 사용법을 배워보세요.
RAGLight 프레임워크를 마스터하세요. RAG, Agentic RAG, RAT 파이프라인, MCP 통합을 통해 강력한 검색 증강 생성 시스템을 구축하는 실전 가이드입니다.
LangGPT의 구조화된 프레임워크를 사용하여 고품질의 재사용 가능한 프롬프트를 만드는 방법을 배워보세요. 혼란스러운 프롬프트 엔지니어링을 체계적인 방법론으로 변환하는 템플릿, 예제, 모범 사례를 제공합니다.
udocker를 사용하여 루트 권한 없이 Docker 컨테이너를 실행하는 방법을 배워보세요. HPC 환경, 공유 시스템, 보안 컨테이너 실행에 완벽한 솔루션입니다.
엔터프라이즈급 보안, 비용 제어, 벤더 유연성을 제공하는 오픈소스 AI 에이전트 오케스트레이터 Shannon의 설치부터 고급 멀티 에이전트 워크플로우까지 완전한 가이드를 제공합니다.
Helm Dashboard에 대한 종합 튜토리얼 - 시각적 인터페이스로 Kubernetes 차트 관리를 단순화하고 리비전 히스토리와 손쉬운 롤백 기능을 제공하는 Helm의 필수 UI 도구.
GitHub Copilot, ChatGPT, Claude 등 AI 기반 코딩 도구를 마스터하여 개발 워크플로우를 가속화하고 더 나은 코드를 빠르게 작성하는 방법을 알아보세요.
AI 코딩 에이전트를 위한 효과적인 에이전틱 루프 설계 방법을 마스터하세요. 안전 실습, 도구 선택, 실제 구현 전략을 학습합니다.
컨텍스트 엔지니어링을 마스터하세요 - 프롬프트 엔지니어링보다 10배, 바이브 코딩보다 100배 뛰어난 혁신적 접근법. AI 코딩 어시스턴트를 진정으로 효과적으로 만드는 방법을 배워보세요.
LandingAI의 Agentic Document Extraction 라이브러리를 활용한 지능형 문서 처리 마스터하기. 복잡한 PDF, 이미지, 문서에서 구조화된 데이터를 AI 파싱 기능으로 추출하는 방법을 학습합니다.
기술적 우수성은 모든 커리어의 기초이지만, 진정한 성장을 위해서는 기술적 능력, 제품 사고, 프로젝트 실행, 그리고 인간관계 기술이라는 네 가지 핵심 역량을 균형 있게 발전시켜야 합니다.
LLM 후훈련을 위한 필수 데이터셋과 도구들을 탐구합니다. 지도 미세조정 데이터셋, 선호도 정렬 데이터, 그리고 고품질 AI 모델 구축을 위한 큐레이션 방법론을 다룹니다.
농업부터 e스포츠까지 다양한 분야의 엄선된 공개 데이터셋 컬렉션을 통해 전 세계 오픈 데이터 커뮤니티의 노하우를 만나보세요.
NVIDIA가 6백만 개의 다국어 추론 데이터셋을 공개하며 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 확장된 고품질 훈련 데이터를 제공합니다.
64만 시간의 오디오 데이터로 구성된 NVIDIA의 최신 다언어 음성 인식 및 번역 데이터셋, Granary의 특징과 활용 방안을 알아봅니다.
PDF, 이미지, 오디오 파일을 자동으로 구조화하는 오픈소스 AI 플랫폼 Rowfill의 핵심 기능과 활용법을 알아보세요.
Node.js/TypeScript로 구축된 AnyCrawl로 웹사이트를 LLM 친화적 데이터로 변환하고, Google/Bing SERP 결과를 효율적으로 수집하는 방법을 마스터해보세요.
ByteDance에서 공개한 Dolphin 프로젝트의 Fox 데이터셋과 벤치마크를 상세히 분석합니다. ACL 2025에 게재된 최신 문서 이해 기술과 3천만 개 이상의 샘플로 구성된 대규모 데이터셋을 알아보세요.
RedNote가 공개한 dots.ocr로 다국어 문서 레이아웃 분석과 OCR을 단일 비전-언어 모델에서 구현하는 방법을 알아봅니다.
프로덕션 환경에서 ML 애플리케이션을 구축하기 위해 필요한 핵심 기술 스택과 역량을 정리한 실무 중심 가이드
Vibe Coding과 Agentic Coding이 가져온 새로운 개발 문화를 어떻게 받아들이고 발전시킬 것인가? 과거의 관습에서 벗어나 AI와 함께하는 협업 문화 구축 가이드
15분 설문과 행동 데이터로 팀 궁합을 정량화해 채용부터 온보딩까지 전 과정을 최적화하는 Saberr 알고리즘 활용법
데이터로 숨은 가치를 발굴해 자원 대비 최대 성과를 이끄는 머니볼 전략을 개발·제품·채용에 적용하는 방법
AI 시대의 개발자는 모든 것을 알 필요 없다. 해킹 마인드셋과 역엔지니어링 정신으로 무지를 강점으로 전환하는 새로운 패러다임을 탐구한다.
AI 엔지니어링을 시작하려는 분들을 위한 학습 로드맵입니다. 순서대로 따라가도 되고, 관심 있는 영역부터 먼저 파도 됩니다.
백엔드·인프라 엔지니어 채용을 위한 10대 필독서와 실무 적용 사례를 통해 우리가 찾는 인재상과 채용 기준을 소개합니다.
ThakiCloud의 Three Vs(속도, 검증, 버전관리) 기반 MLOps 문화와 실전 사례, 그리고 함께할 동료를 찾는 채용 안내를 담았습니다.
KCD Seoul 2025에서 발표한 자료를 공유합니다. xPU as a Service 기반 Agentic AI 플랫폼Thaki Cloud에 대한 내용입니다
Thaki Cloud의 기업 문화, 복지, 개발자들의 이야기, 채용 정보 등을 공유합니다.
Thaki Cloud의 미션, 원칙, 그리고 가치를 공유합니다.