에이전트가 스스로 만든 스킬로 자기를 가르친다: SEED가 희소 보상 문제를 푸는 방법
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다. SEED는 에이전트가 자기 궤적에서 스스로 뽑은 자연어 스킬을 다시 자기에게 증류해, 그 희소한 신호를 토큰마다 촘촘한 신호로 바꿉니다.
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다. SEED는 에이전트가 자기 궤적에서 스스로 뽑은 자연어 스킬을 다시 자기에게 증류해, 그 희소한 신호를 토큰마다 촘촘한 신호로 바꿉니다.
긴 추론의 진짜 비용은 상태가 무한정 커지는 데서 옵니다. 마르코프 사고는 사고를 고정 크기 청크로 끊고, 청크 경계에서 짧은 상태만 넘겨 이어 가게 해 비용을 제곱에서 선형으로 바꿉니다.
무인 에이전트 루프에 검증 게이트를 넣으면 안전해진다는 통념을 실측으로 뜯어본 결과, 게이트 혼자서는 오히려 반복 소진율을 급증시키는 함정이 있었습니다.
The real bottleneck in agentic RL is that the reward arrives only once, at the very end of a trajectory. SEED turns that single sparse signal into dense per-...
The real cost of long reasoning comes from the state growing without bound. Markovian Thinking breaks reasoning into fixed-size chunks and passes only a shor...
العائق الحقيقي في التعلّم المعزّز للوكلاء (agentic RL) هو أن المكافأة تصل مرة واحدة فقط، في نهاية المسار (trajectory). يحوّل SEED هذه الإشارة النادرة الوحيدة...
الكلفة الحقيقية للاستدلال الطويل تأتي من نمو الحالة (state) بلا حدود. يقسّم التفكير الماركوفي (Markovian Thinking) الاستدلال إلى كتل (chunks) ثابتة الحجم ويم...
그림 속 글자는 또박또박, 근데 그 붓은 남의 클라우드에 꽂혀 있다ㅋ
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다. 문제는 모델의 지능이 아니라 답을 검증된 원문에 묶지 않은 설계입니다. 법제처 국가법령정보 Open API를 근거원으로 삼아 LLM 법률 답변을 인용 기반으로 바꾸는 방법을, 서빙 관점에서 정...
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다. 그 비결은 ‘더 많은 테스트’가 아니라 벤치마크 게이트, 릴리스 브랜치 고정, 커밋 단위 이등분이라는 세 가지 결정론적 장치입니다. vLLM 유지관리팀이 공개한 운영기를 타키클라우드 서빙 관...
Claude Code 데스크톱이 iOS 시뮬레이터를 대화 옆 패널에 띄우는 기능을 공개 베타로 내놨습니다. 앱을 빌드해 실행하고, Claude가 실행 중인 화면을 직접 보며 고쳐 나가는 이 닫힌 루프가 무엇을 바꾸는지, 어떻게 켜는지, 그리고 에이전트 네이티브 클라우드 관점에서 왜...
Archify는 Mermaid 문법을 배우지 않고도 평범한 문장 설명만으로 자기완결형 HTML 아키텍처 다이어그램을 만드는 에이전트 스킬입니다. 실제로 설치해 타키클라우드 ai-platform 구조를 그려 보니, 핵심은 그림이 아니라 레이아웃을 강제로 검증하는 렌더러였습니다. 그 ...
7월 22일, 오픈웨이트 릴리스 두 건이 거울처럼 마주 섰습니다. 하나는 코드를 생성하고 하나는 그 코드의 취약점을 찾습니다. 그런데 둘 다 답하지 못하는 질문이 하나 남습니다. 그 코드는 실제로 누구의 인프라에서, 어떤 권한으로 돌아가는가.
vLLM merges roughly 2,000 commits into main every month and still holds production quality. The secret is not ‘more tests’ but three deterministic devices: a...
Claude Code desktop has shipped a public beta feature that opens the iOS simulator in a panel right next to the conversation. Here is what changes when Claud...
Archify is an agent skill that generates self-contained HTML architecture diagrams from plain-language descriptions, no Mermaid syntax required. We installed...
The letters come out perfect. The brush is bolted to someone else’s cloud.
On July 22, two open weight releases stood facing each other like mirror images. One generates code, the other finds vulnerabilities in it. Yet neither answe...
يدمج vLLM نحو 2000 التزام في main كل شهر ويحافظ مع ذلك على جودة الإنتاج. السر ليس ‘مزيداً من الاختبارات’ بل ثلاث آليات حتمية: بوابة قياس أداء، وتثبيت فرع الإ...
أطلق تطبيق Claude Code لسطح المكتب ميزة تُظهر محاكي iOS في لوحة جانبية بجوار المحادثة، ضمن نسخة تجريبية عامة. نستعرض ما تغيّره هذه الحلقة المغلقة التي يبني ف...
Archify مهارة وكيل تُنشئ مخططات معمارية بصيغة HTML ذاتية الاكتفاء من وصف بجملة عادية دون الحاجة لتعلّم صيغة Mermaid. حين ثبّتناها فعليًا ورسمنا بها بنية ai-p...
في الثاني والعشرين من يوليو، وقف إصداران مفتوحا الأوزان وجها لوجه كالمرآة. أحدهما يولد الكود، والآخر يبحث عن ثغراته. لكن يبقى سؤال واحد لم يجب عليه أي منهما،...
VRAM 있는 만큼 골라 담았더니, 클라우드 청구서만 굶었다ㅋ
버스트성 테넌트가 놀릴 때 정적 균등 분배는 그 몫을 낭비합니다. 고정 예산을 수요 쪽으로 옮기는 동적 컨트롤러는 실제 H200에서 총 처리량을 14% 끌어올렸습니다.
알리바바 Qwen 팀이 이미지 생성 3세대 모델 Qwen-Image-3.0을 발표했습니다. 4.5k 토큰 입력, 10px 초소형 텍스트, 12개 언어 렌더링을 앞세웠지만 지금 쓸 수 있는 경로는 Qwen Chat 호스팅뿐이고 가중치도 벤치마크도 공개되지 않았습니다. 확인된 사실과 ...
허깅페이스가 2026년 7월 자율 AI 에이전트에 의한 내부 침해를 공개했습니다. 진입로는 악성 데이터셋 하나였고, 데이터셋 처리 파이프라인의 두 취약점이 코드 실행으로 이어졌습니다. 확인된 사실과 아직 조사 중인 부분을 나누고, 데이터셋 처리를 신뢰 경계로 다뤄야 하는 이유를 정...
허깅페이스가 공개한 hugging-voice와 그 엔진인 speech-to-speech는 VAD에서 STT, LLM, TTS까지 이어지는 실시간 음성 파이프라인을 OpenAI Realtime 호환 WebSocket으로 감쌌습니다. 클라이언트의 base URL 한 줄만 바꾸면 자체 ...
Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다. claude --ax-screen-reader 한 줄이 무엇을 바꾸는지, 어떤 원리로 동작하는지, 그리고 에이전트 인터페이스의 접근성이 왜 타키클라우드 같은 플랫폼에 중요한 문제...
오픈소스 마케팅 플러그인 Digital Marketing Pro는 스킬 158개와 전문 에이전트 24개를 하나로 묶고도 무너지지 않습니다. 비결은 12단계 고정 흐름이라는 결정론적 골격입니다. 이 설계를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어떻게 제품화하는지 정리했습니다.
Cursor가 835쪽 매뉴얼만 보고 SQLite를 Rust로 재구현한 에이전트 스웜을 공개했습니다. 홀드아웃 테스트 100% 통과, 모델 조합에 따라 15배 벌어진 비용, 초당 1,000커밋을 감당하려 새로 만든 버전관리 시스템까지, 홍보 문구가 아니라 공식 블로그 수치로 검증하...
Does an agent that observes GPU telemetry and adjusts batch size and concurrency in real time outperform static Kueue admission control? The simulation said ...
Alibaba’s Qwen team has announced Qwen-Image-3.0, its third-generation image generation model. It leads with 4.5k-token input, 10px micro-text rendering, and...
In July 2026 Hugging Face disclosed an internal breach driven by an autonomous AI agent. The entry point was a single malicious dataset, and two vulnerabilit...
Hugging Face’s hugging-voice and its engine speech-to-speech wrap a full realtime voice pipeline, from VAD through STT, LLM, and TTS, behind an OpenAI Realti...
Claude Code added a screen reader mode that swaps its visual terminal UI for plain, linear text. Here is what claude --ax-screen-reader actually changes, how...
The open-source marketing plugin Digital Marketing Pro bundles 158 skills and 24 specialist agents without collapsing. The trick is a deterministic skeleton:...
We sized the model to the card we already owned. The only thing that starved was the cloud invoice.
Cursor showed an agent swarm that rebuilt SQLite in Rust from only its 835-page manual. It passed 100% of a held-out test suite, cost varied 15x by model mix...
هل يتفوق عميل (agent) يراقب قياسات وحدة معالجة الرسوميات (GPU telemetry) ويضبط حجم الدفعة (batch size) والتزامن (concurrency) في الوقت الفعلي على التحكم الثا...
أعلن فريق Qwen التابع لعلي بابا عن Qwen-Image-3.0، الجيل الثالث من نماذج توليد الصور. طرح النموذج قدرات لافتة مثل استيعاب مدخلات بطول 4.5 ألف رمز (token)، وع...
في يوليو 2026 كشف Hugging Face عن اختراق داخلي قاده وكيل ذكاء اصطناعي ذاتي. كانت نقطة الدخول مجموعة بيانات خبيثة واحدة، وأدت ثغرتان في خط معالجة مجموعات البي...
يغلّف مشروع hugging-voice من Hugging Face ومحركه speech-to-speech خط معالجة صوتي لحظي كامل، من كشف النشاط الصوتي إلى STT وLLM وTTS، خلف واجهة WebSocket متواف...
أضاف Claude Code وضع قارئ الشاشة الذي يستبدل واجهة الطرفية البصرية بنص خطي بسيط. إليك ما يغيّره الأمر claude --ax-screen-reader فعليًا، وكيف يعمل، ولماذا تهم...
يجمع المكوّن الإضافي مفتوح المصدر Digital Marketing Pro بين 158 مهارة و24 وكيلًا متخصصًا دون أن ينهار. السر هيكل حتمي: تدفّق ثابت من 12 جزءًا. نحلّل التصميم ...
عرضت Cursor سربًا من الوكلاء أعاد بناء SQLite بلغة Rust اعتمادًا على دليلها المؤلف من 835 صفحة فقط. اجتاز 100% من مجموعة اختبارات محجوزة، وتفاوتت التكلفة 15 ...
리더보드 1등 먹었는데, 그게 남의 시험지였다ㅋ
도구를 쓰는 LLM 에이전트는 모델을 감싸는 하네스 위에서 돕니다. 최근 arXiv 논문은 이 하네스 설계와 사후학습을 분리해서 다루면 성능이 무너진다는 점을, 특히 도구 환경이 바뀌는 상황에서 실증합니다. 하네스를 일급 리소스로 다루는 관점에서 이 결과를 풀어봅니다.
밤새 스스로 코드를 고치는 에이전트 하네스가 다음 날 그 결과물을 어떻게 배포해야 안전할까요. 카나리와 자동 롤백을 끼운 실험이 장애 반경과 복구시간의 트레이드오프를 구체적으로 보여줍니다.
알리바바가 2.4조 파라미터 규모의 Qwen3.8을 곧 오픈웨이트로 공개하겠다고 예고했습니다. 프리뷰는 이미 테스트할 수 있지만 가중치도 벤치마크도 아직 공개되지 않았습니다. 발표에서 확인된 사실과 아직 주장에 머무는 부분을 구분해 정리했습니다.
폐쇄형 모델이 정당한 보안·의료·법률 작업까지 거부하는 과잉 거부 문제가 다시 도마에 올랐습니다. Moonshot의 오픈웨이트 Kimi K3는 콘텐츠 필터를 아예 두지 않는다고 밝혔습니다. 이 설계가 운영자에게 무엇을 넘겨주는지, 그리고 그 부담을 어떻게 다뤄야 하는지를 정리했습니다.
Moonshot이 공개한 Kimi K3는 오픈웨이트 역사상 가장 큰 2.8조 파라미터 모델입니다. 점수는 화려하지만 곧바로 벤치마크 과적합 논쟁이 붙었습니다. 운영자가 이 모델을 도입하기 전에 무엇을 어떻게 검증해야 하는지를 정리했습니다.
레이어나 전문가 단위가 아니라 텐서 하나하나를 CPU와 GPU에 나눠 배치하면, RTX 4090 한 장으로 VRAM을 훌쩍 넘는 모델을 돌리면서 디코딩을 최대 3.29배 끌어올릴 수 있다는 논문 ATSInfer를 읽고, 그 원리와 우리 서빙 관점에서의 함의를 정리했습니다.
국내 사용자에게 250억 원이 청구된 사건부터 기업 60곳의 과다 청구 의혹까지, 최근 한 달의 AI 비용 뉴스는 하나의 공백을 가리킵니다. 한 번의 요청이 수백 번의 모델 호출로 번지는 에이전트 시대에, 청구서는 더 이상 무엇에 돈을 냈는지 설명해 주지 않습니다. 이 관측 공백을...
AI 코딩 도구가 매 세션 규칙을 잊어버리는 문제를, 한 해커톤 우승자가 실제 TypeScript 마이크로서비스를 6개월 돌리며 쌓은 설정으로 풀었습니다. everything-claude-code의 얇은 하네스·두꺼운 스킬 구조를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어...
일론 머스크가 다보스에서 던진 세 가지 예측이 ‘3년 뒤 급여의 시대가 끝난다’는 경고로 번졌습니다. 실제 인터뷰 영상을 받아 적어 그가 정확히 무엇을 말했는지 확인하고, 노동에서 자산으로 넘어가는 흐름의 밑바닥에서 도는 컴퓨트 인프라가 왜 진짜 관건인지 짚습니다.
문샷AI가 MIT 라이선스로 공개한 오픈소스 코딩 CLI를 공식 문서 기준으로 분석합니다. 서브에이전트와 MCP 편의성은 클로드 코드와 겹치지만, 진짜 차별점은 Agent Client Protocol 네이티브 지원과 모델 개방성입니다.
Anthropic이 Claude Code의 시스템 프롬프트를 80% 걷어냈다는 소식이 개발자 사이에서 화제가 됐습니다. 담당자는 새 모델이 ‘더 작은 시스템 프롬프트를 원하고’, 오히려 우리가 준 지침보다 더 상상력이 풍부하다고 설명했습니다. 모델이 강해질수록 하네스는 얇아지고 규...
Tool-using LLM agents run on top of a harness that wraps the model. A recent arXiv paper shows empirically that treating harness design and post-training as ...
How should an agent harness that rewrites its own code overnight safely roll out the result the next day? An experiment pairing canary releases with automati...
Alibaba has previewed Qwen3.8, a 2.4-trillion-parameter model, promising an open-weight release. The preview is already testable, but neither the weights nor...
The over-refusal problem, where closed models block legitimate security, medical, and legal work, is back in the spotlight. Moonshot’s open-weight Kimi K3 sa...
Kimi K3, released by Moonshot, is the largest open-weight model in history at 2.8 trillion parameters. The scores are dazzling, but a benchmark-overfitting d...
Instead of offloading whole layers or experts, ATSInfer places individual tensors across CPU and GPU. The paper reports running models far beyond VRAM on a s...
From a 25 billion won bill sent to a user in Korea to allegations of overbilling at 60 companies, the past month of AI cost news points to a single blind spo...
AI coding tools forget your rules every new session. An Anthropic hackathon winner solved this by open-sourcing the config they refined over six months on a ...
Elon Musk’s three Davos predictions got recompressed online into a warning that ‘the age of the paycheck ends in three years.’ We transcribed the actual inte...
Topped the leaderboard — on somebody else’s exam.
We dig into the open source coding CLI that Moonshot AI released alongside Kimi K3, working strictly from the official docs and repository. From coder/explor...
News that Anthropic stripped Claude Code’s system prompt down by 80 percent made the rounds among developers. The person behind the change explained that the...
يعمل وكيل LLM المستخدِم للأدوات فوق harness يحيط بالنموذج. وتُثبت ورقة بحثية حديثة على arXiv، عملياً، أن الفصل بين تصميم هذا الـ harness والـ post-training ي...
كيف يمكن لحاضنة عميل ذاتية (agent harness) تعيد كتابة كودها بنفسها طوال الليل أن تنشر نتيجتها بأمان في اليوم التالي؟ تجربة تجمع بين إصدارات الكناري (canary r...
أعلنت علي بابا عن نيتها إصدار Qwen3.8 بحجم 2.4 تريليون معلمة كأوزان مفتوحة قريبا. النسخة التجريبية متاحة للاختبار بالفعل، لكن الأوزان والمعايير القياسية لم ت...
عادت مشكلة الرفض المفرط، التي تجعل النماذج المغلقة ترفض حتى المهام الأمنية والطبية والقانونية المشروعة، إلى الواجهة من جديد. أعلنت Moonshot أن نموذجها مفتوح ...
أطلقت Moonshot نموذج Kimi K3، وهو أكبر نموذج مفتوح الأوزان في التاريخ بـ 2.8 تريليون معامل. النتائج مبهرة، لكن جدلاً حول الإفراط في التكيّف مع المعايير القيا...
بدلاً من إنزال طبقات أو خبراء كاملين، يوزّع ATSInfer الموتّرات فرادى بين الـ CPU والـ GPU. تُبلّغ الورقة عن تشغيل نماذج تتجاوز سعة الـ VRAM بكثير على بطاقة R...
من حادثة فوترة بقيمة 25 مليار وون طالت مستخدما محليا إلى شبهات فوترة زائدة شملت 60 شركة، تشير أخبار تكلفة الذكاء الاصطناعي في الشهر الأخير إلى فجوة واحدة. في...
أدوات البرمجة بالذكاء الاصطناعي تنسى قواعدك مع كل جلسة جديدة. حلّ أحد الفائزين بهاكاثون Anthropic هذه المشكلة بنشر إعداداته مفتوحة المصدر بعد صقلها ستة أشهر ...
اختُزلت توقّعات إيلون ماسك الثلاثة في دافوس على الإنترنت إلى تحذير مفاده أن ‘عصر الراتب ينتهي خلال ثلاث سنوات’. فرّغنا مقطع المقابلة الفعلي لنتحقق مما قاله ح...
نحلل أداة سطر الأوامر المفتوحة المصدر للبرمجة التي أطلقتها Moonshot AI إلى جانب Kimi K3، استناداً إلى الوثائق الرسمية والمستودع الفعلي. من الوكلاء الفرعيين c...
أثار خبر تخفيض أنثروبيك حجم التعليمات النظامية في Claude Code بنسبة 80 بالمئة نقاشا واسعا بين المطورين. وأوضح المسؤول عن ذلك أن النموذج الجديد “يريد تعليمات ...
똑똑한 한 놈은 벽에서 막힌대. 그래서 파시스가 떼로 풀었다ㅋ
GPT-5.6이 사이즈마다 대여섯 개의 추론 노력 설정을 달고 나오면서, effort 조절은 이제 리즈닝 모델의 기본기가 됐습니다. 같은 라벨 뒤에 어떤 학습 레시피가 숨어 있는지, 오픈웨이트 6개 모델의 기술 리포트를 뜯어 공통 골격을 정리합니다.
상탕(SenseTime)이 日日新 SenseNova U1을 Apache 2.0으로 공개했습니다. 비주얼 인코더와 VAE를 모두 없앤 NEO-Unify 아키텍처로 이해·생성·편집·인터리브를 한 모델에서 처리합니다. 오픈 가중치(8B-MoT/A3B-MoT)와 호스티드 U1 Pro의 차...
메모리 쇼크로 AI 인프라를 소유하는 값은 사상 최고로 치솟는데, 키미 K3와 중국 오픈웨이트가 AI를 쓰는 값을 사상 최저로 끌어내렸습니다. 벌어지는 이 가위 사이에서 승부처는 모델이 아니라 활용률로 옮겨갑니다.
OpenAI가 GPT-5.6 Sol을 두고 사이버 레인지에서 새 기록을 세웠다고 발표했습니다. 프런티어 모델이 실제 공격 체인을 자율로 밟기 시작하면, 승부처는 모델의 성능이 아니라 그 모델을 어디에서 어떤 통제 아래 돌리느냐로 옮겨갑니다.
내 음성 에이전트의 어느 단계가 병목인지 벤더 SDK 없이 진단하는 공개 도구를 만들고, RunPod H200에서 우리 실제 스택(Qwen3-ASR·VoxCPM2·Qwen3-TTS)을 측정했습니다. STT는 빠르고, 비스트리밍 TTS가 진짜 병목이었습니다.
MoE 전문가를 CPU로 내려 24GB GPU 한 장으로 거대 모델을 돌린다는 ktransformers. 화제가 된 ‘28배’와 ‘40만 달러를 24GB로’를 RunPod에서 직접 쟀습니다. 트릭은 진짜였고, INT4 AMX 커널을 켜니 671B급이 디코딩 약 16 tok/s로 돌...
With GPT-5.6 shipping five or six reasoning effort settings per size, effort control has become table stakes for reasoning models. We dig into what training ...
SenseTime has released 日日新 SenseNova U1 under Apache 2.0. Its NEO-Unify architecture drops both the visual encoder and the VAE, handling understanding, gener...
A memory shock has pushed the cost of owning AI infrastructure to an all time high, while Kimi K3 and Chinese open weight models have dragged the cost of usi...
OpenAI announced that GPT-5.6 Sol set a new record on a cyber range. As frontier models begin autonomously executing real attack chains, the decisive factor ...
We built an open tool that diagnoses which stage of your voice agent is the bottleneck, without any vendor SDK, and measured our actual stack (Qwen3-ASR, Vox...
ktransformers claims you can run a giant MoE model on a single 24GB GPU by offloading experts to CPU. We tested the viral ‘28x’ and ‘$400K to 24GB’ claims by...
One clever agent hits a wall fast. So Paxis just sent the whole swarm.
مع طرح GPT-5.6 لخمسة أو ستة إعدادات لجهد الاستدلال لكل حجم، أصبح التحكم في الجهد ركيزة أساسية لنماذج الاستدلال. نتناول هنا وصفة التدريب الكامنة خلف التسمية ن...
أطلقت SenseTime نموذج 日日新 SenseNova U1 برخصة Apache 2.0. تعتمد بنية NEO-Unify التي تلغي كلاً من المشفر البصري و VAE، وتعالج الفهم والتوليد والتحرير والتوليد ...
دفعت صدمة الذاكرة تكلفة امتلاك البنية التحتية للذكاء الاصطناعي إلى أعلى مستوى في تاريخها، بينما خفض نموذج كيمي K3 والنماذج الصينية مفتوحة الأوزان تكلفة استخد...
أعلنت OpenAI أن GPT-5.6 Sol سجل رقماً قياسياً جديداً في ساحة اختبار سيبرانية. عندما تبدأ النماذج المتقدمة بتنفيذ سلاسل هجوم حقيقية بشكل مستقل، تنتقل نقطة الح...
بنينا أداة مفتوحة تُشخّص أي مرحلة من وكيل الصوت لديك هي نقطة الاختناق، دون أي SDK من مزود، وقسنا مكدسنا الفعلي (Qwen3-ASR وVoxCPM2 وQwen3-TTS) على وحدة RunPo...
تدّعي ktransformers أنه يمكنك تشغيل نموذج MoE ضخم على بطاقة GPU واحدة بسعة 24 جيجابايت عبر نقل الخبراء (experts) إلى وحدة المعالجة المركزية. اختبرنا الادعاءا...
랙 빌릴 돈이, 서랍 속 카드 한 장에 날아갔다ㅋ
Fable 5급이라 불리는 2.8T 오픈 모델 Kimi K3를 프로프라이어터리 IDE가 아니라 오픈소스 터미널 에이전트에 붙이는 실전 방법을 봅니다. OpenCode를 직접 설치해 프로바이더 연결 흐름까지 확인했습니다.
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.
Moonshot이 세계 최대 규모의 오픈웨이트 모델 Kimi K3를 공개했습니다. 프론트엔드 코딩 벤치마크에서 최상위 폐쇄 모델을 앞섰다는 점도 놀랍지만, 진짜 질문은 그 다음입니다. 2.8조 파라미터 모델을 자체 인프라에서 돌린다는 것은 실제로 무엇을 요구하는가. 타키클라우드 서...
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.
중국 키미 K3가 코딩 리더보드에서 클로드를 제쳤는데 실리콘밸리는 냉담합니다. 같은 주에 구글은 제미나이 3.5를 세 번째로 미뤘습니다. 성능 정점에서 산업이 깨닫는 진실은 하나입니다. 벤치마크 점수는 배포 신뢰를 사주지 못합니다.
Kimi K3, called Fable 5-class by many, can run inside an open-source terminal agent rather than a locked proprietary IDE. We installed OpenCode to verify the...
Most of an AI agent’s cost isn’t smart judgment — it’s simple, repetitive decisions made thousands of times a day. Peel those off into small specialized mode...
Moonshot has released Kimi K3, the largest open weight model in the world to date. What is striking is not just that it beat top closed models on a frontend ...
When you put an LLM into real service, most of the cost is decided not by the model itself but by the inference engine. Here’s how vLLM cuts GPU waste with P...
The rack you were about to rent is already in your drawer.
China’s Kimi K3 overtook Claude on the coding leaderboard, yet Silicon Valley stayed cold. The same week, Google delayed Gemini 3.5 for a third time. At the ...
يمكن تشغيل Kimi K3، الذي يصفه كثيرون بأنه من فئة Fable 5، داخل وكيل طرفية مفتوح المصدر بدلًا من بيئة تطوير مغلقة مملوكة. ثبّتنا OpenCode للتحقق من مسار اتصال...
معظم تكلفة وكيل الذكاء الاصطناعي ليست في الحكم الذكي، بل في قرارات بسيطة متكرّرة آلاف المرات يوميًا. افصل هذه المهام إلى نماذج صغيرة متخصّصة تعمل على بنيتك ا...
أطلقت Moonshot نموذج Kimi K3، أكبر نموذج مفتوح الأوزان في العالم حتى الآن. المثير ليس فقط تفوقه على أفضل النماذج المغلقة في اختبار برمجة الواجهات الأمامية، ب...
عند نشر نموذج لغوي كبير في خدمة حقيقية، تتحدد معظم التكلفة ليس باختيار النموذج، بل بمحرك الاستدلال الذي يشغّله. نستعرض كيف يقلل vLLM من هدر GPU عبر PagedAtte...
تجاوز نموذج كيمي K3 الصيني كلود في لوحة صدارة البرمجة، لكن وادي السيليكون استقبل الخبر ببرود. وفي الأسبوع نفسه، أجّلت جوجل جيميناي 3.5 للمرة الثالثة. والحقيق...
노력 눈금 최대로 땡겼더니, 청구서만 최대치더라ㅋ
에이전트 스킬이나 MCP 도구 카탈로그를 계속 늘려온 팀이라면 라우팅 정확도가 어느 순간부터 떨어지는 걸 체감했을 겁니다. 리트리버를 더 잘 만드는 대신 코퍼스 자체를 줄이면 어떻게 될까요. 2,164개 유닛을 가진 실제 프로덕션 하네스에서 회귀 없이 160개 스킬을 폐기한 실험을...
Google AI Edge의 Cormac Brick은 270M 파라미터의 FunctionGemma를 파인튜닝해 특정 에이전트 과제에서 정확도를 46%에서 90%로 끌어올린 사례를 발표했습니다. 핵심은 큰 모델을 부르는 대신, 작은 모델을 좁은 과제에 맞춰 폰 위에서 돌리는 것입니다...
Tencent이 공개한 Hy3 1-bit·4-bit GGUF 빌드는 295B MoE 모델을 598GB에서 85.5GiB까지 줄여 단일 GPU에서 돌립니다. 다만 여기서 말하는 단일 GPU는 128GB급 통합 메모리를 뜻하지, 16GB 소비자 카드가 아닙니다. 저희는 이 압축이 무엇...
Claude Code가 v2.1.101에서 /simplify를 /code-review로 바꾸면서 리뷰에 노력 단계를 붙였습니다. low와 medium은 확신 높은 소수의 지적만, high와 max는 넓은 커버리지와 불확실한 발견까지, ultra는 클라우드에서 여러 에이전트가 병렬로...
If your team has kept expanding its catalog of agent skills or MCP tools, you’ve probably felt routing accuracy start to slip at some point. What happens if,...
Google AI Edge’s Cormac Brick presented a case where fine-tuning the 270M-parameter FunctionGemma lifted accuracy on a specific agent task from 46% to 90%. T...
Tencent’s Hy3 1-bit and 4-bit GGUF builds shrink a 295B MoE from 598GB to 85.5GiB so it runs on a single GPU. But the single GPU here means a 128GB-class uni...
In v2.1.101 Claude Code renamed /simplify to /code-review and attached effort levels to the review. low and medium return a few high-confidence findings, hig...
We cranked the effort dial to max. So did the invoice.
إذا كان فريقك قد واصل توسيع كتالوج مهارات الوكيل (agent skills) أو أدوات MCP، فمن المرجح أنك لاحظت في مرحلة ما تراجع دقة التوجيه (routing accuracy). ماذا لو،...
عرض Cormac Brick من Google AI Edge حالة رفع فيها ضبطُ نموذج FunctionGemma بحجم 270 مليون معامل الدقةَ في مهمة وكيل محددة من 46% إلى 90%. الجوهر هو تشغيل نموذ...
تُقلّص نسخ Hy3 من Tencent بصيغة GGUF بدقة 1-bit و4-bit نموذج MoE بحجم 295B من 598GB إلى 85.5GiB ليعمل على وحدة معالجة رسومات واحدة. لكن المقصود بـ«وحدة واحدة...
في الإصدار v2.1.101 أعاد Claude Code تسمية /simplify إلى /code-review وأضاف مستويات الجهد إلى المراجعة. يعيد المستويان low وmedium عددًا قليلًا من النتائج عا...
AI가 AI를 하루만에 우등생 만듦ㅋ 근데 밤새 돌린 GPU는 누구 거임?
정적 마크다운으로 끝나던 아티팩트가 커넥터를 호출하는 살아 있는 앱이 됐습니다. 열 때마다 스스로 최신 데이터를 다시 긁어 오는 대시보드를 어떻게 만드는지 봅니다.
LLM 에이전트에게 K8s GPU 인시던트 원격조치를 맡기려는 팀이라면 결국 이 질문과 마주칩니다. 언제까지는 에이전트 혼자 고치게 두고, 언제부터는 사람을 불러야 하는가. 이 경계선을 감으로 정하지 않고 위험도 공식과 안전 상한선으로 계산해낸 논문을 소개합니다.
수직계열화의 상징 애플이 자체 칩을 포기하고 구글 GPU와 중국 라이벌 모델까지 빌립니다. 같은 날 한국은 정반대로 15GW 데이터센터를 소유하려 수십조를 쏟습니다. 두 방향이 가리키는 하나의 결론을 읽습니다.
PrismML이 공개한 Bonsai 27B는 Qwen3.6-27B를 새로 학습한 모델이 아니라, 아키텍처를 그대로 둔 채 가중치만 1-bit·ternary로 압축한 결과물입니다. Ternary 빌드는 5.9GB에서 FP16 품질의 94.6%를, 1-bit 빌드는 3.9GB에서 89...
터미널 6개를 띄워 놓고 응답을 기다리다 엔터만 누르는 하루. ‘멀티 클로딩’이라 불리는 이 새로운 노동이 개발자의 집중력을 갉아먹는 이유를 짚고, 감시자에서 오케스트레이터로 옮겨 가는 위임의 기술을 이야기합니다.
자가진화 하네스가 냈다는 이득은 ‘갱신을 잘 만드는 능력’과 ‘갱신을 잘 쓰는 능력’이 한 루프 안에서 뒤섞인 값입니다. 둘을 분리하면 어디에 예산을 써야 하는지가 뒤집힙니다.
에이전트가 코드베이스에서 생산적으로 일하지 못한다면, 그건 모델의 실패가 아니라 자동화의 실패입니다. 도메인 지식을 인프라로 옮기는 일은 엔지니어가 늘 해온 일의 자연스러운 확장입니다.
코딩 에이전트에게 자연어 프롬프트 두 개를 주면 비전 파운데이션 모델의 포스트트레이닝이 하루 만에 끝납니다. NVIDIA의 에이전트 스킬을 해부하고, 스킬을 일급 리소스로 다루는 우리 플랫폼에 무엇이 옮겨지는지 봅니다.
Artifacts used to end as static markdown. Now they’re living apps that call connectors. Here’s how to build a dashboard that pulls fresh data every time you ...
Any team trying to hand Kubernetes GPU incident remediation to an LLM agent eventually runs into this question: how long should the agent be left to fix thin...
Apple, the symbol of vertical integration, gives up its own chip and borrows Google’s GPUs and even a Chinese rival’s model. On the same day, Korea pours ten...
Bonsai 27B, released by PrismML, is not a newly trained model but the result of compressing Qwen3.6-27B’s weights to 1-bit and ternary while leaving the arch...
A day spent with six terminals open, waiting on responses and just smashing enter. This new kind of labor, called multi-Clauding, is quietly draining develop...
An AI tutored another AI to an A overnight. Whose GPUs paid for the study session?
The gains attributed to self-evolving harnesses are a mix of ‘the ability to produce good updates’ and ‘the ability to use those updates well,’ tangled toget...
If an agent can’t work productively in a codebase, that is not a failure of the model. It is a failure of automation. Moving domain knowledge into infrastruc...
Give a coding agent two natural-language prompts, and post-training a vision foundation model finishes in a single day. We dissect NVIDIA’s agent skill and l...
كانت الأعمال تنتهي كملفات ماركداون ثابتة. الآن أصبحت تطبيقات حية تستدعي الموصلات. نستعرض كيفية بناء لوحة معلومات تسحب بيانات جديدة في كل مرة تفتحها.
أي فريق يفكر في تكليف عميل LLM بمعالجة حوادث GPU في K8s عن بُعد سيصطدم في النهاية بهذا السؤال: إلى متى نترك العميل يصلح الأمور بمفرده، ومتى نستدعي الإنسان؟ ن...
آبل، رمز التكامل الرأسي، تتخلى عن رقاقاتها الخاصة وتستأجر وحدات معالجة رسوميات جوجل بل ونماذج منافسة صينية. في اليوم ذاته، تندفع كوريا الجنوبية في الاتجاه ال...
لا يُعد Bonsai 27B، الذي أصدرته PrismML، نموذجا تم تدريبه من جديد، بل هو نتيجة ضغط أوزان Qwen3.6-27B إلى صيغتي 1-bit وternary مع إبقاء البنية المعمارية كما ه...
يوم كامل مع ست نوافذ طرفية مفتوحة، تنتظر الردود وتضغط Enter فحسب. هذا النوع الجديد من العمل، المسمى multi-Clauding، يستنزف تركيز المطورين بهدوء. نبحث في السب...
المكاسب المنسوبة إلى الأدوات ذاتية التطور هي في الحقيقة مزيج بين ‘القدرة على إنتاج تحديثات جيدة’ و’القدرة على استخدام تلك التحديثات جيدًا’، متشابكتان داخل حل...
إذا لم يستطع الوكيل العمل بفعالية داخل قاعدة الكود، فذلك ليس فشلا في النموذج، بل فشل في الأتمتة. نقل المعرفة التخصصية إلى البنية التحتية هو امتداد طبيعي لما ...
بمطالبتين فقط بلغة طبيعية يُسلَّمان إلى وكيل برمجي، ينتهي التدريب اللاحق لنموذج رؤية أساسي في يوم واحد. نشرّح مهارة وكيل NVIDIA، وننظر إلى ما يمكن أن يُنقل م...
후보를 갈구던 AI, 자기부터 갈궈봤더니ㅋ
파인튜닝이 이길 줄 알고 시작했는데 데이터가 뒤집었습니다. 학습 없이 TDS를 지키는 생성기를 얻은 과정과, 유효한 화면이 좋은 화면은 아니라는 다음 숙제까지 정리합니다.
지금까지 새 모델 아키텍처는 두 번 만들어야 했습니다. 한 번은 학습·연구를 위한 Transformers에서, 또 한 번은 프로덕션 추론을 위한 vLLM에서요. vLLM v0.25.0의 네이티브 속도 Transformers 백엔드는 이 이중화를 끝냅니다. 원리는 torch.fx로 ...
대규모 모델을 여러 가속기에 나눠 학습하거나 서빙할 때, 실제 병목은 연산이 아니라 가속기 사이를 오가는 데이터입니다. 이 글은 all-reduce, all-gather, reduce-scatter, all-to-all 같은 컬렉티브 연산이 무엇인지, 그리고 이 연산들이 GPU 클...
한 개발자가 Codex에 어려운 /goal을 줄 때 ‘다른 스레드가 이 목표를 달성하도록 목표를 대신 써달라’고 먼저 요청한다는 팁을 공유했습니다. 얼핏 말장난처럼 들리지만, 그 안에는 검증 가능한 목표 명세를 모델에게 먼저 작성시키고 그 명세를 새 스레드에 위임한다는 실질적인 에...
We expected fine-tuning to win. The data said otherwise. Here’s how we ended up with a generator that respects TDS without any training, and the next problem...
Until now, every new model architecture had to be built twice: once in Transformers for training and research, and again in vLLM for production inference. vL...
When training or serving a large model across many accelerators, the real bottleneck usually isn’t computation, it’s the data moving between accelerators. Th...
The AI that grills candidates decided to grill itself first.
A developer shared a tip: when handing Codex a genuinely hard /goal, first ask it to write the goal so that another thread can achieve it. It sounds like wor...
بدأنا معتقدين أن الضبط الدقيق سيفوز، لكن البيانات قلبت التوقعات. نلخّص هنا كيف حصلنا على مولّد يحافظ على قواعد TDS دون أي تدريب، وصولًا إلى الدرس التالي: الش...
حتى الآن كان يجب بناء كل بنية نموذج مرتين: مرة في Transformers للتدريب والبحث، ومرة أخرى في vLLM للاستدلال الإنتاجي. خلفية Transformers بالسرعة الأصلية في vL...
عند تدريب أو تقديم نموذج كبير موزّع على عدة مسرّعات، لا تكون عملية الحساب هي عنق الزجاجة الحقيقي، بل البيانات المتنقلة بين المسرّعات. يشرح هذا المقال ماهية ا...
شارك أحد المطورين نصيحة: حين تُسند إلى Codex هدفًا /goal صعبًا حقًا، اطلب منه أولًا أن يكتب الهدف بحيث يستطيع خيط آخر تحقيقه. يبدو الأمر لعبًا بالكلمات، لكنه...
괴물 한 대를 못 사서, 갖고 있는 잡동사니를 다 엮어버림ㅋ
문서 OCR 파이프라인에 두 크기의 VLM을 얹은 엔지니어를 위한 글입니다. H200에서 실측한 결과, 신뢰도 임계값 하나로 어려운 문서만 대형 모델로 올려보내는 캐스케이드는 대형 모델과 같거나 조금 낮은 오류율을 그 비용의 약 60~67%에 달성했습니다.
GPT-5.6이 더 똑똑하냐가 아니라, 그 토큰을 누가 더 싸고 빠르게 서빙하느냐가 마진을 가릅니다. 모델을 나열하는 지도가 건너뛴 다섯 개의 스택 층 - 추론 실리콘, 서빙, 평가, 라이선스, 하니스 - 을 실제 수치로 지도화합니다.
Unsloth로 모델을 4비트로 줄이는 방법을 아는 팀은 많습니다. 그런데 그 파일을 실제로 EC2에 올릴지, SageMaker 엔드포인트로 감쌀지, EKS 파드로 띄울지 정하는 순간 대부분 막힙니다. AWS가 Unsloth와 함께 낸 배포 가이드는 이 질문에 명확한 지도를 제시합...
누군가 GLM-5.2에서 1403GB를 980GB로 줄였다고 했습니다. 양자화도, 프루닝도 아니고, 비트 단위로 완전히 동일한 무손실 압축이라고요. 처음엔 믿기 어려웠습니다. 그래서 직접 Qwen2.5-0.5B의 가중치 4억 9천만 개를 열어 BF16 지수 필드의 엔트로피를 측정했...
은행연합회는 더 똑똑한 모델이 아니라 도입의 순서를 발주했습니다. 오늘 규제 산업의 움직임을 뜯어보면, AI 도입의 진짜 승부처는 능력이 아니라 통제라는 사실이 드러납니다.
Even in an era where sub-billion-parameter, ultra-lightweight VLMs read documents well, the truly hard documents still need a large model. We introduce an an...
The question isn’t whether GPT-5.6 is smarter. It’s who serves those tokens cheaper and faster, because that’s what decides the margin. We map the five stack...
Plenty of teams know how to shrink a model to 4-bit with Unsloth. But the moment they have to decide whether to put that file on EC2, wrap it in a SageMaker ...
Someone claimed they shrank GLM-5.2 from 1403GB to 980GB. Not quantization, not pruning, but lossless compression that is bit-for-bit identical to the origin...
Couldn’t afford one monster, so we ganged up all the little ones.
The Korea Federation of Banks did not order a smarter model, it ordered a sequence for adoption. Reading today’s moves across regulated industries closely re...
حتى في عصر تقرأ فيه نماذج الرؤية واللغة الخفيفة جدًا، التي تقل معاملاتها عن مليار، المستندات جيدًا، لا تزال المستندات الصعبة حقًا بحاجة إلى نموذج كبير. نقدّم...
السؤال ليس ما إذا كان GPT-5.6 أذكى، بل من يقدّم تلك الرموز بتكلفة أقل وسرعة أعلى، لأن ذلك هو ما يحدد الهامش. نرسم خريطة للطبقات الخمس في المكدس التي تتجاهلها...
كثير من الفرق تعرف كيف تقلّص نموذجا إلى 4 بت باستخدام Unsloth. لكن لحظة اتخاذ القرار بوضع ذلك الملف على EC2، أو تغليفه في نقطة نهاية SageMaker، أو تشغيله كحج...
ادعى أحدهم أنه قلّص GLM-5.2 من 1403 غيغابايت إلى 980 غيغابايت. لا تكميم ولا تشذيب، بل ضغط بلا خسارة مطابق للأصل بت ببت. كان من الصعب تصديق ذلك، لذا فتحنا 490...
لم يطلب اتحاد المصارف الكوري نموذجا أكثر ذكاء، بل طلب ترتيبا لتبني الذكاء الاصطناعي. حين نفحص تحركات القطاعات الخاضعة للتنظيم اليوم عن قرب، يتضح أن نقطة الحس...
프로젝트만 던졌더니 알아서 다 깔아줌 — 근데 취향은 남의 취향이었다ㅋ
완전 자율로 매일 밤 논문을 만들어내는 파이프라인을 최종 결과물이 아니라 실제 운영 로그로 감사한 연구입니다. 8일 중 2026-07-08을 기점으로 언어 순도와 리뷰 통과율이 동시에 개선된 뚜렷한 전후 변화를 발견하고, 이를 6가지 최소 가드레일로 정리합니다.
코딩 에이전트는 오랫동안 텍스트만 읽어 왔습니다. claude-video는 yt-dlp·ffmpeg·Whisper를 얇게 엮어, 유튜브·Zoom·Loom·로컬 파일을 프레임 이미지와 타임스탬프 전사로 바꿔 Claude의 멀티모달 Read 컨텍스트에 넣습니다. GitHub 5,400...
This study audits a fully autonomous pipeline that generates a paper every night, not by inspecting the final output but by examining its actual operational ...
Drop your repo, it installs everything — someone else’s taste and all.
Coding agents have long read only text. claude-video thinly wires yt-dlp, ffmpeg, and Whisper together to turn YouTube, Zoom, Loom, or local files into frame...
تُدقق هذه الدراسة خط أنابيب مستقلاً بالكامل يُنتج بحثاً كل ليلة، ليس عبر فحص المخرجات النهائية بل عبر فحص سجلات تشغيله الفعلية. وعلى مدى ثمانية أيام، تكشف ال...
طالما اقتصرت وكلاء البرمجة على قراءة النص فقط. يربط claude-video بشكل رقيق بين yt-dlp وffmpeg وWhisper ليحوّل فيديوهات YouTube وZoom وLoom أو الملفات المحلية...
62만 개 화면을 다 참고했더니, 세상 앱이 다 한 앱이 됐다ㅋ
회사의 반복 업무를 스킬로 정의하면, 각 스킬이 실제로 어느 모델 티어까지 내려가도 되는지를 감이 아니라 측정으로 답할 수 있습니다. 가장 비싼 모델은 일을 시키는 데가 아니라 강등을 판정하는 데 씁니다. 16개 스킬 함대에서 10개를 중간 티어로 내린 실제 운영 기록입니다.
H200이나 Blackwell급 클러스터에서 MoE를 서빙하는 엔지니어라면, 어떤 전문가를 전정밀도로 지켜야 하는지가 핵심입니다. 실제 OLMoE-1B-7B 측정으로 답은 명확했습니다. 트래픽 많은 핫 전문가를 지키면 됩니다.
Claude Code와 Codex 같은 코딩 에이전트는 Anthropic API에 묶여 있습니다. free-claude-code는 그 사이에 Anthropic 호환 프록시를 끼워, 같은 에이전트 UI를 그대로 쓰면서 요청을 Ollama, llama.cpp, vLLM 같은 자체 호스...
vLLM v0.25.0이 232명의 기여자가 보낸 558개의 커밋과 함께 나왔습니다. 이번 릴리스의 핵심은 두 가지입니다. 첫째, Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 되었습니다. 둘째, vLLM을 처음 유명하게 만든 PagedAttention의 레거시...
값이 내려가면 덜 쓸까요. 추론 시장에서는 정반대의 일이 벌어지고 있습니다. 토큰 반값 경쟁과 삼바노바 5배 몸값이라는 모순을 제번스 역설로 읽고, 기업의 진짜 병목이 어디로 옮겨가는지 짚어봅니다.
에이전트 스킬을 프런티어 API로만 돌리면 호출 수천 번에 비용이 폭증합니다. 2026년 상반기 연구는 이 스킬을 1B~35B급 소형 모델에 증류해 로컬에서 자동 실행하는 길을 실전 단계로 끌어올렸습니다. 온폴리시 스킬 증류, 다교사 증류, 학습 없는 에이전트 증류 같은 최근 기법...
한 사람이 한 에이전트를 쓰던 구조에서, 여러 사람과 여러 에이전트가 같은 작업 공간에서 서로 대화하는 구조로 넘어가고 있습니다. 멀티플레이어 Claude Code를 계기로 협업 에이전트의 동시성·충돌·신뢰 경계 문제를 짚고 ThakiCloud 운영 관점에서 검증합니다.
When a company’s recurring work is defined as skills, each skill can tell you, through measurement rather than intuition, exactly how far down the model tier...
For engineers serving MoE models on H200 or Blackwell-class clusters, we introduce a paper that formalizes RASQ, an NVFP4 quantization policy that selectivel...
Coding agents like Claude Code and Codex are tied to the Anthropic API. free-claude-code sits an Anthropic-compatible proxy in between, letting teams keep th...
vLLM v0.25.0 landed with 558 commits from 232 contributors. Two changes define this release: Model Runner V2 is now the default execution path for every dens...
Browse 621,500 screens and somehow ship the exact same app as everyone else.
When prices fall, do we use less? In the inference market, the opposite is happening. We read the paradox of the token price war and SambaNova’s fivefold val...
Running agent skills exclusively on frontier APIs makes costs explode once you hit thousands of calls. Research from the first half of 2026 has pushed distil...
We are moving from a world where one person uses one agent to one where multiple people and multiple agents share a workspace and talk to each other. Using m...
عندما تُعرّف مهام الشركة المتكررة كمهارات، يمكن الإجابة عن السؤال الذي يحدد إلى أي مستوى نموذج يمكن أن تنحدر كل مهارة فعليا بالقياس لا بالحدس. النموذج الأكثر...
لمهندسي الخدمة الذين يشغّلون نماذج MoE على عناقيد من فئة H200 أو Blackwell، نقدّم ورقة بحثية تُصيغ RASQ، وهي سياسة تكميم NVFP4 تحمي بشكل انتقائي الموجّه والخ...
وكلاء البرمجة مثل Claude Code وCodex مرتبطون بشكل وثيق بواجهة برمجة تطبيقات Anthropic. يضع free-claude-code وسيطاً متوافقاً مع Anthropic بين الطرفين، فتحتفظ ...
صدر vLLM v0.25.0 بـ 558 التزامًا (commit) من 232 مساهمًا. يتمحور هذا الإصدار حول تغييرين رئيسيين: أولًا، أصبح Model Runner V2 هو مسار التنفيذ الافتراضي لجميع...
عندما تنخفض الأسعار، هل نستهلك أقل؟ في سوق الاستدلال (inference) يحدث العكس تماما. نقرأ التناقض بين حرب أسعار التوكنات المخفضة إلى النصف وقفزة تقييم سامبانوف...
إذا شُغّلت مهارات الوكلاء عبر واجهة نموذج حدودي فقط، تتضخم التكلفة مع آلاف الاستدعاءات. رفعت أبحاث النصف الأول من عام 2026 مسار تقطير هذه المهارات في نماذج ص...
ننتقل من بنية يستخدم فيها كل شخص عاملاً واحداً، إلى بنية يتحدث فيها عدة أشخاص وعدة عوامل مع بعضهم البعض في مساحة العمل نفسها. انطلاقاً من Claude Code متعدد ا...
약점 콕 집어 고치면 이긴대. 근데 파시스 약점은 ‘그만 풀기’였음ㅋ
모든 fan-out은 적대적 검증으로 닫아야 한다는 원칙은 널리 퍼져 있지만, 검증자 등급과 스켑틱 수를 얼마나 써야 하는지는 실측 없이 관행으로 정해져 왔습니다. 12개 findings와 180회 실제 API 호출로 이 가정을 검증한 결과를 소개합니다.
긴 호흡의 에이전트 작업을 RL로 학습할 때 GRPO의 그룹 샘플링은 가장 느린 롤아웃을 기다리느라 GPU를 놀립니다. 칭화대와 Z AI가 GLM-5.2 학습에 실제로 투입한 SAO는 그룹을 통째로 버리고 롤아웃 하나로 학습하며, 대신 양방향 토큰 클리핑으로 안정성을 지킵니다.
장기 실행 에이전트는 제한된 메모리 안에서 움직이지만, 지금까지의 메모리 기법은 관련성이나 요약 품질 같은 묘사적 기준으로 과거를 조직했습니다. Meta AI 연구자가 참여한 이 논문은 그 기준 자체가 틀렸다고 말합니다. 메모리의 가치는 과거를 충실히 묘사하는 데 있지 않고, 서로...
허깅페이스에서 GGUF 파일을 받아 실행 버튼만 누르는 사람과, 그 파일 안에 어떤 텐서가 몇 비트로 들어 있는지 아는 사람 사이에는 큰 차이가 있습니다. Qwen2.5-0.5B의 Q4_K_M 파일을 실제로 다운로드해 텐서 단위로 열어 보니, 이름과 달리 4비트 Q4_K는 전체의 ...
Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다. serve-sim은 시뮬레이터의 프레임버퍼를 브라우저로 스트리밍하고 WebSocket으로 제어까지 열어, AI 코딩 에이전트가 헤드리스 환경에서 iOS 앱을 빌드하고 실제로 조작하며 테스트하게 합...
OpenAI Codex 팀 엔지니어 jxnl이 공개한 personal-monorepo-template은 벡터DB 없이 폴더 구조와 AGENTS.md만으로 에이전트에 영구 기억을 부여합니다. 이 설계를 분해하고 스킬을 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
Claude Fable 5가 스펙 작성과 diff 리뷰를 지휘하고, 실제 코드 타이핑은 Grok 4.5가 전담하는 fable-advisor 플러그인의 지휘자-워커 분리 구조를 분해하고, 멀티에이전트를 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
The principle that every fan-out should close with adversarial verification is widely accepted, but how much verifier tier and how many skeptics to use has m...
When training long-horizon agentic tasks with RL, GRPO’s group sampling idles the GPU while it waits for the slowest rollout to finish. SAO, the method Tsing...
Long-running agents operate within limited memory, yet memory methods to date have organized the past using descriptive criteria such as relevance or summary...
There is a real gap between someone who downloads a GGUF file from Hugging Face and just clicks run, and someone who knows exactly which tensors are stored a...
Put a Mac Mini in the cloud and you lose the GUI, which means you lose the iOS Simulator too. serve-sim streams the simulator’s framebuffer to a browser and ...
Fix the one skill you lack and you win. Paxis’s missing skill? Knowing when to stop.
OpenAI Codex engineer jxnl has released personal-monorepo-template, which gives agents persistent memory through folder structure and an AGENTS.md file, no v...
We break down the conductor-worker split of the fable-advisor plugin, in which Claude Fable 5 conducts spec writing and diff review while Grok 4.5 handles th...
مبدأ إغلاق كل عملية fan-out بتحقق عدائي أصبح شائعاً على نطاق واسع، لكن مستوى نموذج التحقق وعدد المدققين المشككين المطلوبين لم يُحدد عبر القياس الفعلي بل بالع...
عند تدريب مهام الوكلاء الطويلة عبر التعلّم المعزز، يُبقي أخذ العينات الجماعي في GRPO وحدات GPU عاطلة في انتظار أبطأ rollout. استخدمت جامعة تسينغهوا وZ AI طري...
تعمل الوكلاء طويلة المدى ضمن ذاكرة محدودة، لكن أساليب الذاكرة حتى الآن كانت تنظّم الماضي وفق معايير وصفية مثل الصلة أو جودة التلخيص. هذه الورقة، التي شارك في...
هناك فرق حقيقي بين من يحمل ملف GGUF من Hugging Face ويضغط زر التشغيل فقط، ومن يعرف بالضبط أي المصفوفات (tensors) مخزنة وبكم بت داخل ذلك الملف. قمنا فعليا بتح...
عند وضع Mac Mini في السحابة، ينعدم وجود واجهة رسومية تتيح رؤية محاكي iOS. يبث serve-sim الإطارات المرئية للمحاكي إلى المتصفح، ويفتح أيضاً قناة تحكم عبر WebSo...
يمنح personal-monorepo-template الذي كشف عنه مهندس فريق OpenAI Codex، jxnl، العامل البرمجي ذاكرة دائمة عبر بنية مجلدات وملف AGENTS.md فقط، دون قاعدة بيانات م...
نحلل بنية الفصل بين الموجّه والعامل في إضافة fable-advisor، حيث يقود Claude Fable 5 كتابة المواصفات ومراجعة الفروقات (diff)، بينما يتولى Grok 4.5 وحده كتابة ...
1년째 ‘언젠가’ 리스트에 박아둔 에이전트, 열어보니 커피 식기 전에 끝남ㅋ
예일과 시카고대 연구진이 11,683편의 실제 논문으로 인간과 LLM의 연구 아이디어를 비교했습니다. 결론은 뜻밖입니다. LLM 아이디어의 문제는 품질이 아니라 폭입니다. 인간보다 훨씬 좁은 영역, 특히 ‘기존 연구 연결’에 4~5배 쏠려 있었습니다.
ARC-AGI-3는 설명서 없는 대화형 게임에서 에이전트가 스스로 상황을 파악하고 적응하는지를 측정합니다. GPT-5.6 Sol은 이 벤치마크를 7.78%로 처음 돌파했는데, 그 원동력은 더 나은 실행이 아니라 낯선 환경에서 먼저 방향을 잡는 정향 능력이었습니다.
요즘 RL 포스트트레이닝의 대세는 critic을 버리는 GRPO 계열입니다. 그런데 GLM-5.2는 value model을 되살린 PPO로 돌아가고, IcePop으로 학습-추론 불일치를 잡았습니다. 이 선택의 근거와 ThakiCloud 훈련 인프라 관점의 시사점을 정리합니다.
대규모 스킬 생태계를 운영하는 에이전트 하네스에서 라우팅 실패의 진짜 원인이 분해가 아니라 검색기라는 진단이 나온 뒤, 그 고치는 손을 사람에서 무인 루프로 옮기면 실제로 병목이 좁혀지는지를 실측한 연구입니다.
SpaceXAI가 Grok 4.5를 공개했습니다. 코딩과 에이전트를 위해 처음부터 훈련됐고, Opus급 성능을 백만 토큰당 입력 2달러·출력 6달러에 제공합니다. 값싼 에이전트 지능이 만드는 계산의 변화를 ThakiCloud 관점에서 짚습니다.
HBM4가 서버 랙 한 대 값을 2100만 달러로 밀어올리고, SK하이닉스는 하루 만에 40조를 조달했습니다. 자본과 전력이 진짜 병목이 된 지금, 승부는 비싼 컴퓨트에서 증명 가능한 일을 뽑아내는 소프트웨어 층으로 내려가고 있습니다.
같은 날 발표된 두 개의 숫자가 정반대로 움직였습니다. 2100만 달러짜리 AI 랙과 34배 싸진 추론 요금입니다. 이 벌어지는 가위의 한가운데에서 기업이 쥐어야 할 손잡이를 짚어봅니다.
마이크로소프트는 엑셀과 아웃룩의 대량 AI 요청을 자사 모델로 돌리기 시작했고, 중국 오픈 모델은 미국 기업 AI 사용량의 절반 가까이를 잠식했으며, 시장에서는 1조 달러가 넘는 시가총액이 하루아침에 사라졌습니다. 프리미엄 프론티어 모델을 영원히 결제한다는 가정이 무너지는 중입니다...
자연어 요청 한 번으로 프리미엄 랜딩페이지를 만든다는 Claude Code 스킬이 실제로 어떤 구조로 동작하는지 분해하고, 스킬을 일급 리소스로 다루는 ThakiCloud Paxis 관점에서 검증합니다.
Researchers at Yale and the University of Chicago compared human and LLM research ideas using 11,683 real papers. The conclusion is surprising. The problem w...
ARC-AGI-3 measures whether an agent can figure out a situation and adapt on its own inside an interactive game with no instructions. GPT-5.6 Sol became the f...
The dominant trend in RL post-training these days is the GRPO family, which drops the critic. GLM-5.2, however, went back to PPO with a revived value model a...
After a prior diagnosis found that the real cause of routing failures in a large skill ecosystem was the retriever rather than decomposition, this study meas...
SpaceXAI has unveiled Grok 4.5. Trained from the ground up for coding and agents, it delivers Opus-class performance at $2 per million input tokens and $6 pe...
HBM4 has pushed the price of a single server rack to 21 million dollars, and SK hynix raised 40 trillion won in a single day. Now that capital and power have...
Two numbers released on the same day moved in opposite directions: a 21 million dollar AI rack and inference pricing that got 34 times cheaper. Here is a loo...
Microsoft has started routing bulk AI requests from Excel and Outlook to its own models, Chinese open models now handle nearly half of some US enterprise AI ...
The agent you shelved for ‘someday’ takes less time than your coffee to cool.
A Claude Code skill that turns one plain request into a premium landing page. We take apart how it actually works and validate it from ThakiCloud’s Paxis vie...
قارن باحثون من Yale وجامعة Chicago بين أفكار البحث البشرية وأفكار LLM باستخدام 11,683 ورقة بحثية حقيقية. الخلاصة مفاجئة. مشكلة أفكار LLM ليست في الجودة، بل ف...
يقيس ARC-AGI-3 قدرة العميل الذكي على فهم الموقف والتكيّف بنفسه داخل لعبة تفاعلية بلا تعليمات. حقق GPT-5.6 Sol أول اختراق لهذا المقياس بنسبة 7.78%، وكان الداف...
التيار السائد اليوم في التدريب اللاحق بالتعلم المعزز هو عائلة GRPO التي تتخلى عن الـ critic. لكن GLM-5.2 عاد إلى PPO بإحياء نموذج القيمة، وعالج عدم التطابق ب...
بعد أن توصل تشخيص سابق إلى أن السبب الحقيقي لفشل التوجيه في نظام مهارات كبير هو محرك الاسترجاع وليس التفكيك، تقيس هذه الدراسة تجريبياً ما إذا كان نقل يد الإص...
كشفت SpaceXAI عن Grok 4.5. تم تدريبه من الأساس للبرمجة والوكلاء، ويقدم أداءً بمستوى Opus مقابل 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. نس...
دفعت شريحة HBM4 سعر رف خادم واحد إلى 21 مليون دولار، وجمعت SK hynix ما يعادل 40 تريليون وون في يوم واحد. الآن وقد أصبح رأس المال والطاقة هما الاختناق الحقيقي...
رقمان صدرا في اليوم نفسه تحركا في اتجاهين متضادين تماما: رف ذكاء اصطناعي بـ21 مليون دولار، ورسوم استدلال أرخص بـ34 ضعفا. إليك المقابض التي يجب أن تمسك بها ال...
بدأت مايكروسوفت بتوجيه طلبات الذكاء الاصطناعي الجماعية من Excel وOutlook إلى نماذجها الخاصة، وأصبحت النماذج الصينية المفتوحة تعالج ما يقارب نصف استخدام الذكا...
مهارة Claude Code تحوّل طلبًا بسيطًا إلى صفحة هبوط احترافية. نفكّك آلية عملها الحقيقية ونتحقق منها من منظور Paxis حيث تُعامَل المهارات كموارد من الدرجة الأولى.
기억이 ‘행동’이 됐다는데, 안 잊는 건 왜 요금뿐이냐ㅋ
뇌가 다 같으면, 비싼 뇌를 굳이 빌릴 이유가요?
수백 개 스킬을 라우팅하는 하네스에서 다음 투자를 분해에 할지 리트리버에 할지 두 숫자로 판별하는 진단법을 소개합니다. 실측 결과 병목은 둘 다 아니라 코퍼스 중복이었습니다.
장기 기억과 단기 기억을 서로 다른 휴리스틱으로 다루던 관행을 깨고, 저장·검색·요약·삭제를 에이전트의 행동 공간으로 통합한 AgeMem 논문을 분석하고 ThakiCloud 에이전트 플랫폼 관점에서 시사점을 정리합니다.
SpaceXAI가 공개한 Grok 4.5는 Opus 4.8과 GPT-5.5에 근접한 성능을 절반 이하 가격에 내놓았습니다. 벤치마크 몇 점 차이보다 태스크당 비용과 토큰 효율이 실무 선택을 좌우하는 국면이 왔습니다. 실제 공개 수치로 그 경제학을 뜯어보고, ThakiCloud의 모...
Anthropic의 Claude Fable 5가 프런트엔드 생성에서 새로운 기준을 세우고 있습니다. 스크롤로 제어되는 3D 씬, GLSL 셰이더, 스크린샷 기반 리디자인을 단일 프롬프트에서 뽑아내는 워크플로를 실제 공개 가이드와 오픈소스 갤러리를 근거로 정리하고, 코딩 에이전트를 ...
AI가 감각을 넓히고 손을 얻는 뉴스가 쏟아진 하루입니다. 그런데 도입을 실제로 가르는 질문은 성능이 아니라 ‘증거’로 옮겨가고 있습니다. 오늘 다이제스트를 그 렌즈로 다시 읽어봤습니다.
Claude Code를 사람이 매번 붙어 있지 않아도 돌아가게 만드는 네 가지 메커니즘을 정리하고, ThakiCloud가 실제 운용 중인 헤드리스 파이프라인·훅·서브에이전트·스킬 사례로 검증합니다.
11억 파라미터가 70억을 이기고 최고 모델이 공짜로 풀리는 날, 정작 기업을 멈칫하게 만든 뉴스는 지능이 아니라 ‘행동 기록’이었습니다. 오늘 시장이 갈라선 두 방향을 읽습니다.
For a harness that routes hundreds of skills, this diagnostic tells you with two numbers whether your next investment should go into decomposition or the ret...
AgeMem folds long-term and short-term memory management into the agent’s policy, exposing store, retrieve, summarize, and discard as tool-based actions. We a...
SpaceXAI’s newly released Grok 4.5 comes close to Opus 4.8 and GPT-5.5 in performance, at less than half the price. When benchmark gaps shrink to a point or ...
Anthropic’s Claude Fable 5 is setting a new bar for frontend generation. We look at real public guides and open-source galleries showing scroll-driven 3D sce...
Memory became an action space. Pity the only thing it never forgets is the invoice.
If every brain converges, why rent the pricey one?
A day full of news about AI expanding its senses and gaining hands. But the question that actually decides adoption is shifting from performance to ‘evidence...
Four mechanisms make Claude Code run without a human watching every step: headless mode, hooks, subagents, and skills. We verify each against ThakiCloud’s re...
On a day when a 1.1 billion parameter model beat a 7 billion parameter one and the best models got given away for free, the news that actually made enterpris...
لنظام يوجّه مئات المهارات، يخبرنا هذا التشخيص برقمين اثنين إن كان الاستثمار القادم يجب أن يذهب إلى التفكيك أم إلى المسترجِع. تبيّن أن الإجابة المقيسة لم تكن ...
يدمج AgeMem إدارة الذاكرة طويلة وقصيرة المدى داخل سياسة الوكيل، ويكشف عمليات التخزين والاسترجاع والتلخيص والحذف كأفعال قائمة على الأدوات. نحلّل المنهجية وتدر...
قدّمت SpaceXAI نموذج Grok 4.5 بأداء قريب جداً من Opus 4.8 وGPT-5.5، لكن بسعر أقل من النصف. حين تضيق الفجوة بين النماذج إلى نقطة أو نقطتين في الاختبارات المعي...
يضع Claude Fable 5 من Anthropic معيارًا جديدًا في توليد واجهات الويب الأمامية. نستعرض هنا، استنادًا إلى دليل عملي منشور ومعرض مفتوح المصدر حقيقيين، سير عمل ي...
يوم مليء بأخبار توسّع حواس الذكاء الاصطناعي واكتسابه لأيدٍ فعلية. لكن السؤال الذي يحدد التبني الفعلي ينتقل من الأداء إلى الدليل. أعدنا قراءة نشرة اليوم من هذ...
أربع آليات تجعل Claude Code يعمل دون مراقبة بشرية لكل خطوة: الوضع الرأسي (headless) والخطّافات (hooks) والوكلاء الفرعيون والمهارات. نتحقّق من كلٍّ منها مقابل...
في يوم تفوق فيه نموذج بـ1.1 مليار معامل على نظير له بـ7 مليارات، وأُتيحت فيه أفضل النماذج مجانا، لم يكن الخبر الذي أوقف الشركات فعلا عن الذكاء، بل عن سجل الس...
남 칩 찍어주다 몇 년 만에 흑자. 빌린 흑자는 남의 통장에 찍힌다.
서로 다른 데이터로, 서로 다른 목적으로 학습한 비전 모델과 언어 모델이 시간이 갈수록 데이터를 같은 방식으로 표현하기 시작합니다. MIT의 플라토닉 표현 가설(Platonic Representation Hypothesis)은 이 수렴이 우연이 아니라 규모와 능력이 커질수록 나타나...
온프렘 AI 플랫폼을 쓰는 병원이나 은행, 정부기관은 데이터가 엔클레이브 밖으로 새지 않았다는 것과 서빙된 모델 가중치가 감사받은 그 파일이 맞다는 것, 이 두 가지를 규제기관에게 증명해야 합니다. GPU 기밀 컴퓨팅의 원격 증명과 모델 프로버넌스는 지금까지 따로 발전해 온 두 기...
Anthropic이 2026년 7월 7일 ‘Getting started with loops’라는 첫 공식 루프 엔지니어링 문서를 공개했습니다. 매 단계를 사람이 프롬프트로 지시하는 방식에서, 에이전트를 대신 프롬프트해 주는 시스템을 설계하는 방식으로 넘어가는 전환입니다. 수동 루프...
Vision models and language models trained on different data for different objectives are starting to represent data in the same way. MIT’s Platonic Represent...
Hospitals, banks, and government agencies running on-premises AI platforms must prove two things to regulators: that data never leaked outside the enclave, a...
On July 7, 2026, Anthropic published its first official loop engineering document, ‘Getting started with loops.’ It marks the shift from a human prompting ev...
Years of making other people’s chips, finally in the black. Rented upside prints on someone else’s ledger.
نماذج الرؤية ونماذج اللغة المدرَّبة على بيانات مختلفة ولأهداف مختلفة بدأت تمثّل البيانات بالطريقة نفسها. تجادل فرضية التمثيل الأفلاطوني (Platonic Representat...
يجب على المستشفيات والبنوك والجهات الحكومية التي تشغّل منصات ذكاء اصطناعي محلية (on premises) أن تثبت للجهات التنظيمية أمرين: أن البيانات لم تتسرب خارج الحاو...
في السابع من يوليو 2026 نشرت Anthropic أول وثيقة رسمية عن هندسة الحلقات بعنوان ‘Getting started with loops’. إنها تحوّل من أن يوجّه الإنسان كل خطوة بأمر، إلى...
LLM을 채점자로 쓰는 ‘LLM-as-a-judge’는 이제 모델 개발의 기본값이지만, 2026년 들어 쌓인 증거는 단일 점수를 내는 스칼라 심판이 프롬프트와 위치에 취약하고 중간값으로 쏠리며 적대적 입력 앞에서 동전 던지기 수준으로 무너진다는 사실을 보여줍니다. 병원이나 은행, ...
모노레포에서 라이브러리 디렉터리와 소비 서비스 디렉터리를 오갈 때, 세션을 재시작하면 대화 맥락도 프롬프트 캐시도 함께 날아갑니다. Claude Code v2.1.169에 들어온 /cd 명령은 실행 중인 세션을 다른 디렉터리로 옮기면서 캐시를 그대로 유지합니다. 캐시 읽기(0.1배...
Using an LLM as a grader, the practice known as LLM-as-a-judge, is now the default in model development, but the evidence that piled up through 2026 shows th...
In a monorepo, switching between a library directory and the service that consumes it used to mean restarting your session, and with it, both your conversati...
أصبح استخدام نموذج لغوي كبير كمقيّم، وهو ما يعرف بـ LLM-as-a-judge، الممارسة الافتراضية في تطوير النماذج، لكن الأدلة التي تراكمت خلال عام 2026 تظهر أن الحكم ...
في المستودعات أحادية الجذر (monorepo)، عندما تتنقل بين مجلد مكتبة ومجلد خدمة تستهلكها، تؤدي إعادة تشغيل الجلسة إلى فقدان سياق المحادثة وإبطال ذاكرة التخزين ا...
대부분의 개발자는 세팅을 건너뛰고 바로 프롬프트를 칩니다. 그게 실수입니다. CLAUDE.md·rules·commands·skills·agents·hooks로 이어지는 .claude/ 폴더의 구조를, 스킬 1,671개가 도는 실제 프로덕션 프로젝트를 직접 측정해 뜯어봅니다. Tha...
dair.ai 주간 논문 정리에서 ThakiCloud 관점으로 세 편을 깊게 읽습니다. 메타인지 피드백으로 표준 RL을 최대 63% 넘어선 RLMF, 메모리를 학습 가능한 스킬로 다뤄 Qwen2.5-32B를 Opus 4.5급으로 끌어올린 AutoMem, LLM 통합 애플리케이션의 ...
AI control의 핵심 방어선인 ‘신뢰 못 하는 강한 모델을 약한 감시 모델로 통제한다’는 전제는 감시자와 정책 모델이 같은 텍스트를 읽는다는 가정 위에 서 있습니다. 온프렘 멀티테넌트 클러스터에서는 이 가정이 조용히 무너집니다. 서로 다른 토크나이저와 정규화 규칙이 감시자는 ...
구글 딥마인드가 공개한 약 57페이지 보고서 From AGI to ASI는 초지능을 먼 사고실험이 아니라 지금 준비해야 할 계획 문제로 다룹니다. 스케일링, 알고리즘 전환, 재귀적 자기개선, 다중 에이전트 집단 형성이라는 네 갈래 경로와 그 각각을 가로막는 물리적 한계를 짚습니다....
오픈 언어 모델의 다운로드와 추론 사용량을 한자리에서 측정한 ATOM 리포트는, 중국 오픈 모델이 2025년 여름 미국 진영을 추월한 뒤 격차를 벌려 왔다는 사실을 데이터로 보여 줍니다. Qwen 계열은 허깅페이스 누적 다운로드 약 10억 건을 넘겼고, OpenRouter 추론 시...
Most developers skip the setup and jump straight into prompting. That’s a mistake. We dissect the structure of the .claude/ folder, from CLAUDE.md to rules, ...
From dair.ai’s weekly paper roundup, we take a deep dive into three papers through a ThakiCloud lens: RLMF, which beats standard RL by up to 63% using metaco...
The core defense of AI control, the idea that an untrusted strong model can be controlled by a weaker, trusted monitor, rests on the assumption that the moni...
Google DeepMind’s roughly 57-page report From AGI to ASI treats superintelligence not as a distant thought experiment but as a planning problem to prepare fo...
The ATOM Report measures open language models across both downloads and inference usage in one place, and shows with data that Chinese open models overtook t...
معظم المطورين يتخطون الإعداد وينتقلون مباشرة إلى كتابة الأوامر النصية (prompts). هذا خطأ. نشرّح هنا بنية مجلد .claude/ الممتدة من CLAUDE.md إلى rules وcomman...
من نشرة dair.ai الأسبوعية لأوراق الذكاء الاصطناعي، نتعمق في قراءة ثلاث أوراق بحثية من منظور ThakiCloud. RLMF الذي يتفوق على التعلم المعزز القياسي بنسبة تصل إ...
يقوم خط الدفاع الأساسي في ضبط الذكاء الاصطناعي (AI control)، القائل بأن النموذج القوي غير الموثوق يمكن ضبطه عبر نموذج إشراف أضعف موثوق به، على افتراض أن نموذ...
يتعامل تقرير Google DeepMind المكوّن من نحو 57 صفحة From AGI to ASI مع الذكاء الفائق لا كتجربة فكرية بعيدة بل كمشكلة تخطيط ينبغي الاستعداد لها الآن. يرسم أرب...
يقيس تقرير ATOM النماذج اللغوية المفتوحة عبر التنزيلات واستخدام الاستدلال في مكان واحد، ويُظهر بالبيانات أن النماذج المفتوحة الصينية تجاوزت المعسكر الأمريكي ...
몸에 좋은 조합만 골라 담았는데, 냉장고 열쇠는 왜 쟤가 쥐고 있냐.
거대 LLM과 에이전트 스킬이 좋아질수록 파인튜닝은 필요 없어진다는 체감이 업계에 퍼지고 있습니다. 실제로 OpenAI는 셀프서브 파인튜닝 API를 접는 중입니다. 그런데 같은 한 달 동안 정반대 방향의 신호도 쏟아졌습니다. 19일간의 프론티어 모델 셧다운, 파인튜닝을 전제로 설계...
284B DeepSeek V4 Flash가 35B Qwen3.6보다 output 토큰이 5배 저렴한 역설을 roofline 모델로 해부합니다. KV 캐시 읽기, MoE 배치 경제학, 8xH100 서빙 형태 계산까지 추론 원가의 실제 구조를 숫자로 설명합니다.
GLM-5.2 743B MoE를 AMD MI355X 한 노드에서 2,626 tok/s/node로 서빙하고 Blackwell 대비 2배 이상 저렴하게 만든 사례를, MXFP4 양자화와 SGLang MoE 병렬화 관점에서 검증하고 ThakiCloud ai-platform의 멀티벤더 서...
작동하는 기계와 이해한 원리 사이의 간극은 과학사에서 늘 반복된 장면입니다. 컴퓨팅 파워로 모든 것을 밀어붙이는 지금, 에너지와 파동의 눈으로 딥러닝 시대를 다시 읽고 과학자가 가져야 할 겸손을 이야기합니다.
As frontier LLMs and agent skills keep improving, the industry has started to feel that fine-tuning is no longer necessary. OpenAI is, in fact, winding down ...
We dissect, with a roofline model, the paradox that the 284B DeepSeek V4 Flash prices its output tokens 5x cheaper than the 35B Qwen3.6. From KV cache reads ...
We examine a case of serving the GLM-5.2 743B MoE model on a single AMD MI355X node at 2,626 tok/s per node, at more than twice the cost efficiency of Blackw...
The gap between a machine that works and a principle we understand is one of the oldest scenes in the history of science. In an era that solves everything wi...
A perfectly healthy combo — pity someone else holds the fridge key.
كلما تحسّنت النماذج اللغوية الكبيرة ومهارات الوكلاء، ينتشر في الصناعة شعور بأن fine-tuning (الضبط الدقيق) لم يعد ضروريا. بل إن OpenAI بصدد إيقاف واجهة برمجة ...
نحلل، باستخدام نموذج roofline، المفارقة التي تجعل DeepSeek V4 Flash بحجم 284B مليار معلمة يسعّر رموز الإخراج بأرخص بخمسة أضعاف من Qwen3.6 بحجم 35B. من قراءات...
نتحقق من حالة خدمة GLM-5.2 743B MoE على عقدة واحدة من AMD MI355X بمعدل 2,626 tok/s لكل عقدة، بتكلفة أقل بأكثر من الضعف مقارنة بـ Blackwell، من زاوية تكميم MX...
الفجوة بين آلة تعمل ومبدأ نفهمه من أقدم المشاهد في تاريخ العلم. في عصر يحل كل شيء بالقوة الحاسوبية، تعيد هذه المقالة قراءة عصر التعلم العميق بعدسة الطاقة وال...
로켓 CEO의 창업 특강, 마지막 원칙이 곧 온프렘이었다.
Anthropic이 최신 모델용 프롬프팅 베스트 프랙티스를 정리한 공식 가이드를 뜯어봅니다. 모델별 차이, 핵심 기법(명료성·예시·XML·사고연쇄·역할·체이닝·확장 사고), 마이그레이션까지. ThakiCloud가 Paxis 스킬 하니스에서 프롬프트를 계약으로 굳히는 방식과 연결합니다.
tom_doerr가 공유한 최대 384GB VRAM Personal AI Computer 빌드 가이드를 출발점으로, VRAM이 어떻게 실행 가능한 모델을 결정하는지 계산으로 따져보고, 이 개인용 한 대를 조직 규모의 온프렘 서빙으로 올릴 때 무엇이 필요한지 ThakiCloud ai...
T3 창시자 Theo가 공유한 Claude Fable 5 운용 팁을 뜯어봅니다. effort 레벨 선택, Codex 오케스트레이션, CLAUDE.md 모델 우선순위, 토큰 무거운 작업 위임까지. ThakiCloud가 Paxis와 ai-platform에서 쓰는 모델 라우팅 규율과 나...
We work through Anthropic’s official guide to prompting best practices for the latest models. Model differences, the core techniques (clarity, examples, XML,...
Starting from the Personal AI Computer build guides shared by tom_doerr, which reach up to 384GB of VRAM, we work out through calculation how VRAM decides wh...
We unpack the Claude Fable 5 workflow tips shared by T3 creator Theo: effort levels, Codex orchestration, model priority in CLAUDE.md, and offloading token-h...
A rocket-CEO’s startup lecture, and the last rule was on-prem all along.
نستعرض دليل Anthropic الرسمي لأفضل ممارسات الموجّهات للنماذج الأحدث. فروق النماذج، والتقنيات الأساسية (الوضوح، الأمثلة، XML، سلسلة التفكير، الأدوار، التسلسل،...
انطلاقًا من أدلة بناء حاسوب الذكاء الاصطناعي الشخصي التي شاركها tom_doerr والتي تصل إلى 384GB من ذاكرة VRAM، نحسب كيف تحدد ذاكرة VRAM النماذج التي يمكن تشغيل...
نحلّل نصائح سير العمل مع Claude Fable 5 التي شاركها Theo مبتكر T3: مستويات الجهد، وتنسيق Codex، وأولوية النماذج في CLAUDE.md، وإسناد المهام كثيفة الرموز. ونض...
Claude Code의 아티팩트 기능이 Team·Enterprise를 넘어 Pro·Max 요금제까지 확대됐습니다. 세션의 작업을 실시간으로 갱신되는 공유 가능한 웹페이지로 바꾸는 이 기능을 뜯어보고, ThakiCloud의 Paxis와 ai-platform 관점에서 어떻게 쓸 수 있...
대부분의 에이전트 업무는 프론티어 모델이 필요 없습니다. 스킬을 비싼 모델로 한 번 완성한 뒤 포맷을 코드로 내리면, 같은 품질을 싼 모델로 돌릴 수 있습니다. 팩시스는 이 판단을 매일 밤 자동으로 측정하고, 안전할 때만 모델을 내리며, 품질이 흔들리면 되돌립니다. 실제 측정치와 ...
NVIDIA B200 두 장에서 Qwen3.6-27B-NVFP4와 gemma-4-26B-A4B를 대상으로 텐서병렬, 데이터병렬, Prefill/Decode 분리(1P1D)의 초당 생성 토큰을 실제로 측정했습니다. 두 장뿐일 때 총 처리량의 승자는 분리가 아니라 데이터병렬이었고, 이...
Claude Code artifacts have expanded beyond Team and Enterprise to the Pro and Max plans. We break down the feature that turns a coding session into a live, s...
Most agent work doesn’t need a frontier model. Build a skill once with an expensive model, push its format down into code, and you can run the same quality o...
We measured actual tokens-per-second across tensor parallelism, data parallelism, and Prefill/Decode disaggregation (1P1D) for Qwen3.6-27B-NVFP4 and gemma-4-...
توسّعت ميزة Artifacts في Claude Code لتتجاوز خطتي Team وEnterprise إلى خطتي Pro وMax. نحلّل الميزة التي تحوّل جلسة برمجية إلى صفحة ويب حية قابلة للمشاركة، ون...
معظم مهام الوكلاء لا تحتاج إلى نموذج طليعي. حين تُبنى المهارة مرة واحدة بنموذج مكلف ثم يُنقل التنسيق إلى الكود، يمكن تشغيل الجودة نفسها بنموذج أرخص. يقيس Pax...
قسنا فعلياً عدد الرموز المُولّدة في الثانية عبر التوازي على مستوى المُوتِّرات، والتوازي على مستوى البيانات، وفصل Prefill/Decode (1P1D) لنموذجَي Qwen3.6-27B-N...
87% 싸진 건 축하할 일인데, 주인만 바꾼 건 아니고요?
Claude Code 2.1.198에 추가된 /dataviz 스킬은 차트와 대시보드 설계 지침을 컨텍스트에 직접 로드합니다. 폼 휴리스틱, 색 공식, 실행 가능한 팔레트 검증기를 뜯어보고 ThakiCloud 플랫폼 관점에서 어떻게 활용할지 정리합니다.
NVIDIA가 Qwen3.6-27B를 NVFP4로 재양자화해 단일 Blackwell GPU에서 vLLM으로 바로 서빙할 수 있게 했습니다. MLP는 NVFP4로 내리고 어텐션과 KV 캐시는 FP8로 남기는 혼합 정밀도가 어떻게 22GB 안에 27B 모델을 담는지, 그리고 이 방식이...
앤트로픽이 공개한 Claude Fable 5 프롬프트 가이드를 뜯어봅니다. 이전 모델용 지시를 덜어내고, 진행을 도구 결과로 감사하고, 서브에이전트를 적극 쓰고, 지난 실행에서 배우고, 제약을 명시하라는 다섯 원칙을 ThakiCloud 에이전트 운영 관점에서 정리합니다.
LLM을 운영하면서도 KV 캐시가 왜 메모리를 잡아먹는지, GQA가 무엇을 절약하는지 설명하지 못한다면 최적화는 감에 의존하게 됩니다. amitshekhariitbhu/llm-internals는 토큰화, 어텐션 수식, 트랜스포머 블록, KV 캐시, MoE, GQA를 순서대로 엮은 ...
The /dataviz skill added in Claude Code 2.1.198 loads chart and dashboard design guidance directly into context. We break down the form heuristic, color form...
NVIDIA re-quantized Qwen3.6-27B to NVFP4 so it serves on a single Blackwell GPU with vLLM out of the box. We break down how the mixed precision (MLP in NVFP4...
We break down Anthropic’s official prompting guide for Claude Fable 5. It lays out five principles: strip out instructions written for older models, audit pr...
If you operate LLMs in production but can’t explain why the KV cache eats memory or what GQA actually saves, your optimization work is running on intuition. ...
87% cheaper is great. But you just swapped landlords, didn’t you?
مهارة /dataviz المضافة في الإصدار 2.1.198 من Claude Code تحمّل إرشادات تصميم الرسوم البيانية ولوحات المعلومات مباشرة إلى السياق. نستعرض قاعدة الشكل، وصيغة ال...
أعادت NVIDIA تكميم Qwen3.6-27B إلى NVFP4 ليُخدَم على GPU واحدة من Blackwell عبر vLLM مباشرةً. نفكّك كيف تُوائم الدقة المختلطة (MLP بصيغة NVFP4 والانتباه وذاك...
نحلل دليل التوجيه الرسمي الذي أصدرته Anthropic لنموذج Claude Fable 5. يطرح الدليل خمسة مبادئ: التخلص من التعليمات التي كُتبت للنماذج القديمة، ومراجعة التقدم ...
إذا كنت تشغّل LLM في الإنتاج ولا تستطيع أن تشرح لماذا يستهلك KV Cache هذا القدر من الذاكرة، أو ما الذي يوفره GQA بالضبط، فإن التحسين يصبح مجرد تخمين. مستودع ...
엔지니어·PM·디자이너가 프로토타이퍼·빌더·스위퍼·그로워·메인테이너로 녹아든다는데, 아무도 안 하려는 6번째가 있다.
스택이 통째로 남의 손에 넘어간 날, 파시스와 메티스의 대처법.
NVIDIA가 공개한 Qwen3.6-27B-NVFP4는 27B 하이브리드 어텐션 추론 모델을 4비트로 눌러 메모리를 약 2.5배 줄이면서도 FP8 대비 벤치마크 차이를 1%p 이내로 유지합니다. 지난 Gemma NVFP4가 Blackwell 전용이었던 것과 달리 이번 빌드는 Hop...
짧은 응답 요청이 긴 응답 요청에 밀려 기다리는 HoL 블로킹은 GPU 시간을 낭비하는 조용한 적입니다. 요청을 short-context 풀과 long-context 풀로 나눠 라우팅하는 Dual-Pool Token-Budget Routing은 arXiv 2604.08075에서 G...
엔지니어링·제품·디자인·데이터가 한 덩어리로 녹아드는 지금, Claude Code를 만든 보리스 체르니가 제안한 다섯 가지 역할 원형과 제품 생애주기별 팀 구성 공식을 살펴봅니다.
NVIDIA’s Qwen3.6-27B-NVFP4 compresses a 27B hybrid-attention reasoning model to 4-bit, cutting memory by roughly 2.5x while keeping benchmark gaps within 1 p...
Short requests waiting behind long ones in a single queue silently waste GPU time — this is Head-of-Line (HoL) blocking. Dual-Pool Token-Budget Routing, prop...
As engineering, product, design, and data blur into a single mass, Boris Cherny, the creator of Claude Code, proposes five role archetypes and a team-composi...
Roles blur into prototyper, builder, sweeper, grower, maintainer, and nobody wants the sixth.
The day the whole stack belonged to someone else, and Paxis and Metis cope.
نموذج Qwen3.6-27B-NVFP4 من NVIDIA يضغط نموذج استدلال بـ 27 مليار معامل ذا انتباه هجين إلى 4 بت، فيخفض الذاكرة بنحو 2.5 ضعف مع إبقاء فجوة المعايير ضمن نقطة وا...
الطلبات القصيرة التي تنتظر خلف الطلبات الطويلة في قائمة انتظار واحدة تُهدر وقت GPU في صمت — وهذا ما يُعرف بـ HoL Blocking. يقترح أسلوب Dual-Pool Token-Budget...
في عصر تتشابك فيه الهندسة والمنتج والتصميم والبيانات في كتلة واحدة، يستعرض هذا المقال النماذج الأصيلة الخمسة التي رصدها Boris Cherny صانع Claude Code، وصيغة ...
2026년 중반 오픈웨이트 모델은 프런티어와 3~6개월 격차로 좁혀졌고, 그 격차는 더 벌어지지 않고 있습니다. 이제 진짜 의사결정은 모델 성능이 아니라 어디서 어떻게 돌릴 것인가, 즉 self-hosting 경제학으로 옮겨갑니다. ThakiCloud의 K8s 서빙 관점에서 정리합...
By mid-2026, open-weight models had closed to within a 3-to-6-month capability gap of frontier labs, and that gap is no longer widening. The real decision ha...
في منتصف عام 2026، باتت النماذج مفتوحة الأوزان على بُعد ثلاثة إلى ستة أشهر من الحدود الأمامية، والفجوة لا تتسع. القرار الحقيقي الآن لم يعد عن أداء النموذج، ب...
NVIDIA가 공개한 GLM-5.2-NVFP4 체크포인트는 469B MoE 모델을 단일 Blackwell 노드(8× RTX PRO 6000)에서 vLLM으로 서빙할 수 있게 합니다. 혼합 정밀도 양자화 구조와 공식 서빙 명령을 정리하고, 공개 수치 기반 메모리 사이징을 직접 계산해...
The GLM-5.2-NVFP4 checkpoint published by NVIDIA lets you serve a 469B MoE model on a single Blackwell node (8x RTX PRO 6000) with vLLM. We break down the mi...
نقطة التفتيش GLM-5.2-NVFP4 التي أصدرتها NVIDIA تتيح تقديم نموذج MoE بحجم 469B على عقدة Blackwell واحدة (8× RTX PRO 6000) باستخدام vLLM. نحلّل بنية التكميم ال...
midudev이 공유해 화제가 된 browser-use의 video-use는 폴더에 원본 영상을 넣고 한 문장을 입력하면 컷 편집, 필러 제거, 자막, 색보정, 애니메이션, 렌더링까지 코딩 에이전트가 자동으로 끝내는 무료 오픈소스 스킬입니다. 컷마다 병렬 서브에이전트를 띄우는 이 ...
Z.ai의 1M 컨텍스트 오픈웨이트 모델 GLM-5.2의 후처리 학습을 떠받친 비동기 강화학습 인프라 slime이 완전 오픈소스로 공개되었습니다. Megatron 학습과 SGLang 롤아웃을 Data Buffer로 잇는 3-컴포넌트 구조, colocated/disaggregated...
코인베이스 CEO 브라이언 암스트롱이 공개한 AI 비용 통제법은 사용량 제한이나 경고 알림이 아니라 더 나은 기본값, 라우팅, 캐싱이었습니다. 직원의 91%가 애초에 사용 한도에 닿지도 않았다는 데이터를 근거로, 마찰을 늘리는 대신 LLM 게이트웨이의 기본 모델을 오픈웨이트로 바꾼...
Shared by midudev and quickly making the rounds, browser-use’s video-use is a free, open-source skill: drop raw footage into a folder, type one sentence, and...
slime, the asynchronous reinforcement-learning infrastructure behind the post-training of Z.ai’s 1M-context open-weight model GLM-5.2, has been fully open-so...
Coinbase CEO Brian Armstrong’s recipe for controlling AI cost was not usage caps or spend alerts, but better defaults, routing, and caching. Backed by the fi...
شاركها midudev فانتشرت بسرعة. مهارة video-use من فريق browser-use مفتوحة المصدر ومجانية بالكامل: ضع اللقطات الخام في مجلد، اكتب جملة واحدة، ويتولى الوكيل الب...
تم فتح المصدر بالكامل لإطار البنية التحتية للتعلّم المعزّز غير المتزامن slime، وهو الذي قاد مرحلة التدريب اللاحق للنموذج مفتوح الأوزان GLM-5.2 من Z.ai بسياق ...
وصفة الرئيس التنفيذي لـ Coinbase بريان أرمسترونغ للتحكم في كلفة الذكاء الاصطناعي لم تكن حدود الاستخدام ولا تنبيهات الإنفاق، بل إعدادات افتراضية أفضل وتوجيه و...
DeepReinforce가 2026년 6월 25일 공개한 Ornith-1.0은 모델이 자신의 강화학습 훈련 스캐폴드를 직접 작성하는 자가-스캐폴딩(self-scaffolding) 메커니즘으로 만든 오픈소스 코딩 모델 패밀리입니다. 9B/31B 밀집과 35B/397B MoE 네 가지...
NVIDIA가 ZAI의 753B MoE 추론 모델 GLM-5.2를 NVFP4(4비트)로 양자화해 Hugging Face에 공개했습니다. 모든 가중치를 일괄로 깎는 대신 MoE 전문가의 선형 연산자만 4비트로 줄이고 공유 전문가와 어텐션은 BF16으로 남기는 선택적 양자화로, FP8...
교수의 논문 작성 노하우를 Codex, Claude Code, Gemini 어디서나 불러 쓰는 Skill 패키지로 묶은 오픈소스 프로젝트가 화제입니다. 단순 프롬프트 모음과 무엇이 다른지, Agent Skill이라는 형식이 왜 중요한지, 그리고 수백 개의 Skill로 에이전트 플랫...
Released by DeepReinforce on June 25, 2026, Ornith-1.0 is an open-source coding model family built on a self-scaffolding mechanism: during reinforcement lear...
NVIDIA has released a NVFP4 (4-bit) quantization of ZAI’s 753B MoE reasoning model GLM-5.2 on Hugging Face. Rather than blanket-quantizing every weight, the ...
An open-source project bundles a professor’s paper-writing expertise into a Skill package that works across Codex, Claude Code, and Gemini. We examine how it...
Ornith-1.0 الصادر عن DeepReinforce في 25 يونيو 2026 هو عائلة نماذج برمجة مفتوحة المصدر تعتمد آلية التسقيل الذاتي (self-scaffolding)، حيث يكتب النموذج بنفسه س...
كمّمت NVIDIA نموذج الاستدلال GLM-5.2 من ZAI (MoE بحجم 753B) إلى NVFP4 (4 بت) ونشرته على Hugging Face. بدلاً من سحق كل الأوزان إلى 4 بت، تُكمَّم فقط المعاملات...
مشروع مفتوح المصدر يُحوّل خبرة الأستاذ في كتابة الأوراق البحثية إلى حزمة Skill قابلة للاستدعاء من Codex أو Claude Code أو Gemini. نستعرض الفارق عن مجموعات ال...
Ollama는 쉽고 vLLM은 빠르다는 통념을 2026년 RTX 4090 공개 벤치마크로 다시 검증합니다. 단일 사용자에서는 격차가 13% 안팎이지만, 동시 50명에서는 vLLM이 약 6배 처리량을 냅니다. PagedAttention과 연속 배칭이 만드는 확장 곡선의 차이, 그리고...
AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다. 정작 프로덕션에서 무너지는 지점은 루프를 멈추는 가드레일입니다. 외부 LLM 없이 순수 파이썬으로 가드레일이 붙은 최소 ReAct 루프를 직접 돌려, 단계 상한과 반복 탐...
The conventional wisdom that Ollama is easy and vLLM is fast gets re-examined with 2026 RTX 4090 public benchmarks. At a single user the gap is around 13%, b...
Most introductory guides to AI agents cover four pieces: the LLM brain, memory, tools, and the agent loop. What actually breaks in production is the part tha...
نعيد اختبار المفهوم الشائع بأن Ollama سهل وvLLM سريع، باستخدام معايير أداء RTX 4090 المنشورة عام 2026. الفجوة لا تتجاوز 13% عند مستخدم واحد، غير أنها تبلغ نح...
تقتصر معظم أدلة المبتدئين في وكلاء الذكاء الاصطناعي على شرح أربعة مكونات: دماغ نموذج اللغة الكبير، والذاكرة، والأدوات، وحلقة الوكيل. غير أن نقطة الانهيار الف...
Google DeepMind가 2026년 4월 공개한 Gemma 4는 E2B부터 31B까지 5종으로 구성된 멀티모달 오픈웨이트 패밀리입니다. Apache 2.0 라이선스, 256K 컨텍스트, 26B MoE와 31B Dense의 차이, 그리고 온프렘 서빙 관점에서 각 모델을 어떻게 ...
NVIDIA가 공개한 Gemma-4-26B-A4B-NVFP4를 DGX Spark 한 대에서 16배 병렬로 돌리면 스트림당 약 18토큰/초, 합산 약 300토큰/초가 나옵니다. 25.2B MoE를 4비트로 압축해 14GB대에 올리는 NVFP4의 원리, 단일 스트림 대 동시성의 트레이...
docker-android는 Android 에뮬레이터를 단일 컨테이너로 패키징해 헤드리스로 띄우는 오픈소스 프로젝트입니다. 이미지 크기와 KVM 요구사항을 실제 문서 기준으로 확인하고, ThakiCloud K8s 플랫폼에서 디바이스 패스스루 워크로드를 운용하는 관점을 정리합니다.
Released by Google DeepMind in April 2026, Gemma 4 is a multimodal open-weight family of five models spanning E2B to 31B. We break down the Apache 2.0 licens...
NVIDIA’s Gemma-4-26B-A4B-NVFP4 running 16 parallel streams on a single DGX Spark (128 GB unified memory) delivers roughly 18 tokens/s per stream and about 30...
docker-android packages an Android emulator into a single container and runs it headlessly. We verify image sizes and KVM requirements against the official d...
أصدرت Google DeepMind نموذج Gemma 4 في أبريل 2026، وهو عائلة متعددة الوسائط مفتوحة الأوزان مكوّنة من خمسة نماذج تمتد من E2B إلى 31B. نشرح رخصة Apache 2.0، وس...
نموذج Gemma-4-26B-A4B-NVFP4 الذي أصدرته NVIDIA يعمل على جهاز DGX Spark واحد (128 جيجابايت من الذاكرة الموحدة) بتوازي 16 ضعفاً، محققاً نحو 18 رمزاً في الثانية...
يُغلّف docker-android محاكي أندرويد في حاوية واحدة ويُشغّله بلا واجهة رسومية. نتحقق من أحجام الصور ومتطلبات KVM وفق التوثيق الرسمي، ونستعرض كيفية تشغيل أحمال...
Claude Code 안에서 슬래시 명령 한두 개로 1080p 영상을 렌더링하는 오픈소스 toolkit입니다. API 키 없이 examples/hello-world를 실제로 클론해 렌더했더니 750프레임 25초짜리 1080p 영상이 18초 만에 나왔습니다. 구조와 실측, 그리고 T...
An open-source toolkit that renders 1080p video from inside Claude Code with a couple of slash commands. I cloned examples/hello-world and rendered it with z...
أداة مفتوحة المصدر تعرض فيديو بدقة 1080p من داخل Claude Code بأمرين من أوامر الشرطة المائلة. استنسخت examples/hello-world وعرضته دون أي مفاتيح API، فخرج مقطع...
웹 디자이너 빅터 오디가 공개한 16분 튜토리얼은 Gemini 3.1로 사이트 구조를 짜고 Seedance 2.0으로 시네마틱 영상을 입혀, 과거 1만 달러를 받던 마케팅 사이트를 한 사람이 만드는 과정을 보여줍니다. 이 단일 운영자 워크플로가 무엇을 압축했는지, 그리고 멀티모달 ...
Anthropic이 Fable 5를 6월 22일까지만 구독 플랜에 무료로 포함하고, 23일부터는 종량제 크레딧으로 돌립니다. 프런티어 모델의 용량 경제학과, 그것이 LLM 소싱 전략과 소버린 AI에 주는 교훈을 ThakiCloud 관점에서 정리합니다.
AGI·인프라·노동이라는 세 렌즈로 AI의 미래를 달리 보는 허사비스, 황, 아모데이의 세계관을 비교하고, 불확실성이 겹치는 지금 빌더 조직이 각자에게서 무엇을 취해야 하는지 종합한다.
NVIDIA CEO 젠슨 황의 ‘엔지니어 1인당 수백 개 에이전트’ 비전이 현실화될 때 조직 구조와 일하는 방식은 어떻게 바뀌어야 하는가.
DeepMind CEO 허사비스의 ‘AGI와 거리가 멀다’ 발언을 출발점으로, AI 조직이 과대광고 대신 정직한 기대치 설정을 문화로 삼아야 하는 이유를 살핀다.
젠슨 황의 ‘시장이 붙인 별명’을 출발점으로, Moneyball 계승 심화, 데이터가 직관을 이기는 의사결정 문화를 어떻게 조직에 뿌리내릴 것인가
코드의 한계비용이 0에 수렴할 때, 엔지니어링 팀의 가치는 ‘무엇을 만드는가’에서 ‘무엇을 만들어야 하는가를 아는가’로 옮겨간다.
A 16-minute tutorial published by web designer Viktor Oddy demonstrates how one person can build a cinematic marketing site that once commanded $10,000 in fe...
Anthropic is including Fable 5 in subscription plans at no extra cost only through June 22, and from June 23 it shifts to pay-per-use credits. ThakiCloud exa...
A comparison of the worldviews of Hassabis, Huang, and Amodei, who read the same AI wave through three different lenses of AGI, infrastructure, and labor, an...
When NVIDIA CEO Jensen Huang’s vision of ‘hundreds of agents per engineer’ becomes reality, how must organizational structures and ways of working change?
Starting from DeepMind CEO Hassabis’s statement that we are ‘nowhere near AGI,’ this post explores why AI organizations should make honest expectation-settin...
Starting from a market-coined label about Jensen Huang, and deepening the Moneyball legacy, how to root a data-beats-intuition decision culture inside your o...
When the marginal cost of code approaches zero, the value of an engineering team shifts from ‘what we build’ to ‘knowing what should be built.’
يوضح برنامج تعليمي مدته 16 دقيقة نشره مصمم الويب فيكتور أودي كيف يمكن لشخص واحد بناء موقع تسويقي سينمائي كان يُكلّف عشرة آلاف دولار في السابق، وذلك باستخدام ...
تتضمّن Anthropic نموذج Fable 5 في خطط الاشتراك مجاناً حتى 22 يونيو فحسب، ومن 23 يونيو ينتقل إلى نظام الدفع حسب الاستخدام. تستعرض ThakiCloud اقتصاديات طاقة ال...
مقارنة بين رؤى هاسابيس وهوانغ وأموداي، الذين يقرؤون الموجة الذكائية الاصطناعية ذاتها من خلال ثلاثة عدسات مختلفة: الذكاء الاصطناعي العام، والبنية التحتية، وسو...
حين تتحقق رؤية الرئيس التنفيذي لـ NVIDIA جنسن هوانغ بـ’مئات الوكلاء لكل مهندس’، كيف يجب أن تتغير الهياكل التنظيمية وأساليب العمل؟
انطلاقًا من تصريح الرئيس التنفيذي لشركة DeepMind بأننا ‘لسنا قريبين على الإطلاق من الذكاء الاصطناعي العام’، نستعرض لماذا ينبغي لمنظمات الذكاء الاصطناعي أن تج...
انطلاقاً من لقب أطلقه المراقبون السوقيون على جنسن هوانغ، وتعمقاً في إرث Moneyball، كيف نُرسّخ ثقافة قرار تتفوق فيها البيانات على الحدس داخل المنظمة
حين يقترب التكلفة الحدية للكود من الصفر، تنتقل قيمة فريق الهندسة من ‘ماذا نبني’ إلى ‘معرفة ما يجب بناؤه’.
Moonshot AI의 Kimi K2.6은 1T 총 파라미터 중 32B만 활성화하는 MoE 구조로 dense 32B급 추론 비용을 유지하면서 256K 컨텍스트와 멀티모달을 지원한다. 300 서브에이전트 스웜 기능이 K8s 멀티테넌트 에이전트 환경과 자연스럽게 연결된다.
Z.ai의 GLM-5.2는 DSA(Dynamic Sparse Attention)로 1M 컨텍스트를 2.9x FLOPs 절감하며 처리한다. MIT 라이선스로 온프렘 배포가 자유롭고, GGUF 29종 양자화로 소비자급 GPU에서도 실행된다.
Microsoft가 공개한 FastContext-1.0-4B-SFT는 Qwen3-4B를 파인튜닝한 코딩 에이전트 서브에이전트 모델이다. READ/GLOB/GREP 세 가지 도구만 써서 저장소를 탐색하고 근거를 찾는다. 262K 컨텍스트, MIT 라이선스.
Google DeepMind가 공개한 DiffusionGemma-26B-A4B-it는 MoE 기반 VLM이되, 텍스트 생성을 autoregressive가 아니라 이산 확산(discrete diffusion)으로 수행한다. 25.2B 총 파라미터, 3.8B 활성, 256K 컨텍스트,...
lazarus19가 공개한 Vibe-Coding-Instruct는 Apache-2.0, 110만 개 코딩 instruction-response 쌍 데이터셋이다. 이미 7개 Gemma/Qwen 파생 모델을 훈련한 실적이 있으며, 커스텀 코드 에이전트 SFT 파이프라인 구축에 바로 쓸...
Glint-Research가 공개한 Fable 5(Claude Code) 에이전트 trace 4,665개. AGPL-3.0, HF Agent Traces 포맷, tool-use 81% 구성. 소형 모델 distillation과 자가호스팅 코드 에이전트 구축에 활용하는 실전 가이드.
agents-last-exam은 153개 장기 과제로 컴퓨터 사용 에이전트를 평가하는 벤치마크 데이터셋이다. Business, Computing, Engineering, Legal 등 5개 도메인, CC-BY-4.0 라이선스. 자체 모델 벤치마킹 파이프라인 구축 가이드.
Moonshot AI’s Kimi K2.6 is a MoE model with 1T total parameters but only 32B active per token, maintaining dense 32B inference costs while supporting 256K co...
Z.ai’s GLM-5.2 handles 1M context with 2.9x FLOPs savings using DSA (Dynamic Sparse Attention). The MIT license removes barriers to on-premises deployment, a...
Microsoft released FastContext-1.0-4B-SFT, a fine-tuned Qwen3-4B coding agent subagent model. It explores repositories using only three tools, READ, GLOB, an...
Google DeepMind released diffusiongemma-26B-A4B-it, a MoE-based VLM that generates text via discrete diffusion rather than autoregressive decoding. 25.2B tot...
Vibe-Coding-Instruct by lazarus19 is an Apache-2.0 dataset of 1.1 million coding instruction-response pairs. It has already been used to train 7 Gemma/Qwen d...
Glint-Research released 4,665 Fable 5 (Claude Code) agent traces in AGPL-3.0 under the HF Agent Traces format, with 81% tool-use composition. A practical gui...
agents-last-exam is a benchmark dataset of 153 long-horizon tasks for evaluating computer-use agents. Five domains including Business, Computing, Engineering...
يحتفظ Kimi K2.6 من Moonshot AI ببنية MoE تُنشّط 32B معاملًا فقط من أصل تريليون، محققًا تكلفة استدلال مماثلة لنماذج dense بحجم 32B مع دعم سياق 256K ومعالجة مت...
يعالج GLM-5.2 من Z.ai سياقًا بطول مليون رمز بتوفير 2.9x في FLOPs باستخدام DSA (الانتباه المتفرق الديناميكي). ترخيص MIT يتيح النشر المحلي بحرية، وتتوفر 29 نسخ...
FastContext-1.0-4B-SFT الصادر عن Microsoft هو نموذج وكيل فرعي مبني على Qwen3-4B ومخصص لاستكشاف مستودعات الشفرات. يستخدم ثلاثة أدوات فقط: READ وGLOB وGREP، وي...
أطلق Google DeepMind نموذج DiffusionGemma-26B-A4B-it، وهو نموذج متعدد الأوضاع مبني على بنية MoE، غير أنه يعتمد الانتشار المتقطع للنصوص بدلاً من التوليد التلق...
Vibe-Coding-Instruct الذي نشره lazarus19 مجموعة بيانات بأزواج تعليمات واستجابات برمجية تضم 1.1 مليون عينة برخصة Apache-2.0. استُخدمت بالفعل لتدريب 7 نماذج مش...
مجموعة بيانات تضم 4,665 أثراً لجلسات وكيل Fable 5 (Claude Code) نشرها Glint-Research. رخصة AGPL-3.0، بتنسيق HF Agent Traces، وتكوين tool-use بنسبة 81%. دليل ...
agents-last-exam مجموعة بيانات معيارية لتقييم وكلاء استخدام الحاسوب عبر 153 مهمة طويلة الأمد في خمسة مجالات: Business وComputing وEngineering وLegal وغيرها. ...
HTML, CSS, JavaScript, 이미지를 포함한 전체 웹사이트를 로컬 머신에 다운로드할 수 있는 강력한 Go 기반 웹사이트 클로너 Goclone 사용법을 배워보세요.
Learn how to use Goclone, a powerful Go-based website cloner that downloads entire websites including HTML, CSS, JavaScript, and images to your local machine.
تعلم كيفية استخدام Goclone، أداة قوية لاستنساخ المواقع تعتمد على Go لتنزيل مواقع الويب الكاملة بما في ذلك HTML و CSS و JavaScript والصور إلى جهازك المحلي.
RAGLight 프레임워크를 마스터하세요. RAG, Agentic RAG, RAT 파이프라인, MCP 통합을 통해 강력한 검색 증강 생성 시스템을 구축하는 실전 가이드입니다.
Master RAGLight framework with hands-on examples covering RAG, Agentic RAG, RAT pipelines, and MCP integration for building powerful retrieval-augmented gene...
إتقان إطار RAGLight مع أمثلة عملية تغطي RAG، Agentic RAG، RAT pipelines، وتكامل MCP لبناء أنظمة توليد معززة بالاسترجاع قوية.
LangGPT의 구조화된 프레임워크를 사용하여 고품질의 재사용 가능한 프롬프트를 만드는 방법을 배워보세요. 혼란스러운 프롬프트 엔지니어링을 체계적인 방법론으로 변환하는 템플릿, 예제, 모범 사례를 제공합니다.
Learn how to create high-quality, reusable prompts using LangGPT’s structured framework. Transform chaotic prompt engineering into systematic methodology wit...
تعلم كيفية إنشاء محفزات عالية الجودة وقابلة لإعادة الاستخدام باستخدام إطار عمل LangGPT المنظم. حول هندسة المحفزات الفوضوية إلى منهجية منظمة مع القوالب والأمث...
udocker를 사용하여 루트 권한 없이 Docker 컨테이너를 실행하는 방법을 배워보세요. HPC 환경, 공유 시스템, 보안 컨테이너 실행에 완벽한 솔루션입니다.
엔터프라이즈급 보안, 비용 제어, 벤더 유연성을 제공하는 오픈소스 AI 에이전트 오케스트레이터 Shannon의 설치부터 고급 멀티 에이전트 워크플로우까지 완전한 가이드를 제공합니다.
Learn how to run Docker containers without root privileges using udocker - perfect for HPC environments, shared systems, and secure container execution.
Learn how to set up and use Shannon, an open-source AI agent orchestrator with enterprise-grade security, cost controls, and vendor flexibility. A comprehens...
تعلم كيفية تشغيل حاويات Docker بدون صلاحيات الجذر باستخدام udocker - مثالي لبيئات الحوسبة عالية الأداء والأنظمة المشتركة والتشغيل الآمن للحاويات.
تعلم كيفية إعداد واستخدام Shannon، منسق وكلاء الذكاء الاصطناعي مفتوح المصدر مع أمان على مستوى المؤسسات وضوابط التكلفة ومرونة البائعين. دليل شامل من التثبيت إ...
Helm Dashboard에 대한 종합 튜토리얼 - 시각적 인터페이스로 Kubernetes 차트 관리를 단순화하고 리비전 히스토리와 손쉬운 롤백 기능을 제공하는 Helm의 필수 UI 도구.
A comprehensive tutorial on Helm Dashboard - the missing UI for Helm that simplifies Kubernetes chart management with visual interface, revision history, and...
برنامج تعليمي شامل حول Helm Dashboard - واجهة المستخدم المفقودة لـ Helm التي تبسط إدارة مخططات Kubernetes بواجهة مرئية وسجل المراجعات وإمكانيات الاستعادة الس...
GitHub Copilot, ChatGPT, Claude 등 AI 기반 코딩 도구를 마스터하여 개발 워크플로우를 가속화하고 더 나은 코드를 빠르게 작성하는 방법을 알아보세요.
Master AI-powered coding tools like GitHub Copilot, ChatGPT, and Claude to accelerate your development workflow and write better code faster.
تعلم كيفية إتقان أدوات البرمجة المدعومة بالذكاء الاصطناعي مثل GitHub Copilot وChatGPT وClaude لتسريع سير عمل التطوير وكتابة كود أفضل بشكل أسرع.
AI 코딩 에이전트를 위한 효과적인 에이전틱 루프 설계 방법을 마스터하세요. 안전 실습, 도구 선택, 실제 구현 전략을 학습합니다.
컨텍스트 엔지니어링을 마스터하세요 - 프롬프트 엔지니어링보다 10배, 바이브 코딩보다 100배 뛰어난 혁신적 접근법. AI 코딩 어시스턴트를 진정으로 효과적으로 만드는 방법을 배워보세요.
Master the art of designing effective agentic loops for AI coding agents. Learn safety practices, tool selection, and real-world implementation strategies.
Master Context Engineering - the revolutionary approach that’s 10x better than prompt engineering and 100x better than vibe coding. Learn how to make AI codi...
أتقن فن تصميم الحلقات الوكيلة الفعالة لوكلاء الترميز بالذكاء الاصطناعي. تعلم ممارسات الأمان واختيار الأدوات واستراتيجيات التنفيذ الواقعية.
أتقن هندسة السياق - النهج الثوري الذي يتفوق على هندسة التوجيهات بـ 10 أضعاف وعلى البرمجة العشوائية بـ 100 ضعف. تعلم كيفية جعل مساعدي البرمجة بالذكاء الاصطناع...
LandingAI의 Agentic Document Extraction 라이브러리를 활용한 지능형 문서 처리 마스터하기. 복잡한 PDF, 이미지, 문서에서 구조화된 데이터를 AI 파싱 기능으로 추출하는 방법을 학습합니다.
Master LandingAI’s Agentic Document Extraction library for intelligent document processing. Extract structured data from complex PDFs, images, and documents ...
إتقان مكتبة LandingAI’s Agentic Document Extraction لمعالجة المستندات الذكية. استخراج البيانات المنظمة من ملفات PDF والصور والمستندات المعقدة باستخدام قدرات ...
기술적 우수성은 모든 커리어의 기초이지만, 진정한 성장을 위해서는 기술적 능력, 제품 사고, 프로젝트 실행, 그리고 인간관계 기술이라는 네 가지 핵심 역량을 균형 있게 발전시켜야 합니다.
While technical excellence is the foundation of any career, true advancement requires mastering four essential disciplines: technical skill, product thinking...
بينما تُعد التميز التقني أساس أي مسار مهني، فإن النمو الحقيقي يتطلب إتقان أربع مهارات أساسية: المهارة التقنية، والتفكير في المنتج، وتنفيذ المشاريع، ومهارات ا...
LLM 후훈련을 위한 필수 데이터셋과 도구들을 탐구합니다. 지도 미세조정 데이터셋, 선호도 정렬 데이터, 그리고 고품질 AI 모델 구축을 위한 큐레이션 방법론을 다룹니다.
Explore the essential datasets and tools for LLM post-training, including supervised fine-tuning datasets, preference alignment data, and curation methodolog...
استكشف مجموعات البيانات والأدوات الأساسية للتدريب اللاحق للنماذج اللغوية الكبيرة، بما في ذلك مجموعات بيانات الضبط الدقيق المراقب وبيانات محاذاة التفضيلات ومن...
농업부터 e스포츠까지 다양한 분야의 엄선된 공개 데이터셋 컬렉션을 통해 전 세계 오픈 데이터 커뮤니티의 노하우를 만나보세요.
Discover the ultimate collection of curated public datasets across diverse domains, from agriculture to eSports, maintained by the global open data community.
اكتشف المجموعة النهائية من مجموعات البيانات العامة المنتقاة عبر مجالات متنوعة، من الزراعة إلى الرياضات الإلكترونية، يحتفظ بها مجتمع البيانات المفتوحة العالمي.
NVIDIA가 6백만 개의 다국어 추론 데이터셋을 공개하며 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 확장된 고품질 훈련 데이터를 제공합니다.
NVIDIA releases a 6-million-example multilingual reasoning dataset, providing high-quality training data expanded across five languages: French, Spanish, Ger...
تُطلق NVIDIA مجموعة بيانات استدلال متعددة اللغات تضم ستة ملايين مثال، وتوفر بيانات تدريب عالية الجودة تغطي خمس لغات: الفرنسية والإسبانية والألمانية والإيطالي...
64만 시간의 오디오 데이터로 구성된 NVIDIA의 최신 다언어 음성 인식 및 번역 데이터셋, Granary의 특징과 활용 방안을 알아봅니다.
NVIDIA’s latest multilingual speech recognition and translation dataset, Granary, covers 640,000 hours of audio across 25 European languages. This guide cove...
مجموعة بيانات NVIDIA Granary الصوتية متعددة اللغات تضم 640,000 ساعة من التسجيلات الصوتية عبر 25 لغة أوروبية. دليل شامل لخصائصها وأساليب توظيفها.
PDF, 이미지, 오디오 파일을 자동으로 구조화하는 오픈소스 AI 플랫폼 Rowfill의 핵심 기능과 활용법을 알아보세요.
Discover the core features and applications of Rowfill, an open-source AI platform that automatically structures PDF, image, and audio files.
اكتشف الميزات الأساسية وتطبيقات Rowfill، منصة الذكاء الاصطناعي مفتوحة المصدر التي تنظم ملفات PDF والصور والصوت تلقائياً.
Node.js/TypeScript로 구축된 AnyCrawl로 웹사이트를 LLM 친화적 데이터로 변환하고, Google/Bing SERP 결과를 효율적으로 수집하는 방법을 마스터해보세요.
Master how to transform websites into LLM-ready data and efficiently collect Google/Bing SERP results with AnyCrawl, built on Node.js/TypeScript.
أتقن كيفية تحويل مواقع الويب إلى بيانات جاهزة للنماذج اللغوية الكبيرة وجمع نتائج Google/Bing SERP بكفاءة باستخدام AnyCrawl المبني على Node.js/TypeScript.
ByteDance에서 공개한 Dolphin 프로젝트의 Fox 데이터셋과 벤치마크를 상세히 분석합니다. ACL 2025에 게재된 최신 문서 이해 기술과 3천만 개 이상의 샘플로 구성된 대규모 데이터셋을 알아보세요.
A detailed analysis of ByteDance’s Dolphin project Fox dataset and benchmark, including the Analyze-then-Parse paradigm from ACL 2025 and a large-scale datas...
تحليل مفصل لمجموعة بيانات Fox والاختبارات المرجعية لمشروع Dolphin الصادر عن ByteDance. تعرف على أحدث تقنيات فهم المستندات المنشورة في ACL 2025 ومجموعة البيان...
RedNote가 공개한 dots.ocr로 다국어 문서 레이아웃 분석과 OCR을 단일 비전-언어 모델에서 구현하는 방법을 알아봅니다.
How to implement multilingual document layout analysis and OCR in a single vision-language model using dots.ocr, released by RedNote.
استعراض النموذج البصري اللغوي dots.ocr الذي أصدرته RedNote، وكيفية تنفيذ تحليل تخطيط المستندات متعدد اللغات والتعرف الضوئي على الحروف في نموذج واحد.
프로덕션 환경에서 ML 애플리케이션을 구축하기 위해 필요한 핵심 기술 스택과 역량을 정리한 실무 중심 가이드
A practical guide outlining the core technology stack and competencies needed to build ML applications in production environments
دليل عملي يوضح المجموعة التقنية الأساسية والكفاءات المطلوبة لبناء تطبيقات التعلم الآلي في بيئات الإنتاج
Vibe Coding과 Agentic Coding이 가져온 새로운 개발 문화를 어떻게 받아들이고 발전시킬 것인가? 과거의 관습에서 벗어나 AI와 함께하는 협업 문화 구축 가이드
How to embrace and develop the new development culture brought by Vibe Coding and Agentic Coding? A guide to building collaborative culture with AI, breaking...
كيف نتبنى ونطور ثقافة التطوير الجديدة التي جلبتها البرمجة الإيقاعية والبرمجة الوكيلة؟ دليل لبناء ثقافة تعاونية مع الذكاء الاصطناعي، والانفصال عن التقاليد الس...
15분 설문과 행동 데이터로 팀 궁합을 정량화해 채용부터 온보딩까지 전 과정을 최적화하는 Saberr 알고리즘 활용법
데이터로 숨은 가치를 발굴해 자원 대비 최대 성과를 이끄는 머니볼 전략을 개발·제품·채용에 적용하는 방법
AI 시대의 개발자는 모든 것을 알 필요 없다. 해킹 마인드셋과 역엔지니어링 정신으로 무지를 강점으로 전환하는 새로운 패러다임을 탐구한다.
How to leverage Saberr algorithms to quantify team compatibility through 15-minute surveys and behavioral data, optimizing everything from hiring to onboarding
How to apply Moneyball strategy that discovers hidden value through data and achieves maximum performance relative to resources in development, product, and ...
In the AI era, developers don’t need to know everything. Explore a new paradigm that transforms ignorance into strength through hacking mindset and reverse e...
كيفية الاستفادة من خوارزميات سابر لقياس توافق الفريق من خلال استطلاعات 15 دقيقة والبيانات السلوكية، وتحسين كل شيء من التوظيف إلى الإعداد
كيفية تطبيق استراتيجية مونيبول التي تكتشف القيمة المخفية من خلال البيانات وتحقق أقصى أداء نسبة إلى الموارد في التطوير والمنتج والتوظيف
في عصر الذكاء الاصطناعي، لا يحتاج المطورون لمعرفة كل شيء. استكشف نموذجاً جديداً يحول الجهل إلى قوة من خلال عقلية القرصنة وروح الهندسة العكسية.
AI 엔지니어링을 시작하려는 분들을 위한 학습 로드맵입니다. 순서대로 따라가도 되고, 관심 있는 영역부터 먼저 파도 됩니다.
We’re sharing a learning roadmap for those who want to start AI engineering. This roadmap is structured to allow step-by-step learning of the core areas of A...
نحن نشارك خريطة طريق التعلم لأولئك الذين يريدون بدء هندسة الذكاء الاصطناعي. هذه الخريطة منظمة للسماح بالتعلم التدريجي للمجالات الأساسية لهندسة الذكاء الاصطنا...
백엔드·인프라 엔지니어 채용을 위한 10대 필독서와 실무 적용 사례를 통해 우리가 찾는 인재상과 채용 기준을 소개합니다.
Introducing the ideal candidate profile and hiring criteria through 10 must-read books for backend·infrastructure engineer recruitment and practical applicat...
تقديم الملف المثالي للمرشح ومعايير التوظيف من خلال 10 كتب يجب قراءتها لتوظيف مهندس البنية التحتية والخلفية وحالات التطبيق العملية.
ThakiCloud의 Three Vs(속도, 검증, 버전관리) 기반 MLOps 문화와 실전 사례, 그리고 함께할 동료를 찾는 채용 안내를 담았습니다.
KCD Seoul 2025에서 발표한 자료를 공유합니다. xPU as a Service 기반 Agentic AI 플랫폼Thaki Cloud에 대한 내용입니다
ThakiCloud’s Three Vs (Velocity, Validation, Versioning) based MLOps culture and practical cases, plus recruitment information for colleagues to join us.
Sharing materials presented at KCD Seoul 2025. Content about Thaki Cloud, an xPU as a Service-based Agentic AI platform
ثقافة MLOps القائمة على Three Vs (السرعة، التحقق، الإصدار) في ThakiCloud والحالات العملية، بالإضافة إلى معلومات التوظيف للزملاء للانضمام إلينا.
مشاركة المواد المقدمة في KCD Seoul 2025. محتوى حول Thaki Cloud، منصة الذكاء الاصطناعي الوكيلي القائمة على xPU كخدمة
Thaki Cloud의 기업 문화, 복지, 개발자들의 이야기, 채용 정보 등을 공유합니다.
Thaki Cloud의 미션, 원칙, 그리고 가치를 공유합니다.
Sharing Thaki Cloud’s corporate culture, benefits, developer stories, recruitment information, and more.
Sharing Thaki Cloud’s mission, principles, and values.
مشاركة ثقافة الشركة والمزايا وقصص المطورين ومعلومات التوظيف في Thaki Cloud والمزيد.
مشاركة مهمة ومبادئ وقيم Thaki Cloud.
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다. SEED는 에이전트가 자기 궤적에서 스스로 뽑은 자연어 스킬을 다시 자기에게 증류해, 그 희소한 신호를 토큰마다 촘촘한 신호로 바꿉니다.
긴 추론의 진짜 비용은 상태가 무한정 커지는 데서 옵니다. 마르코프 사고는 사고를 고정 크기 청크로 끊고, 청크 경계에서 짧은 상태만 넘겨 이어 가게 해 비용을 제곱에서 선형으로 바꿉니다.
무인 에이전트 루프에 검증 게이트를 넣으면 안전해진다는 통념을 실측으로 뜯어본 결과, 게이트 혼자서는 오히려 반복 소진율을 급증시키는 함정이 있었습니다.
The real bottleneck in agentic RL is that the reward arrives only once, at the very end of a trajectory. SEED turns that single sparse signal into dense per-...
The real cost of long reasoning comes from the state growing without bound. Markovian Thinking breaks reasoning into fixed-size chunks and passes only a shor...
العائق الحقيقي في التعلّم المعزّز للوكلاء (agentic RL) هو أن المكافأة تصل مرة واحدة فقط، في نهاية المسار (trajectory). يحوّل SEED هذه الإشارة النادرة الوحيدة...
الكلفة الحقيقية للاستدلال الطويل تأتي من نمو الحالة (state) بلا حدود. يقسّم التفكير الماركوفي (Markovian Thinking) الاستدلال إلى كتل (chunks) ثابتة الحجم ويم...
그림 속 글자는 또박또박, 근데 그 붓은 남의 클라우드에 꽂혀 있다ㅋ
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다. 문제는 모델의 지능이 아니라 답을 검증된 원문에 묶지 않은 설계입니다. 법제처 국가법령정보 Open API를 근거원으로 삼아 LLM 법률 답변을 인용 기반으로 바꾸는 방법을, 서빙 관점에서 정...
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다. 그 비결은 ‘더 많은 테스트’가 아니라 벤치마크 게이트, 릴리스 브랜치 고정, 커밋 단위 이등분이라는 세 가지 결정론적 장치입니다. vLLM 유지관리팀이 공개한 운영기를 타키클라우드 서빙 관...
Claude Code 데스크톱이 iOS 시뮬레이터를 대화 옆 패널에 띄우는 기능을 공개 베타로 내놨습니다. 앱을 빌드해 실행하고, Claude가 실행 중인 화면을 직접 보며 고쳐 나가는 이 닫힌 루프가 무엇을 바꾸는지, 어떻게 켜는지, 그리고 에이전트 네이티브 클라우드 관점에서 왜...
Archify는 Mermaid 문법을 배우지 않고도 평범한 문장 설명만으로 자기완결형 HTML 아키텍처 다이어그램을 만드는 에이전트 스킬입니다. 실제로 설치해 타키클라우드 ai-platform 구조를 그려 보니, 핵심은 그림이 아니라 레이아웃을 강제로 검증하는 렌더러였습니다. 그 ...
7월 22일, 오픈웨이트 릴리스 두 건이 거울처럼 마주 섰습니다. 하나는 코드를 생성하고 하나는 그 코드의 취약점을 찾습니다. 그런데 둘 다 답하지 못하는 질문이 하나 남습니다. 그 코드는 실제로 누구의 인프라에서, 어떤 권한으로 돌아가는가.
vLLM merges roughly 2,000 commits into main every month and still holds production quality. The secret is not ‘more tests’ but three deterministic devices: a...
Claude Code desktop has shipped a public beta feature that opens the iOS simulator in a panel right next to the conversation. Here is what changes when Claud...
Archify is an agent skill that generates self-contained HTML architecture diagrams from plain-language descriptions, no Mermaid syntax required. We installed...
The letters come out perfect. The brush is bolted to someone else’s cloud.
On July 22, two open weight releases stood facing each other like mirror images. One generates code, the other finds vulnerabilities in it. Yet neither answe...
يدمج vLLM نحو 2000 التزام في main كل شهر ويحافظ مع ذلك على جودة الإنتاج. السر ليس ‘مزيداً من الاختبارات’ بل ثلاث آليات حتمية: بوابة قياس أداء، وتثبيت فرع الإ...
أطلق تطبيق Claude Code لسطح المكتب ميزة تُظهر محاكي iOS في لوحة جانبية بجوار المحادثة، ضمن نسخة تجريبية عامة. نستعرض ما تغيّره هذه الحلقة المغلقة التي يبني ف...
Archify مهارة وكيل تُنشئ مخططات معمارية بصيغة HTML ذاتية الاكتفاء من وصف بجملة عادية دون الحاجة لتعلّم صيغة Mermaid. حين ثبّتناها فعليًا ورسمنا بها بنية ai-p...
في الثاني والعشرين من يوليو، وقف إصداران مفتوحا الأوزان وجها لوجه كالمرآة. أحدهما يولد الكود، والآخر يبحث عن ثغراته. لكن يبقى سؤال واحد لم يجب عليه أي منهما،...
VRAM 있는 만큼 골라 담았더니, 클라우드 청구서만 굶었다ㅋ
버스트성 테넌트가 놀릴 때 정적 균등 분배는 그 몫을 낭비합니다. 고정 예산을 수요 쪽으로 옮기는 동적 컨트롤러는 실제 H200에서 총 처리량을 14% 끌어올렸습니다.
알리바바 Qwen 팀이 이미지 생성 3세대 모델 Qwen-Image-3.0을 발표했습니다. 4.5k 토큰 입력, 10px 초소형 텍스트, 12개 언어 렌더링을 앞세웠지만 지금 쓸 수 있는 경로는 Qwen Chat 호스팅뿐이고 가중치도 벤치마크도 공개되지 않았습니다. 확인된 사실과 ...
허깅페이스가 2026년 7월 자율 AI 에이전트에 의한 내부 침해를 공개했습니다. 진입로는 악성 데이터셋 하나였고, 데이터셋 처리 파이프라인의 두 취약점이 코드 실행으로 이어졌습니다. 확인된 사실과 아직 조사 중인 부분을 나누고, 데이터셋 처리를 신뢰 경계로 다뤄야 하는 이유를 정...
허깅페이스가 공개한 hugging-voice와 그 엔진인 speech-to-speech는 VAD에서 STT, LLM, TTS까지 이어지는 실시간 음성 파이프라인을 OpenAI Realtime 호환 WebSocket으로 감쌌습니다. 클라이언트의 base URL 한 줄만 바꾸면 자체 ...
Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다. claude --ax-screen-reader 한 줄이 무엇을 바꾸는지, 어떤 원리로 동작하는지, 그리고 에이전트 인터페이스의 접근성이 왜 타키클라우드 같은 플랫폼에 중요한 문제...
오픈소스 마케팅 플러그인 Digital Marketing Pro는 스킬 158개와 전문 에이전트 24개를 하나로 묶고도 무너지지 않습니다. 비결은 12단계 고정 흐름이라는 결정론적 골격입니다. 이 설계를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어떻게 제품화하는지 정리했습니다.
Cursor가 835쪽 매뉴얼만 보고 SQLite를 Rust로 재구현한 에이전트 스웜을 공개했습니다. 홀드아웃 테스트 100% 통과, 모델 조합에 따라 15배 벌어진 비용, 초당 1,000커밋을 감당하려 새로 만든 버전관리 시스템까지, 홍보 문구가 아니라 공식 블로그 수치로 검증하...
Does an agent that observes GPU telemetry and adjusts batch size and concurrency in real time outperform static Kueue admission control? The simulation said ...
Alibaba’s Qwen team has announced Qwen-Image-3.0, its third-generation image generation model. It leads with 4.5k-token input, 10px micro-text rendering, and...
In July 2026 Hugging Face disclosed an internal breach driven by an autonomous AI agent. The entry point was a single malicious dataset, and two vulnerabilit...
Hugging Face’s hugging-voice and its engine speech-to-speech wrap a full realtime voice pipeline, from VAD through STT, LLM, and TTS, behind an OpenAI Realti...
Claude Code added a screen reader mode that swaps its visual terminal UI for plain, linear text. Here is what claude --ax-screen-reader actually changes, how...
The open-source marketing plugin Digital Marketing Pro bundles 158 skills and 24 specialist agents without collapsing. The trick is a deterministic skeleton:...
We sized the model to the card we already owned. The only thing that starved was the cloud invoice.
Cursor showed an agent swarm that rebuilt SQLite in Rust from only its 835-page manual. It passed 100% of a held-out test suite, cost varied 15x by model mix...
هل يتفوق عميل (agent) يراقب قياسات وحدة معالجة الرسوميات (GPU telemetry) ويضبط حجم الدفعة (batch size) والتزامن (concurrency) في الوقت الفعلي على التحكم الثا...
أعلن فريق Qwen التابع لعلي بابا عن Qwen-Image-3.0، الجيل الثالث من نماذج توليد الصور. طرح النموذج قدرات لافتة مثل استيعاب مدخلات بطول 4.5 ألف رمز (token)، وع...
في يوليو 2026 كشف Hugging Face عن اختراق داخلي قاده وكيل ذكاء اصطناعي ذاتي. كانت نقطة الدخول مجموعة بيانات خبيثة واحدة، وأدت ثغرتان في خط معالجة مجموعات البي...
يغلّف مشروع hugging-voice من Hugging Face ومحركه speech-to-speech خط معالجة صوتي لحظي كامل، من كشف النشاط الصوتي إلى STT وLLM وTTS، خلف واجهة WebSocket متواف...
أضاف Claude Code وضع قارئ الشاشة الذي يستبدل واجهة الطرفية البصرية بنص خطي بسيط. إليك ما يغيّره الأمر claude --ax-screen-reader فعليًا، وكيف يعمل، ولماذا تهم...
يجمع المكوّن الإضافي مفتوح المصدر Digital Marketing Pro بين 158 مهارة و24 وكيلًا متخصصًا دون أن ينهار. السر هيكل حتمي: تدفّق ثابت من 12 جزءًا. نحلّل التصميم ...
عرضت Cursor سربًا من الوكلاء أعاد بناء SQLite بلغة Rust اعتمادًا على دليلها المؤلف من 835 صفحة فقط. اجتاز 100% من مجموعة اختبارات محجوزة، وتفاوتت التكلفة 15 ...
리더보드 1등 먹었는데, 그게 남의 시험지였다ㅋ
도구를 쓰는 LLM 에이전트는 모델을 감싸는 하네스 위에서 돕니다. 최근 arXiv 논문은 이 하네스 설계와 사후학습을 분리해서 다루면 성능이 무너진다는 점을, 특히 도구 환경이 바뀌는 상황에서 실증합니다. 하네스를 일급 리소스로 다루는 관점에서 이 결과를 풀어봅니다.
밤새 스스로 코드를 고치는 에이전트 하네스가 다음 날 그 결과물을 어떻게 배포해야 안전할까요. 카나리와 자동 롤백을 끼운 실험이 장애 반경과 복구시간의 트레이드오프를 구체적으로 보여줍니다.
알리바바가 2.4조 파라미터 규모의 Qwen3.8을 곧 오픈웨이트로 공개하겠다고 예고했습니다. 프리뷰는 이미 테스트할 수 있지만 가중치도 벤치마크도 아직 공개되지 않았습니다. 발표에서 확인된 사실과 아직 주장에 머무는 부분을 구분해 정리했습니다.
폐쇄형 모델이 정당한 보안·의료·법률 작업까지 거부하는 과잉 거부 문제가 다시 도마에 올랐습니다. Moonshot의 오픈웨이트 Kimi K3는 콘텐츠 필터를 아예 두지 않는다고 밝혔습니다. 이 설계가 운영자에게 무엇을 넘겨주는지, 그리고 그 부담을 어떻게 다뤄야 하는지를 정리했습니다.
Moonshot이 공개한 Kimi K3는 오픈웨이트 역사상 가장 큰 2.8조 파라미터 모델입니다. 점수는 화려하지만 곧바로 벤치마크 과적합 논쟁이 붙었습니다. 운영자가 이 모델을 도입하기 전에 무엇을 어떻게 검증해야 하는지를 정리했습니다.
레이어나 전문가 단위가 아니라 텐서 하나하나를 CPU와 GPU에 나눠 배치하면, RTX 4090 한 장으로 VRAM을 훌쩍 넘는 모델을 돌리면서 디코딩을 최대 3.29배 끌어올릴 수 있다는 논문 ATSInfer를 읽고, 그 원리와 우리 서빙 관점에서의 함의를 정리했습니다.
국내 사용자에게 250억 원이 청구된 사건부터 기업 60곳의 과다 청구 의혹까지, 최근 한 달의 AI 비용 뉴스는 하나의 공백을 가리킵니다. 한 번의 요청이 수백 번의 모델 호출로 번지는 에이전트 시대에, 청구서는 더 이상 무엇에 돈을 냈는지 설명해 주지 않습니다. 이 관측 공백을...
AI 코딩 도구가 매 세션 규칙을 잊어버리는 문제를, 한 해커톤 우승자가 실제 TypeScript 마이크로서비스를 6개월 돌리며 쌓은 설정으로 풀었습니다. everything-claude-code의 얇은 하네스·두꺼운 스킬 구조를 뜯어보고, 타키클라우드 Paxis가 같은 원리를 어...
일론 머스크가 다보스에서 던진 세 가지 예측이 ‘3년 뒤 급여의 시대가 끝난다’는 경고로 번졌습니다. 실제 인터뷰 영상을 받아 적어 그가 정확히 무엇을 말했는지 확인하고, 노동에서 자산으로 넘어가는 흐름의 밑바닥에서 도는 컴퓨트 인프라가 왜 진짜 관건인지 짚습니다.
문샷AI가 MIT 라이선스로 공개한 오픈소스 코딩 CLI를 공식 문서 기준으로 분석합니다. 서브에이전트와 MCP 편의성은 클로드 코드와 겹치지만, 진짜 차별점은 Agent Client Protocol 네이티브 지원과 모델 개방성입니다.
Anthropic이 Claude Code의 시스템 프롬프트를 80% 걷어냈다는 소식이 개발자 사이에서 화제가 됐습니다. 담당자는 새 모델이 ‘더 작은 시스템 프롬프트를 원하고’, 오히려 우리가 준 지침보다 더 상상력이 풍부하다고 설명했습니다. 모델이 강해질수록 하네스는 얇아지고 규...
Tool-using LLM agents run on top of a harness that wraps the model. A recent arXiv paper shows empirically that treating harness design and post-training as ...
How should an agent harness that rewrites its own code overnight safely roll out the result the next day? An experiment pairing canary releases with automati...
Alibaba has previewed Qwen3.8, a 2.4-trillion-parameter model, promising an open-weight release. The preview is already testable, but neither the weights nor...
The over-refusal problem, where closed models block legitimate security, medical, and legal work, is back in the spotlight. Moonshot’s open-weight Kimi K3 sa...
Kimi K3, released by Moonshot, is the largest open-weight model in history at 2.8 trillion parameters. The scores are dazzling, but a benchmark-overfitting d...
Instead of offloading whole layers or experts, ATSInfer places individual tensors across CPU and GPU. The paper reports running models far beyond VRAM on a s...
From a 25 billion won bill sent to a user in Korea to allegations of overbilling at 60 companies, the past month of AI cost news points to a single blind spo...
AI coding tools forget your rules every new session. An Anthropic hackathon winner solved this by open-sourcing the config they refined over six months on a ...
Elon Musk’s three Davos predictions got recompressed online into a warning that ‘the age of the paycheck ends in three years.’ We transcribed the actual inte...
Topped the leaderboard — on somebody else’s exam.
We dig into the open source coding CLI that Moonshot AI released alongside Kimi K3, working strictly from the official docs and repository. From coder/explor...
News that Anthropic stripped Claude Code’s system prompt down by 80 percent made the rounds among developers. The person behind the change explained that the...
يعمل وكيل LLM المستخدِم للأدوات فوق harness يحيط بالنموذج. وتُثبت ورقة بحثية حديثة على arXiv، عملياً، أن الفصل بين تصميم هذا الـ harness والـ post-training ي...
كيف يمكن لحاضنة عميل ذاتية (agent harness) تعيد كتابة كودها بنفسها طوال الليل أن تنشر نتيجتها بأمان في اليوم التالي؟ تجربة تجمع بين إصدارات الكناري (canary r...
أعلنت علي بابا عن نيتها إصدار Qwen3.8 بحجم 2.4 تريليون معلمة كأوزان مفتوحة قريبا. النسخة التجريبية متاحة للاختبار بالفعل، لكن الأوزان والمعايير القياسية لم ت...
عادت مشكلة الرفض المفرط، التي تجعل النماذج المغلقة ترفض حتى المهام الأمنية والطبية والقانونية المشروعة، إلى الواجهة من جديد. أعلنت Moonshot أن نموذجها مفتوح ...
أطلقت Moonshot نموذج Kimi K3، وهو أكبر نموذج مفتوح الأوزان في التاريخ بـ 2.8 تريليون معامل. النتائج مبهرة، لكن جدلاً حول الإفراط في التكيّف مع المعايير القيا...
بدلاً من إنزال طبقات أو خبراء كاملين، يوزّع ATSInfer الموتّرات فرادى بين الـ CPU والـ GPU. تُبلّغ الورقة عن تشغيل نماذج تتجاوز سعة الـ VRAM بكثير على بطاقة R...
من حادثة فوترة بقيمة 25 مليار وون طالت مستخدما محليا إلى شبهات فوترة زائدة شملت 60 شركة، تشير أخبار تكلفة الذكاء الاصطناعي في الشهر الأخير إلى فجوة واحدة. في...
أدوات البرمجة بالذكاء الاصطناعي تنسى قواعدك مع كل جلسة جديدة. حلّ أحد الفائزين بهاكاثون Anthropic هذه المشكلة بنشر إعداداته مفتوحة المصدر بعد صقلها ستة أشهر ...
اختُزلت توقّعات إيلون ماسك الثلاثة في دافوس على الإنترنت إلى تحذير مفاده أن ‘عصر الراتب ينتهي خلال ثلاث سنوات’. فرّغنا مقطع المقابلة الفعلي لنتحقق مما قاله ح...
نحلل أداة سطر الأوامر المفتوحة المصدر للبرمجة التي أطلقتها Moonshot AI إلى جانب Kimi K3، استناداً إلى الوثائق الرسمية والمستودع الفعلي. من الوكلاء الفرعيين c...
أثار خبر تخفيض أنثروبيك حجم التعليمات النظامية في Claude Code بنسبة 80 بالمئة نقاشا واسعا بين المطورين. وأوضح المسؤول عن ذلك أن النموذج الجديد “يريد تعليمات ...
똑똑한 한 놈은 벽에서 막힌대. 그래서 파시스가 떼로 풀었다ㅋ
GPT-5.6이 사이즈마다 대여섯 개의 추론 노력 설정을 달고 나오면서, effort 조절은 이제 리즈닝 모델의 기본기가 됐습니다. 같은 라벨 뒤에 어떤 학습 레시피가 숨어 있는지, 오픈웨이트 6개 모델의 기술 리포트를 뜯어 공통 골격을 정리합니다.
상탕(SenseTime)이 日日新 SenseNova U1을 Apache 2.0으로 공개했습니다. 비주얼 인코더와 VAE를 모두 없앤 NEO-Unify 아키텍처로 이해·생성·편집·인터리브를 한 모델에서 처리합니다. 오픈 가중치(8B-MoT/A3B-MoT)와 호스티드 U1 Pro의 차...
메모리 쇼크로 AI 인프라를 소유하는 값은 사상 최고로 치솟는데, 키미 K3와 중국 오픈웨이트가 AI를 쓰는 값을 사상 최저로 끌어내렸습니다. 벌어지는 이 가위 사이에서 승부처는 모델이 아니라 활용률로 옮겨갑니다.
OpenAI가 GPT-5.6 Sol을 두고 사이버 레인지에서 새 기록을 세웠다고 발표했습니다. 프런티어 모델이 실제 공격 체인을 자율로 밟기 시작하면, 승부처는 모델의 성능이 아니라 그 모델을 어디에서 어떤 통제 아래 돌리느냐로 옮겨갑니다.
내 음성 에이전트의 어느 단계가 병목인지 벤더 SDK 없이 진단하는 공개 도구를 만들고, RunPod H200에서 우리 실제 스택(Qwen3-ASR·VoxCPM2·Qwen3-TTS)을 측정했습니다. STT는 빠르고, 비스트리밍 TTS가 진짜 병목이었습니다.
MoE 전문가를 CPU로 내려 24GB GPU 한 장으로 거대 모델을 돌린다는 ktransformers. 화제가 된 ‘28배’와 ‘40만 달러를 24GB로’를 RunPod에서 직접 쟀습니다. 트릭은 진짜였고, INT4 AMX 커널을 켜니 671B급이 디코딩 약 16 tok/s로 돌...
With GPT-5.6 shipping five or six reasoning effort settings per size, effort control has become table stakes for reasoning models. We dig into what training ...
SenseTime has released 日日新 SenseNova U1 under Apache 2.0. Its NEO-Unify architecture drops both the visual encoder and the VAE, handling understanding, gener...
A memory shock has pushed the cost of owning AI infrastructure to an all time high, while Kimi K3 and Chinese open weight models have dragged the cost of usi...
OpenAI announced that GPT-5.6 Sol set a new record on a cyber range. As frontier models begin autonomously executing real attack chains, the decisive factor ...
We built an open tool that diagnoses which stage of your voice agent is the bottleneck, without any vendor SDK, and measured our actual stack (Qwen3-ASR, Vox...
ktransformers claims you can run a giant MoE model on a single 24GB GPU by offloading experts to CPU. We tested the viral ‘28x’ and ‘$400K to 24GB’ claims by...
One clever agent hits a wall fast. So Paxis just sent the whole swarm.
مع طرح GPT-5.6 لخمسة أو ستة إعدادات لجهد الاستدلال لكل حجم، أصبح التحكم في الجهد ركيزة أساسية لنماذج الاستدلال. نتناول هنا وصفة التدريب الكامنة خلف التسمية ن...
أطلقت SenseTime نموذج 日日新 SenseNova U1 برخصة Apache 2.0. تعتمد بنية NEO-Unify التي تلغي كلاً من المشفر البصري و VAE، وتعالج الفهم والتوليد والتحرير والتوليد ...
دفعت صدمة الذاكرة تكلفة امتلاك البنية التحتية للذكاء الاصطناعي إلى أعلى مستوى في تاريخها، بينما خفض نموذج كيمي K3 والنماذج الصينية مفتوحة الأوزان تكلفة استخد...
أعلنت OpenAI أن GPT-5.6 Sol سجل رقماً قياسياً جديداً في ساحة اختبار سيبرانية. عندما تبدأ النماذج المتقدمة بتنفيذ سلاسل هجوم حقيقية بشكل مستقل، تنتقل نقطة الح...
بنينا أداة مفتوحة تُشخّص أي مرحلة من وكيل الصوت لديك هي نقطة الاختناق، دون أي SDK من مزود، وقسنا مكدسنا الفعلي (Qwen3-ASR وVoxCPM2 وQwen3-TTS) على وحدة RunPo...
تدّعي ktransformers أنه يمكنك تشغيل نموذج MoE ضخم على بطاقة GPU واحدة بسعة 24 جيجابايت عبر نقل الخبراء (experts) إلى وحدة المعالجة المركزية. اختبرنا الادعاءا...
랙 빌릴 돈이, 서랍 속 카드 한 장에 날아갔다ㅋ
Fable 5급이라 불리는 2.8T 오픈 모델 Kimi K3를 프로프라이어터리 IDE가 아니라 오픈소스 터미널 에이전트에 붙이는 실전 방법을 봅니다. OpenCode를 직접 설치해 프로바이더 연결 흐름까지 확인했습니다.
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다. 그 반복 작업만 작은 전용 모델로 떼어내 온프레미스에서 운영하면 호출당 비용이 크게 내려가고 데이터도 외부로 나가지 않습니다. 타키클라우드가 이 패턴을 직접 측정하고 전 과정을 공개했습니다.
Moonshot이 세계 최대 규모의 오픈웨이트 모델 Kimi K3를 공개했습니다. 프론트엔드 코딩 벤치마크에서 최상위 폐쇄 모델을 앞섰다는 점도 놀랍지만, 진짜 질문은 그 다음입니다. 2.8조 파라미터 모델을 자체 인프라에서 돌린다는 것은 실제로 무엇을 요구하는가. 타키클라우드 서...
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다. vLLM이 PagedAttention과 연속 배칭으로 GPU 낭비를 어떻게 줄이는지, 그리고 그것을 프로덕션에서 어떻게 운영하는지를 타키클라우드 서빙 관점에서 정리했습니다.
중국 키미 K3가 코딩 리더보드에서 클로드를 제쳤는데 실리콘밸리는 냉담합니다. 같은 주에 구글은 제미나이 3.5를 세 번째로 미뤘습니다. 성능 정점에서 산업이 깨닫는 진실은 하나입니다. 벤치마크 점수는 배포 신뢰를 사주지 못합니다.
Kimi K3, called Fable 5-class by many, can run inside an open-source terminal agent rather than a locked proprietary IDE. We installed OpenCode to verify the...
Most of an AI agent’s cost isn’t smart judgment — it’s simple, repetitive decisions made thousands of times a day. Peel those off into small specialized mode...
Moonshot has released Kimi K3, the largest open weight model in the world to date. What is striking is not just that it beat top closed models on a frontend ...
When you put an LLM into real service, most of the cost is decided not by the model itself but by the inference engine. Here’s how vLLM cuts GPU waste with P...
The rack you were about to rent is already in your drawer.
China’s Kimi K3 overtook Claude on the coding leaderboard, yet Silicon Valley stayed cold. The same week, Google delayed Gemini 3.5 for a third time. At the ...
يمكن تشغيل Kimi K3، الذي يصفه كثيرون بأنه من فئة Fable 5، داخل وكيل طرفية مفتوح المصدر بدلًا من بيئة تطوير مغلقة مملوكة. ثبّتنا OpenCode للتحقق من مسار اتصال...
معظم تكلفة وكيل الذكاء الاصطناعي ليست في الحكم الذكي، بل في قرارات بسيطة متكرّرة آلاف المرات يوميًا. افصل هذه المهام إلى نماذج صغيرة متخصّصة تعمل على بنيتك ا...
أطلقت Moonshot نموذج Kimi K3، أكبر نموذج مفتوح الأوزان في العالم حتى الآن. المثير ليس فقط تفوقه على أفضل النماذج المغلقة في اختبار برمجة الواجهات الأمامية، ب...
عند نشر نموذج لغوي كبير في خدمة حقيقية، تتحدد معظم التكلفة ليس باختيار النموذج، بل بمحرك الاستدلال الذي يشغّله. نستعرض كيف يقلل vLLM من هدر GPU عبر PagedAtte...
تجاوز نموذج كيمي K3 الصيني كلود في لوحة صدارة البرمجة، لكن وادي السيليكون استقبل الخبر ببرود. وفي الأسبوع نفسه، أجّلت جوجل جيميناي 3.5 للمرة الثالثة. والحقيق...
노력 눈금 최대로 땡겼더니, 청구서만 최대치더라ㅋ
에이전트 스킬이나 MCP 도구 카탈로그를 계속 늘려온 팀이라면 라우팅 정확도가 어느 순간부터 떨어지는 걸 체감했을 겁니다. 리트리버를 더 잘 만드는 대신 코퍼스 자체를 줄이면 어떻게 될까요. 2,164개 유닛을 가진 실제 프로덕션 하네스에서 회귀 없이 160개 스킬을 폐기한 실험을...
Google AI Edge의 Cormac Brick은 270M 파라미터의 FunctionGemma를 파인튜닝해 특정 에이전트 과제에서 정확도를 46%에서 90%로 끌어올린 사례를 발표했습니다. 핵심은 큰 모델을 부르는 대신, 작은 모델을 좁은 과제에 맞춰 폰 위에서 돌리는 것입니다...
Tencent이 공개한 Hy3 1-bit·4-bit GGUF 빌드는 295B MoE 모델을 598GB에서 85.5GiB까지 줄여 단일 GPU에서 돌립니다. 다만 여기서 말하는 단일 GPU는 128GB급 통합 메모리를 뜻하지, 16GB 소비자 카드가 아닙니다. 저희는 이 압축이 무엇...
Claude Code가 v2.1.101에서 /simplify를 /code-review로 바꾸면서 리뷰에 노력 단계를 붙였습니다. low와 medium은 확신 높은 소수의 지적만, high와 max는 넓은 커버리지와 불확실한 발견까지, ultra는 클라우드에서 여러 에이전트가 병렬로...
If your team has kept expanding its catalog of agent skills or MCP tools, you’ve probably felt routing accuracy start to slip at some point. What happens if,...
Google AI Edge’s Cormac Brick presented a case where fine-tuning the 270M-parameter FunctionGemma lifted accuracy on a specific agent task from 46% to 90%. T...
Tencent’s Hy3 1-bit and 4-bit GGUF builds shrink a 295B MoE from 598GB to 85.5GiB so it runs on a single GPU. But the single GPU here means a 128GB-class uni...
In v2.1.101 Claude Code renamed /simplify to /code-review and attached effort levels to the review. low and medium return a few high-confidence findings, hig...
We cranked the effort dial to max. So did the invoice.
إذا كان فريقك قد واصل توسيع كتالوج مهارات الوكيل (agent skills) أو أدوات MCP، فمن المرجح أنك لاحظت في مرحلة ما تراجع دقة التوجيه (routing accuracy). ماذا لو،...
عرض Cormac Brick من Google AI Edge حالة رفع فيها ضبطُ نموذج FunctionGemma بحجم 270 مليون معامل الدقةَ في مهمة وكيل محددة من 46% إلى 90%. الجوهر هو تشغيل نموذ...
تُقلّص نسخ Hy3 من Tencent بصيغة GGUF بدقة 1-bit و4-bit نموذج MoE بحجم 295B من 598GB إلى 85.5GiB ليعمل على وحدة معالجة رسومات واحدة. لكن المقصود بـ«وحدة واحدة...
في الإصدار v2.1.101 أعاد Claude Code تسمية /simplify إلى /code-review وأضاف مستويات الجهد إلى المراجعة. يعيد المستويان low وmedium عددًا قليلًا من النتائج عا...
AI가 AI를 하루만에 우등생 만듦ㅋ 근데 밤새 돌린 GPU는 누구 거임?
정적 마크다운으로 끝나던 아티팩트가 커넥터를 호출하는 살아 있는 앱이 됐습니다. 열 때마다 스스로 최신 데이터를 다시 긁어 오는 대시보드를 어떻게 만드는지 봅니다.
LLM 에이전트에게 K8s GPU 인시던트 원격조치를 맡기려는 팀이라면 결국 이 질문과 마주칩니다. 언제까지는 에이전트 혼자 고치게 두고, 언제부터는 사람을 불러야 하는가. 이 경계선을 감으로 정하지 않고 위험도 공식과 안전 상한선으로 계산해낸 논문을 소개합니다.
수직계열화의 상징 애플이 자체 칩을 포기하고 구글 GPU와 중국 라이벌 모델까지 빌립니다. 같은 날 한국은 정반대로 15GW 데이터센터를 소유하려 수십조를 쏟습니다. 두 방향이 가리키는 하나의 결론을 읽습니다.
PrismML이 공개한 Bonsai 27B는 Qwen3.6-27B를 새로 학습한 모델이 아니라, 아키텍처를 그대로 둔 채 가중치만 1-bit·ternary로 압축한 결과물입니다. Ternary 빌드는 5.9GB에서 FP16 품질의 94.6%를, 1-bit 빌드는 3.9GB에서 89...
터미널 6개를 띄워 놓고 응답을 기다리다 엔터만 누르는 하루. ‘멀티 클로딩’이라 불리는 이 새로운 노동이 개발자의 집중력을 갉아먹는 이유를 짚고, 감시자에서 오케스트레이터로 옮겨 가는 위임의 기술을 이야기합니다.
자가진화 하네스가 냈다는 이득은 ‘갱신을 잘 만드는 능력’과 ‘갱신을 잘 쓰는 능력’이 한 루프 안에서 뒤섞인 값입니다. 둘을 분리하면 어디에 예산을 써야 하는지가 뒤집힙니다.
에이전트가 코드베이스에서 생산적으로 일하지 못한다면, 그건 모델의 실패가 아니라 자동화의 실패입니다. 도메인 지식을 인프라로 옮기는 일은 엔지니어가 늘 해온 일의 자연스러운 확장입니다.
코딩 에이전트에게 자연어 프롬프트 두 개를 주면 비전 파운데이션 모델의 포스트트레이닝이 하루 만에 끝납니다. NVIDIA의 에이전트 스킬을 해부하고, 스킬을 일급 리소스로 다루는 우리 플랫폼에 무엇이 옮겨지는지 봅니다.
Artifacts used to end as static markdown. Now they’re living apps that call connectors. Here’s how to build a dashboard that pulls fresh data every time you ...
Any team trying to hand Kubernetes GPU incident remediation to an LLM agent eventually runs into this question: how long should the agent be left to fix thin...
Apple, the symbol of vertical integration, gives up its own chip and borrows Google’s GPUs and even a Chinese rival’s model. On the same day, Korea pours ten...
Bonsai 27B, released by PrismML, is not a newly trained model but the result of compressing Qwen3.6-27B’s weights to 1-bit and ternary while leaving the arch...
A day spent with six terminals open, waiting on responses and just smashing enter. This new kind of labor, called multi-Clauding, is quietly draining develop...
An AI tutored another AI to an A overnight. Whose GPUs paid for the study session?
The gains attributed to self-evolving harnesses are a mix of ‘the ability to produce good updates’ and ‘the ability to use those updates well,’ tangled toget...
If an agent can’t work productively in a codebase, that is not a failure of the model. It is a failure of automation. Moving domain knowledge into infrastruc...
Give a coding agent two natural-language prompts, and post-training a vision foundation model finishes in a single day. We dissect NVIDIA’s agent skill and l...
كانت الأعمال تنتهي كملفات ماركداون ثابتة. الآن أصبحت تطبيقات حية تستدعي الموصلات. نستعرض كيفية بناء لوحة معلومات تسحب بيانات جديدة في كل مرة تفتحها.
أي فريق يفكر في تكليف عميل LLM بمعالجة حوادث GPU في K8s عن بُعد سيصطدم في النهاية بهذا السؤال: إلى متى نترك العميل يصلح الأمور بمفرده، ومتى نستدعي الإنسان؟ ن...
آبل، رمز التكامل الرأسي، تتخلى عن رقاقاتها الخاصة وتستأجر وحدات معالجة رسوميات جوجل بل ونماذج منافسة صينية. في اليوم ذاته، تندفع كوريا الجنوبية في الاتجاه ال...
لا يُعد Bonsai 27B، الذي أصدرته PrismML، نموذجا تم تدريبه من جديد، بل هو نتيجة ضغط أوزان Qwen3.6-27B إلى صيغتي 1-bit وternary مع إبقاء البنية المعمارية كما ه...
يوم كامل مع ست نوافذ طرفية مفتوحة، تنتظر الردود وتضغط Enter فحسب. هذا النوع الجديد من العمل، المسمى multi-Clauding، يستنزف تركيز المطورين بهدوء. نبحث في السب...
المكاسب المنسوبة إلى الأدوات ذاتية التطور هي في الحقيقة مزيج بين ‘القدرة على إنتاج تحديثات جيدة’ و’القدرة على استخدام تلك التحديثات جيدًا’، متشابكتان داخل حل...
إذا لم يستطع الوكيل العمل بفعالية داخل قاعدة الكود، فذلك ليس فشلا في النموذج، بل فشل في الأتمتة. نقل المعرفة التخصصية إلى البنية التحتية هو امتداد طبيعي لما ...
بمطالبتين فقط بلغة طبيعية يُسلَّمان إلى وكيل برمجي، ينتهي التدريب اللاحق لنموذج رؤية أساسي في يوم واحد. نشرّح مهارة وكيل NVIDIA، وننظر إلى ما يمكن أن يُنقل م...
후보를 갈구던 AI, 자기부터 갈궈봤더니ㅋ
파인튜닝이 이길 줄 알고 시작했는데 데이터가 뒤집었습니다. 학습 없이 TDS를 지키는 생성기를 얻은 과정과, 유효한 화면이 좋은 화면은 아니라는 다음 숙제까지 정리합니다.
지금까지 새 모델 아키텍처는 두 번 만들어야 했습니다. 한 번은 학습·연구를 위한 Transformers에서, 또 한 번은 프로덕션 추론을 위한 vLLM에서요. vLLM v0.25.0의 네이티브 속도 Transformers 백엔드는 이 이중화를 끝냅니다. 원리는 torch.fx로 ...
대규모 모델을 여러 가속기에 나눠 학습하거나 서빙할 때, 실제 병목은 연산이 아니라 가속기 사이를 오가는 데이터입니다. 이 글은 all-reduce, all-gather, reduce-scatter, all-to-all 같은 컬렉티브 연산이 무엇인지, 그리고 이 연산들이 GPU 클...
한 개발자가 Codex에 어려운 /goal을 줄 때 ‘다른 스레드가 이 목표를 달성하도록 목표를 대신 써달라’고 먼저 요청한다는 팁을 공유했습니다. 얼핏 말장난처럼 들리지만, 그 안에는 검증 가능한 목표 명세를 모델에게 먼저 작성시키고 그 명세를 새 스레드에 위임한다는 실질적인 에...
We expected fine-tuning to win. The data said otherwise. Here’s how we ended up with a generator that respects TDS without any training, and the next problem...
Until now, every new model architecture had to be built twice: once in Transformers for training and research, and again in vLLM for production inference. vL...
When training or serving a large model across many accelerators, the real bottleneck usually isn’t computation, it’s the data moving between accelerators. Th...
The AI that grills candidates decided to grill itself first.
A developer shared a tip: when handing Codex a genuinely hard /goal, first ask it to write the goal so that another thread can achieve it. It sounds like wor...
بدأنا معتقدين أن الضبط الدقيق سيفوز، لكن البيانات قلبت التوقعات. نلخّص هنا كيف حصلنا على مولّد يحافظ على قواعد TDS دون أي تدريب، وصولًا إلى الدرس التالي: الش...
حتى الآن كان يجب بناء كل بنية نموذج مرتين: مرة في Transformers للتدريب والبحث، ومرة أخرى في vLLM للاستدلال الإنتاجي. خلفية Transformers بالسرعة الأصلية في vL...
عند تدريب أو تقديم نموذج كبير موزّع على عدة مسرّعات، لا تكون عملية الحساب هي عنق الزجاجة الحقيقي، بل البيانات المتنقلة بين المسرّعات. يشرح هذا المقال ماهية ا...
شارك أحد المطورين نصيحة: حين تُسند إلى Codex هدفًا /goal صعبًا حقًا، اطلب منه أولًا أن يكتب الهدف بحيث يستطيع خيط آخر تحقيقه. يبدو الأمر لعبًا بالكلمات، لكنه...
괴물 한 대를 못 사서, 갖고 있는 잡동사니를 다 엮어버림ㅋ
문서 OCR 파이프라인에 두 크기의 VLM을 얹은 엔지니어를 위한 글입니다. H200에서 실측한 결과, 신뢰도 임계값 하나로 어려운 문서만 대형 모델로 올려보내는 캐스케이드는 대형 모델과 같거나 조금 낮은 오류율을 그 비용의 약 60~67%에 달성했습니다.
GPT-5.6이 더 똑똑하냐가 아니라, 그 토큰을 누가 더 싸고 빠르게 서빙하느냐가 마진을 가릅니다. 모델을 나열하는 지도가 건너뛴 다섯 개의 스택 층 - 추론 실리콘, 서빙, 평가, 라이선스, 하니스 - 을 실제 수치로 지도화합니다.
Unsloth로 모델을 4비트로 줄이는 방법을 아는 팀은 많습니다. 그런데 그 파일을 실제로 EC2에 올릴지, SageMaker 엔드포인트로 감쌀지, EKS 파드로 띄울지 정하는 순간 대부분 막힙니다. AWS가 Unsloth와 함께 낸 배포 가이드는 이 질문에 명확한 지도를 제시합...
누군가 GLM-5.2에서 1403GB를 980GB로 줄였다고 했습니다. 양자화도, 프루닝도 아니고, 비트 단위로 완전히 동일한 무손실 압축이라고요. 처음엔 믿기 어려웠습니다. 그래서 직접 Qwen2.5-0.5B의 가중치 4억 9천만 개를 열어 BF16 지수 필드의 엔트로피를 측정했...
은행연합회는 더 똑똑한 모델이 아니라 도입의 순서를 발주했습니다. 오늘 규제 산업의 움직임을 뜯어보면, AI 도입의 진짜 승부처는 능력이 아니라 통제라는 사실이 드러납니다.
Even in an era where sub-billion-parameter, ultra-lightweight VLMs read documents well, the truly hard documents still need a large model. We introduce an an...
The question isn’t whether GPT-5.6 is smarter. It’s who serves those tokens cheaper and faster, because that’s what decides the margin. We map the five stack...
Plenty of teams know how to shrink a model to 4-bit with Unsloth. But the moment they have to decide whether to put that file on EC2, wrap it in a SageMaker ...
Someone claimed they shrank GLM-5.2 from 1403GB to 980GB. Not quantization, not pruning, but lossless compression that is bit-for-bit identical to the origin...
Couldn’t afford one monster, so we ganged up all the little ones.
The Korea Federation of Banks did not order a smarter model, it ordered a sequence for adoption. Reading today’s moves across regulated industries closely re...
حتى في عصر تقرأ فيه نماذج الرؤية واللغة الخفيفة جدًا، التي تقل معاملاتها عن مليار، المستندات جيدًا، لا تزال المستندات الصعبة حقًا بحاجة إلى نموذج كبير. نقدّم...
السؤال ليس ما إذا كان GPT-5.6 أذكى، بل من يقدّم تلك الرموز بتكلفة أقل وسرعة أعلى، لأن ذلك هو ما يحدد الهامش. نرسم خريطة للطبقات الخمس في المكدس التي تتجاهلها...
كثير من الفرق تعرف كيف تقلّص نموذجا إلى 4 بت باستخدام Unsloth. لكن لحظة اتخاذ القرار بوضع ذلك الملف على EC2، أو تغليفه في نقطة نهاية SageMaker، أو تشغيله كحج...
ادعى أحدهم أنه قلّص GLM-5.2 من 1403 غيغابايت إلى 980 غيغابايت. لا تكميم ولا تشذيب، بل ضغط بلا خسارة مطابق للأصل بت ببت. كان من الصعب تصديق ذلك، لذا فتحنا 490...
لم يطلب اتحاد المصارف الكوري نموذجا أكثر ذكاء، بل طلب ترتيبا لتبني الذكاء الاصطناعي. حين نفحص تحركات القطاعات الخاضعة للتنظيم اليوم عن قرب، يتضح أن نقطة الحس...
프로젝트만 던졌더니 알아서 다 깔아줌 — 근데 취향은 남의 취향이었다ㅋ
완전 자율로 매일 밤 논문을 만들어내는 파이프라인을 최종 결과물이 아니라 실제 운영 로그로 감사한 연구입니다. 8일 중 2026-07-08을 기점으로 언어 순도와 리뷰 통과율이 동시에 개선된 뚜렷한 전후 변화를 발견하고, 이를 6가지 최소 가드레일로 정리합니다.
코딩 에이전트는 오랫동안 텍스트만 읽어 왔습니다. claude-video는 yt-dlp·ffmpeg·Whisper를 얇게 엮어, 유튜브·Zoom·Loom·로컬 파일을 프레임 이미지와 타임스탬프 전사로 바꿔 Claude의 멀티모달 Read 컨텍스트에 넣습니다. GitHub 5,400...
This study audits a fully autonomous pipeline that generates a paper every night, not by inspecting the final output but by examining its actual operational ...
Drop your repo, it installs everything — someone else’s taste and all.
Coding agents have long read only text. claude-video thinly wires yt-dlp, ffmpeg, and Whisper together to turn YouTube, Zoom, Loom, or local files into frame...
تُدقق هذه الدراسة خط أنابيب مستقلاً بالكامل يُنتج بحثاً كل ليلة، ليس عبر فحص المخرجات النهائية بل عبر فحص سجلات تشغيله الفعلية. وعلى مدى ثمانية أيام، تكشف ال...
طالما اقتصرت وكلاء البرمجة على قراءة النص فقط. يربط claude-video بشكل رقيق بين yt-dlp وffmpeg وWhisper ليحوّل فيديوهات YouTube وZoom وLoom أو الملفات المحلية...
62만 개 화면을 다 참고했더니, 세상 앱이 다 한 앱이 됐다ㅋ
회사의 반복 업무를 스킬로 정의하면, 각 스킬이 실제로 어느 모델 티어까지 내려가도 되는지를 감이 아니라 측정으로 답할 수 있습니다. 가장 비싼 모델은 일을 시키는 데가 아니라 강등을 판정하는 데 씁니다. 16개 스킬 함대에서 10개를 중간 티어로 내린 실제 운영 기록입니다.
H200이나 Blackwell급 클러스터에서 MoE를 서빙하는 엔지니어라면, 어떤 전문가를 전정밀도로 지켜야 하는지가 핵심입니다. 실제 OLMoE-1B-7B 측정으로 답은 명확했습니다. 트래픽 많은 핫 전문가를 지키면 됩니다.
Claude Code와 Codex 같은 코딩 에이전트는 Anthropic API에 묶여 있습니다. free-claude-code는 그 사이에 Anthropic 호환 프록시를 끼워, 같은 에이전트 UI를 그대로 쓰면서 요청을 Ollama, llama.cpp, vLLM 같은 자체 호스...
vLLM v0.25.0이 232명의 기여자가 보낸 558개의 커밋과 함께 나왔습니다. 이번 릴리스의 핵심은 두 가지입니다. 첫째, Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 되었습니다. 둘째, vLLM을 처음 유명하게 만든 PagedAttention의 레거시...
값이 내려가면 덜 쓸까요. 추론 시장에서는 정반대의 일이 벌어지고 있습니다. 토큰 반값 경쟁과 삼바노바 5배 몸값이라는 모순을 제번스 역설로 읽고, 기업의 진짜 병목이 어디로 옮겨가는지 짚어봅니다.
에이전트 스킬을 프런티어 API로만 돌리면 호출 수천 번에 비용이 폭증합니다. 2026년 상반기 연구는 이 스킬을 1B~35B급 소형 모델에 증류해 로컬에서 자동 실행하는 길을 실전 단계로 끌어올렸습니다. 온폴리시 스킬 증류, 다교사 증류, 학습 없는 에이전트 증류 같은 최근 기법...
한 사람이 한 에이전트를 쓰던 구조에서, 여러 사람과 여러 에이전트가 같은 작업 공간에서 서로 대화하는 구조로 넘어가고 있습니다. 멀티플레이어 Claude Code를 계기로 협업 에이전트의 동시성·충돌·신뢰 경계 문제를 짚고 ThakiCloud 운영 관점에서 검증합니다.
When a company’s recurring work is defined as skills, each skill can tell you, through measurement rather than intuition, exactly how far down the model tier...
For engineers serving MoE models on H200 or Blackwell-class clusters, we introduce a paper that formalizes RASQ, an NVFP4 quantization policy that selectivel...
Coding agents like Claude Code and Codex are tied to the Anthropic API. free-claude-code sits an Anthropic-compatible proxy in between, letting teams keep th...
vLLM v0.25.0 landed with 558 commits from 232 contributors. Two changes define this release: Model Runner V2 is now the default execution path for every dens...
Browse 621,500 screens and somehow ship the exact same app as everyone else.
When prices fall, do we use less? In the inference market, the opposite is happening. We read the paradox of the token price war and SambaNova’s fivefold val...
Running agent skills exclusively on frontier APIs makes costs explode once you hit thousands of calls. Research from the first half of 2026 has pushed distil...
We are moving from a world where one person uses one agent to one where multiple people and multiple agents share a workspace and talk to each other. Using m...
عندما تُعرّف مهام الشركة المتكررة كمهارات، يمكن الإجابة عن السؤال الذي يحدد إلى أي مستوى نموذج يمكن أن تنحدر كل مهارة فعليا بالقياس لا بالحدس. النموذج الأكثر...
لمهندسي الخدمة الذين يشغّلون نماذج MoE على عناقيد من فئة H200 أو Blackwell، نقدّم ورقة بحثية تُصيغ RASQ، وهي سياسة تكميم NVFP4 تحمي بشكل انتقائي الموجّه والخ...
وكلاء البرمجة مثل Claude Code وCodex مرتبطون بشكل وثيق بواجهة برمجة تطبيقات Anthropic. يضع free-claude-code وسيطاً متوافقاً مع Anthropic بين الطرفين، فتحتفظ ...
صدر vLLM v0.25.0 بـ 558 التزامًا (commit) من 232 مساهمًا. يتمحور هذا الإصدار حول تغييرين رئيسيين: أولًا، أصبح Model Runner V2 هو مسار التنفيذ الافتراضي لجميع...
عندما تنخفض الأسعار، هل نستهلك أقل؟ في سوق الاستدلال (inference) يحدث العكس تماما. نقرأ التناقض بين حرب أسعار التوكنات المخفضة إلى النصف وقفزة تقييم سامبانوف...
إذا شُغّلت مهارات الوكلاء عبر واجهة نموذج حدودي فقط، تتضخم التكلفة مع آلاف الاستدعاءات. رفعت أبحاث النصف الأول من عام 2026 مسار تقطير هذه المهارات في نماذج ص...
ننتقل من بنية يستخدم فيها كل شخص عاملاً واحداً، إلى بنية يتحدث فيها عدة أشخاص وعدة عوامل مع بعضهم البعض في مساحة العمل نفسها. انطلاقاً من Claude Code متعدد ا...
약점 콕 집어 고치면 이긴대. 근데 파시스 약점은 ‘그만 풀기’였음ㅋ
모든 fan-out은 적대적 검증으로 닫아야 한다는 원칙은 널리 퍼져 있지만, 검증자 등급과 스켑틱 수를 얼마나 써야 하는지는 실측 없이 관행으로 정해져 왔습니다. 12개 findings와 180회 실제 API 호출로 이 가정을 검증한 결과를 소개합니다.
긴 호흡의 에이전트 작업을 RL로 학습할 때 GRPO의 그룹 샘플링은 가장 느린 롤아웃을 기다리느라 GPU를 놀립니다. 칭화대와 Z AI가 GLM-5.2 학습에 실제로 투입한 SAO는 그룹을 통째로 버리고 롤아웃 하나로 학습하며, 대신 양방향 토큰 클리핑으로 안정성을 지킵니다.
장기 실행 에이전트는 제한된 메모리 안에서 움직이지만, 지금까지의 메모리 기법은 관련성이나 요약 품질 같은 묘사적 기준으로 과거를 조직했습니다. Meta AI 연구자가 참여한 이 논문은 그 기준 자체가 틀렸다고 말합니다. 메모리의 가치는 과거를 충실히 묘사하는 데 있지 않고, 서로...
허깅페이스에서 GGUF 파일을 받아 실행 버튼만 누르는 사람과, 그 파일 안에 어떤 텐서가 몇 비트로 들어 있는지 아는 사람 사이에는 큰 차이가 있습니다. Qwen2.5-0.5B의 Q4_K_M 파일을 실제로 다운로드해 텐서 단위로 열어 보니, 이름과 달리 4비트 Q4_K는 전체의 ...
Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다. serve-sim은 시뮬레이터의 프레임버퍼를 브라우저로 스트리밍하고 WebSocket으로 제어까지 열어, AI 코딩 에이전트가 헤드리스 환경에서 iOS 앱을 빌드하고 실제로 조작하며 테스트하게 합...
OpenAI Codex 팀 엔지니어 jxnl이 공개한 personal-monorepo-template은 벡터DB 없이 폴더 구조와 AGENTS.md만으로 에이전트에 영구 기억을 부여합니다. 이 설계를 분해하고 스킬을 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
Claude Fable 5가 스펙 작성과 diff 리뷰를 지휘하고, 실제 코드 타이핑은 Grok 4.5가 전담하는 fable-advisor 플러그인의 지휘자-워커 분리 구조를 분해하고, 멀티에이전트를 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
The principle that every fan-out should close with adversarial verification is widely accepted, but how much verifier tier and how many skeptics to use has m...
When training long-horizon agentic tasks with RL, GRPO’s group sampling idles the GPU while it waits for the slowest rollout to finish. SAO, the method Tsing...
Long-running agents operate within limited memory, yet memory methods to date have organized the past using descriptive criteria such as relevance or summary...
There is a real gap between someone who downloads a GGUF file from Hugging Face and just clicks run, and someone who knows exactly which tensors are stored a...
Put a Mac Mini in the cloud and you lose the GUI, which means you lose the iOS Simulator too. serve-sim streams the simulator’s framebuffer to a browser and ...
Fix the one skill you lack and you win. Paxis’s missing skill? Knowing when to stop.
OpenAI Codex engineer jxnl has released personal-monorepo-template, which gives agents persistent memory through folder structure and an AGENTS.md file, no v...
We break down the conductor-worker split of the fable-advisor plugin, in which Claude Fable 5 conducts spec writing and diff review while Grok 4.5 handles th...
مبدأ إغلاق كل عملية fan-out بتحقق عدائي أصبح شائعاً على نطاق واسع، لكن مستوى نموذج التحقق وعدد المدققين المشككين المطلوبين لم يُحدد عبر القياس الفعلي بل بالع...
عند تدريب مهام الوكلاء الطويلة عبر التعلّم المعزز، يُبقي أخذ العينات الجماعي في GRPO وحدات GPU عاطلة في انتظار أبطأ rollout. استخدمت جامعة تسينغهوا وZ AI طري...
تعمل الوكلاء طويلة المدى ضمن ذاكرة محدودة، لكن أساليب الذاكرة حتى الآن كانت تنظّم الماضي وفق معايير وصفية مثل الصلة أو جودة التلخيص. هذه الورقة، التي شارك في...
هناك فرق حقيقي بين من يحمل ملف GGUF من Hugging Face ويضغط زر التشغيل فقط، ومن يعرف بالضبط أي المصفوفات (tensors) مخزنة وبكم بت داخل ذلك الملف. قمنا فعليا بتح...
عند وضع Mac Mini في السحابة، ينعدم وجود واجهة رسومية تتيح رؤية محاكي iOS. يبث serve-sim الإطارات المرئية للمحاكي إلى المتصفح، ويفتح أيضاً قناة تحكم عبر WebSo...
يمنح personal-monorepo-template الذي كشف عنه مهندس فريق OpenAI Codex، jxnl، العامل البرمجي ذاكرة دائمة عبر بنية مجلدات وملف AGENTS.md فقط، دون قاعدة بيانات م...
نحلل بنية الفصل بين الموجّه والعامل في إضافة fable-advisor، حيث يقود Claude Fable 5 كتابة المواصفات ومراجعة الفروقات (diff)، بينما يتولى Grok 4.5 وحده كتابة ...
1년째 ‘언젠가’ 리스트에 박아둔 에이전트, 열어보니 커피 식기 전에 끝남ㅋ
예일과 시카고대 연구진이 11,683편의 실제 논문으로 인간과 LLM의 연구 아이디어를 비교했습니다. 결론은 뜻밖입니다. LLM 아이디어의 문제는 품질이 아니라 폭입니다. 인간보다 훨씬 좁은 영역, 특히 ‘기존 연구 연결’에 4~5배 쏠려 있었습니다.
ARC-AGI-3는 설명서 없는 대화형 게임에서 에이전트가 스스로 상황을 파악하고 적응하는지를 측정합니다. GPT-5.6 Sol은 이 벤치마크를 7.78%로 처음 돌파했는데, 그 원동력은 더 나은 실행이 아니라 낯선 환경에서 먼저 방향을 잡는 정향 능력이었습니다.
요즘 RL 포스트트레이닝의 대세는 critic을 버리는 GRPO 계열입니다. 그런데 GLM-5.2는 value model을 되살린 PPO로 돌아가고, IcePop으로 학습-추론 불일치를 잡았습니다. 이 선택의 근거와 ThakiCloud 훈련 인프라 관점의 시사점을 정리합니다.
대규모 스킬 생태계를 운영하는 에이전트 하네스에서 라우팅 실패의 진짜 원인이 분해가 아니라 검색기라는 진단이 나온 뒤, 그 고치는 손을 사람에서 무인 루프로 옮기면 실제로 병목이 좁혀지는지를 실측한 연구입니다.
SpaceXAI가 Grok 4.5를 공개했습니다. 코딩과 에이전트를 위해 처음부터 훈련됐고, Opus급 성능을 백만 토큰당 입력 2달러·출력 6달러에 제공합니다. 값싼 에이전트 지능이 만드는 계산의 변화를 ThakiCloud 관점에서 짚습니다.
HBM4가 서버 랙 한 대 값을 2100만 달러로 밀어올리고, SK하이닉스는 하루 만에 40조를 조달했습니다. 자본과 전력이 진짜 병목이 된 지금, 승부는 비싼 컴퓨트에서 증명 가능한 일을 뽑아내는 소프트웨어 층으로 내려가고 있습니다.
같은 날 발표된 두 개의 숫자가 정반대로 움직였습니다. 2100만 달러짜리 AI 랙과 34배 싸진 추론 요금입니다. 이 벌어지는 가위의 한가운데에서 기업이 쥐어야 할 손잡이를 짚어봅니다.
마이크로소프트는 엑셀과 아웃룩의 대량 AI 요청을 자사 모델로 돌리기 시작했고, 중국 오픈 모델은 미국 기업 AI 사용량의 절반 가까이를 잠식했으며, 시장에서는 1조 달러가 넘는 시가총액이 하루아침에 사라졌습니다. 프리미엄 프론티어 모델을 영원히 결제한다는 가정이 무너지는 중입니다...
자연어 요청 한 번으로 프리미엄 랜딩페이지를 만든다는 Claude Code 스킬이 실제로 어떤 구조로 동작하는지 분해하고, 스킬을 일급 리소스로 다루는 ThakiCloud Paxis 관점에서 검증합니다.
Researchers at Yale and the University of Chicago compared human and LLM research ideas using 11,683 real papers. The conclusion is surprising. The problem w...
ARC-AGI-3 measures whether an agent can figure out a situation and adapt on its own inside an interactive game with no instructions. GPT-5.6 Sol became the f...
The dominant trend in RL post-training these days is the GRPO family, which drops the critic. GLM-5.2, however, went back to PPO with a revived value model a...
After a prior diagnosis found that the real cause of routing failures in a large skill ecosystem was the retriever rather than decomposition, this study meas...
SpaceXAI has unveiled Grok 4.5. Trained from the ground up for coding and agents, it delivers Opus-class performance at $2 per million input tokens and $6 pe...
HBM4 has pushed the price of a single server rack to 21 million dollars, and SK hynix raised 40 trillion won in a single day. Now that capital and power have...
Two numbers released on the same day moved in opposite directions: a 21 million dollar AI rack and inference pricing that got 34 times cheaper. Here is a loo...
Microsoft has started routing bulk AI requests from Excel and Outlook to its own models, Chinese open models now handle nearly half of some US enterprise AI ...
The agent you shelved for ‘someday’ takes less time than your coffee to cool.
A Claude Code skill that turns one plain request into a premium landing page. We take apart how it actually works and validate it from ThakiCloud’s Paxis vie...
قارن باحثون من Yale وجامعة Chicago بين أفكار البحث البشرية وأفكار LLM باستخدام 11,683 ورقة بحثية حقيقية. الخلاصة مفاجئة. مشكلة أفكار LLM ليست في الجودة، بل ف...
يقيس ARC-AGI-3 قدرة العميل الذكي على فهم الموقف والتكيّف بنفسه داخل لعبة تفاعلية بلا تعليمات. حقق GPT-5.6 Sol أول اختراق لهذا المقياس بنسبة 7.78%، وكان الداف...
التيار السائد اليوم في التدريب اللاحق بالتعلم المعزز هو عائلة GRPO التي تتخلى عن الـ critic. لكن GLM-5.2 عاد إلى PPO بإحياء نموذج القيمة، وعالج عدم التطابق ب...
بعد أن توصل تشخيص سابق إلى أن السبب الحقيقي لفشل التوجيه في نظام مهارات كبير هو محرك الاسترجاع وليس التفكيك، تقيس هذه الدراسة تجريبياً ما إذا كان نقل يد الإص...
كشفت SpaceXAI عن Grok 4.5. تم تدريبه من الأساس للبرمجة والوكلاء، ويقدم أداءً بمستوى Opus مقابل 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. نس...
دفعت شريحة HBM4 سعر رف خادم واحد إلى 21 مليون دولار، وجمعت SK hynix ما يعادل 40 تريليون وون في يوم واحد. الآن وقد أصبح رأس المال والطاقة هما الاختناق الحقيقي...
رقمان صدرا في اليوم نفسه تحركا في اتجاهين متضادين تماما: رف ذكاء اصطناعي بـ21 مليون دولار، ورسوم استدلال أرخص بـ34 ضعفا. إليك المقابض التي يجب أن تمسك بها ال...
بدأت مايكروسوفت بتوجيه طلبات الذكاء الاصطناعي الجماعية من Excel وOutlook إلى نماذجها الخاصة، وأصبحت النماذج الصينية المفتوحة تعالج ما يقارب نصف استخدام الذكا...
مهارة Claude Code تحوّل طلبًا بسيطًا إلى صفحة هبوط احترافية. نفكّك آلية عملها الحقيقية ونتحقق منها من منظور Paxis حيث تُعامَل المهارات كموارد من الدرجة الأولى.
기억이 ‘행동’이 됐다는데, 안 잊는 건 왜 요금뿐이냐ㅋ
뇌가 다 같으면, 비싼 뇌를 굳이 빌릴 이유가요?
수백 개 스킬을 라우팅하는 하네스에서 다음 투자를 분해에 할지 리트리버에 할지 두 숫자로 판별하는 진단법을 소개합니다. 실측 결과 병목은 둘 다 아니라 코퍼스 중복이었습니다.
장기 기억과 단기 기억을 서로 다른 휴리스틱으로 다루던 관행을 깨고, 저장·검색·요약·삭제를 에이전트의 행동 공간으로 통합한 AgeMem 논문을 분석하고 ThakiCloud 에이전트 플랫폼 관점에서 시사점을 정리합니다.
SpaceXAI가 공개한 Grok 4.5는 Opus 4.8과 GPT-5.5에 근접한 성능을 절반 이하 가격에 내놓았습니다. 벤치마크 몇 점 차이보다 태스크당 비용과 토큰 효율이 실무 선택을 좌우하는 국면이 왔습니다. 실제 공개 수치로 그 경제학을 뜯어보고, ThakiCloud의 모...
Anthropic의 Claude Fable 5가 프런트엔드 생성에서 새로운 기준을 세우고 있습니다. 스크롤로 제어되는 3D 씬, GLSL 셰이더, 스크린샷 기반 리디자인을 단일 프롬프트에서 뽑아내는 워크플로를 실제 공개 가이드와 오픈소스 갤러리를 근거로 정리하고, 코딩 에이전트를 ...
AI가 감각을 넓히고 손을 얻는 뉴스가 쏟아진 하루입니다. 그런데 도입을 실제로 가르는 질문은 성능이 아니라 ‘증거’로 옮겨가고 있습니다. 오늘 다이제스트를 그 렌즈로 다시 읽어봤습니다.
Claude Code를 사람이 매번 붙어 있지 않아도 돌아가게 만드는 네 가지 메커니즘을 정리하고, ThakiCloud가 실제 운용 중인 헤드리스 파이프라인·훅·서브에이전트·스킬 사례로 검증합니다.
11억 파라미터가 70억을 이기고 최고 모델이 공짜로 풀리는 날, 정작 기업을 멈칫하게 만든 뉴스는 지능이 아니라 ‘행동 기록’이었습니다. 오늘 시장이 갈라선 두 방향을 읽습니다.
For a harness that routes hundreds of skills, this diagnostic tells you with two numbers whether your next investment should go into decomposition or the ret...
AgeMem folds long-term and short-term memory management into the agent’s policy, exposing store, retrieve, summarize, and discard as tool-based actions. We a...
SpaceXAI’s newly released Grok 4.5 comes close to Opus 4.8 and GPT-5.5 in performance, at less than half the price. When benchmark gaps shrink to a point or ...
Anthropic’s Claude Fable 5 is setting a new bar for frontend generation. We look at real public guides and open-source galleries showing scroll-driven 3D sce...
Memory became an action space. Pity the only thing it never forgets is the invoice.
If every brain converges, why rent the pricey one?
A day full of news about AI expanding its senses and gaining hands. But the question that actually decides adoption is shifting from performance to ‘evidence...
Four mechanisms make Claude Code run without a human watching every step: headless mode, hooks, subagents, and skills. We verify each against ThakiCloud’s re...
On a day when a 1.1 billion parameter model beat a 7 billion parameter one and the best models got given away for free, the news that actually made enterpris...
لنظام يوجّه مئات المهارات، يخبرنا هذا التشخيص برقمين اثنين إن كان الاستثمار القادم يجب أن يذهب إلى التفكيك أم إلى المسترجِع. تبيّن أن الإجابة المقيسة لم تكن ...
يدمج AgeMem إدارة الذاكرة طويلة وقصيرة المدى داخل سياسة الوكيل، ويكشف عمليات التخزين والاسترجاع والتلخيص والحذف كأفعال قائمة على الأدوات. نحلّل المنهجية وتدر...
قدّمت SpaceXAI نموذج Grok 4.5 بأداء قريب جداً من Opus 4.8 وGPT-5.5، لكن بسعر أقل من النصف. حين تضيق الفجوة بين النماذج إلى نقطة أو نقطتين في الاختبارات المعي...
يضع Claude Fable 5 من Anthropic معيارًا جديدًا في توليد واجهات الويب الأمامية. نستعرض هنا، استنادًا إلى دليل عملي منشور ومعرض مفتوح المصدر حقيقيين، سير عمل ي...
يوم مليء بأخبار توسّع حواس الذكاء الاصطناعي واكتسابه لأيدٍ فعلية. لكن السؤال الذي يحدد التبني الفعلي ينتقل من الأداء إلى الدليل. أعدنا قراءة نشرة اليوم من هذ...
أربع آليات تجعل Claude Code يعمل دون مراقبة بشرية لكل خطوة: الوضع الرأسي (headless) والخطّافات (hooks) والوكلاء الفرعيون والمهارات. نتحقّق من كلٍّ منها مقابل...
في يوم تفوق فيه نموذج بـ1.1 مليار معامل على نظير له بـ7 مليارات، وأُتيحت فيه أفضل النماذج مجانا، لم يكن الخبر الذي أوقف الشركات فعلا عن الذكاء، بل عن سجل الس...
남 칩 찍어주다 몇 년 만에 흑자. 빌린 흑자는 남의 통장에 찍힌다.
서로 다른 데이터로, 서로 다른 목적으로 학습한 비전 모델과 언어 모델이 시간이 갈수록 데이터를 같은 방식으로 표현하기 시작합니다. MIT의 플라토닉 표현 가설(Platonic Representation Hypothesis)은 이 수렴이 우연이 아니라 규모와 능력이 커질수록 나타나...
온프렘 AI 플랫폼을 쓰는 병원이나 은행, 정부기관은 데이터가 엔클레이브 밖으로 새지 않았다는 것과 서빙된 모델 가중치가 감사받은 그 파일이 맞다는 것, 이 두 가지를 규제기관에게 증명해야 합니다. GPU 기밀 컴퓨팅의 원격 증명과 모델 프로버넌스는 지금까지 따로 발전해 온 두 기...
Anthropic이 2026년 7월 7일 ‘Getting started with loops’라는 첫 공식 루프 엔지니어링 문서를 공개했습니다. 매 단계를 사람이 프롬프트로 지시하는 방식에서, 에이전트를 대신 프롬프트해 주는 시스템을 설계하는 방식으로 넘어가는 전환입니다. 수동 루프...
Vision models and language models trained on different data for different objectives are starting to represent data in the same way. MIT’s Platonic Represent...
Hospitals, banks, and government agencies running on-premises AI platforms must prove two things to regulators: that data never leaked outside the enclave, a...
On July 7, 2026, Anthropic published its first official loop engineering document, ‘Getting started with loops.’ It marks the shift from a human prompting ev...
Years of making other people’s chips, finally in the black. Rented upside prints on someone else’s ledger.
نماذج الرؤية ونماذج اللغة المدرَّبة على بيانات مختلفة ولأهداف مختلفة بدأت تمثّل البيانات بالطريقة نفسها. تجادل فرضية التمثيل الأفلاطوني (Platonic Representat...
يجب على المستشفيات والبنوك والجهات الحكومية التي تشغّل منصات ذكاء اصطناعي محلية (on premises) أن تثبت للجهات التنظيمية أمرين: أن البيانات لم تتسرب خارج الحاو...
في السابع من يوليو 2026 نشرت Anthropic أول وثيقة رسمية عن هندسة الحلقات بعنوان ‘Getting started with loops’. إنها تحوّل من أن يوجّه الإنسان كل خطوة بأمر، إلى...
LLM을 채점자로 쓰는 ‘LLM-as-a-judge’는 이제 모델 개발의 기본값이지만, 2026년 들어 쌓인 증거는 단일 점수를 내는 스칼라 심판이 프롬프트와 위치에 취약하고 중간값으로 쏠리며 적대적 입력 앞에서 동전 던지기 수준으로 무너진다는 사실을 보여줍니다. 병원이나 은행, ...
모노레포에서 라이브러리 디렉터리와 소비 서비스 디렉터리를 오갈 때, 세션을 재시작하면 대화 맥락도 프롬프트 캐시도 함께 날아갑니다. Claude Code v2.1.169에 들어온 /cd 명령은 실행 중인 세션을 다른 디렉터리로 옮기면서 캐시를 그대로 유지합니다. 캐시 읽기(0.1배...
Using an LLM as a grader, the practice known as LLM-as-a-judge, is now the default in model development, but the evidence that piled up through 2026 shows th...
In a monorepo, switching between a library directory and the service that consumes it used to mean restarting your session, and with it, both your conversati...
أصبح استخدام نموذج لغوي كبير كمقيّم، وهو ما يعرف بـ LLM-as-a-judge، الممارسة الافتراضية في تطوير النماذج، لكن الأدلة التي تراكمت خلال عام 2026 تظهر أن الحكم ...
في المستودعات أحادية الجذر (monorepo)، عندما تتنقل بين مجلد مكتبة ومجلد خدمة تستهلكها، تؤدي إعادة تشغيل الجلسة إلى فقدان سياق المحادثة وإبطال ذاكرة التخزين ا...
대부분의 개발자는 세팅을 건너뛰고 바로 프롬프트를 칩니다. 그게 실수입니다. CLAUDE.md·rules·commands·skills·agents·hooks로 이어지는 .claude/ 폴더의 구조를, 스킬 1,671개가 도는 실제 프로덕션 프로젝트를 직접 측정해 뜯어봅니다. Tha...
dair.ai 주간 논문 정리에서 ThakiCloud 관점으로 세 편을 깊게 읽습니다. 메타인지 피드백으로 표준 RL을 최대 63% 넘어선 RLMF, 메모리를 학습 가능한 스킬로 다뤄 Qwen2.5-32B를 Opus 4.5급으로 끌어올린 AutoMem, LLM 통합 애플리케이션의 ...
AI control의 핵심 방어선인 ‘신뢰 못 하는 강한 모델을 약한 감시 모델로 통제한다’는 전제는 감시자와 정책 모델이 같은 텍스트를 읽는다는 가정 위에 서 있습니다. 온프렘 멀티테넌트 클러스터에서는 이 가정이 조용히 무너집니다. 서로 다른 토크나이저와 정규화 규칙이 감시자는 ...
구글 딥마인드가 공개한 약 57페이지 보고서 From AGI to ASI는 초지능을 먼 사고실험이 아니라 지금 준비해야 할 계획 문제로 다룹니다. 스케일링, 알고리즘 전환, 재귀적 자기개선, 다중 에이전트 집단 형성이라는 네 갈래 경로와 그 각각을 가로막는 물리적 한계를 짚습니다....
오픈 언어 모델의 다운로드와 추론 사용량을 한자리에서 측정한 ATOM 리포트는, 중국 오픈 모델이 2025년 여름 미국 진영을 추월한 뒤 격차를 벌려 왔다는 사실을 데이터로 보여 줍니다. Qwen 계열은 허깅페이스 누적 다운로드 약 10억 건을 넘겼고, OpenRouter 추론 시...
Most developers skip the setup and jump straight into prompting. That’s a mistake. We dissect the structure of the .claude/ folder, from CLAUDE.md to rules, ...
From dair.ai’s weekly paper roundup, we take a deep dive into three papers through a ThakiCloud lens: RLMF, which beats standard RL by up to 63% using metaco...
The core defense of AI control, the idea that an untrusted strong model can be controlled by a weaker, trusted monitor, rests on the assumption that the moni...
Google DeepMind’s roughly 57-page report From AGI to ASI treats superintelligence not as a distant thought experiment but as a planning problem to prepare fo...
The ATOM Report measures open language models across both downloads and inference usage in one place, and shows with data that Chinese open models overtook t...
معظم المطورين يتخطون الإعداد وينتقلون مباشرة إلى كتابة الأوامر النصية (prompts). هذا خطأ. نشرّح هنا بنية مجلد .claude/ الممتدة من CLAUDE.md إلى rules وcomman...
من نشرة dair.ai الأسبوعية لأوراق الذكاء الاصطناعي، نتعمق في قراءة ثلاث أوراق بحثية من منظور ThakiCloud. RLMF الذي يتفوق على التعلم المعزز القياسي بنسبة تصل إ...
يقوم خط الدفاع الأساسي في ضبط الذكاء الاصطناعي (AI control)، القائل بأن النموذج القوي غير الموثوق يمكن ضبطه عبر نموذج إشراف أضعف موثوق به، على افتراض أن نموذ...
يتعامل تقرير Google DeepMind المكوّن من نحو 57 صفحة From AGI to ASI مع الذكاء الفائق لا كتجربة فكرية بعيدة بل كمشكلة تخطيط ينبغي الاستعداد لها الآن. يرسم أرب...
يقيس تقرير ATOM النماذج اللغوية المفتوحة عبر التنزيلات واستخدام الاستدلال في مكان واحد، ويُظهر بالبيانات أن النماذج المفتوحة الصينية تجاوزت المعسكر الأمريكي ...
몸에 좋은 조합만 골라 담았는데, 냉장고 열쇠는 왜 쟤가 쥐고 있냐.
거대 LLM과 에이전트 스킬이 좋아질수록 파인튜닝은 필요 없어진다는 체감이 업계에 퍼지고 있습니다. 실제로 OpenAI는 셀프서브 파인튜닝 API를 접는 중입니다. 그런데 같은 한 달 동안 정반대 방향의 신호도 쏟아졌습니다. 19일간의 프론티어 모델 셧다운, 파인튜닝을 전제로 설계...
284B DeepSeek V4 Flash가 35B Qwen3.6보다 output 토큰이 5배 저렴한 역설을 roofline 모델로 해부합니다. KV 캐시 읽기, MoE 배치 경제학, 8xH100 서빙 형태 계산까지 추론 원가의 실제 구조를 숫자로 설명합니다.
GLM-5.2 743B MoE를 AMD MI355X 한 노드에서 2,626 tok/s/node로 서빙하고 Blackwell 대비 2배 이상 저렴하게 만든 사례를, MXFP4 양자화와 SGLang MoE 병렬화 관점에서 검증하고 ThakiCloud ai-platform의 멀티벤더 서...
작동하는 기계와 이해한 원리 사이의 간극은 과학사에서 늘 반복된 장면입니다. 컴퓨팅 파워로 모든 것을 밀어붙이는 지금, 에너지와 파동의 눈으로 딥러닝 시대를 다시 읽고 과학자가 가져야 할 겸손을 이야기합니다.
As frontier LLMs and agent skills keep improving, the industry has started to feel that fine-tuning is no longer necessary. OpenAI is, in fact, winding down ...
We dissect, with a roofline model, the paradox that the 284B DeepSeek V4 Flash prices its output tokens 5x cheaper than the 35B Qwen3.6. From KV cache reads ...
We examine a case of serving the GLM-5.2 743B MoE model on a single AMD MI355X node at 2,626 tok/s per node, at more than twice the cost efficiency of Blackw...
The gap between a machine that works and a principle we understand is one of the oldest scenes in the history of science. In an era that solves everything wi...
A perfectly healthy combo — pity someone else holds the fridge key.
كلما تحسّنت النماذج اللغوية الكبيرة ومهارات الوكلاء، ينتشر في الصناعة شعور بأن fine-tuning (الضبط الدقيق) لم يعد ضروريا. بل إن OpenAI بصدد إيقاف واجهة برمجة ...
نحلل، باستخدام نموذج roofline، المفارقة التي تجعل DeepSeek V4 Flash بحجم 284B مليار معلمة يسعّر رموز الإخراج بأرخص بخمسة أضعاف من Qwen3.6 بحجم 35B. من قراءات...
نتحقق من حالة خدمة GLM-5.2 743B MoE على عقدة واحدة من AMD MI355X بمعدل 2,626 tok/s لكل عقدة، بتكلفة أقل بأكثر من الضعف مقارنة بـ Blackwell، من زاوية تكميم MX...
الفجوة بين آلة تعمل ومبدأ نفهمه من أقدم المشاهد في تاريخ العلم. في عصر يحل كل شيء بالقوة الحاسوبية، تعيد هذه المقالة قراءة عصر التعلم العميق بعدسة الطاقة وال...
로켓 CEO의 창업 특강, 마지막 원칙이 곧 온프렘이었다.
Anthropic이 최신 모델용 프롬프팅 베스트 프랙티스를 정리한 공식 가이드를 뜯어봅니다. 모델별 차이, 핵심 기법(명료성·예시·XML·사고연쇄·역할·체이닝·확장 사고), 마이그레이션까지. ThakiCloud가 Paxis 스킬 하니스에서 프롬프트를 계약으로 굳히는 방식과 연결합니다.
tom_doerr가 공유한 최대 384GB VRAM Personal AI Computer 빌드 가이드를 출발점으로, VRAM이 어떻게 실행 가능한 모델을 결정하는지 계산으로 따져보고, 이 개인용 한 대를 조직 규모의 온프렘 서빙으로 올릴 때 무엇이 필요한지 ThakiCloud ai...
T3 창시자 Theo가 공유한 Claude Fable 5 운용 팁을 뜯어봅니다. effort 레벨 선택, Codex 오케스트레이션, CLAUDE.md 모델 우선순위, 토큰 무거운 작업 위임까지. ThakiCloud가 Paxis와 ai-platform에서 쓰는 모델 라우팅 규율과 나...
We work through Anthropic’s official guide to prompting best practices for the latest models. Model differences, the core techniques (clarity, examples, XML,...
Starting from the Personal AI Computer build guides shared by tom_doerr, which reach up to 384GB of VRAM, we work out through calculation how VRAM decides wh...
We unpack the Claude Fable 5 workflow tips shared by T3 creator Theo: effort levels, Codex orchestration, model priority in CLAUDE.md, and offloading token-h...
A rocket-CEO’s startup lecture, and the last rule was on-prem all along.
نستعرض دليل Anthropic الرسمي لأفضل ممارسات الموجّهات للنماذج الأحدث. فروق النماذج، والتقنيات الأساسية (الوضوح، الأمثلة، XML، سلسلة التفكير، الأدوار، التسلسل،...
انطلاقًا من أدلة بناء حاسوب الذكاء الاصطناعي الشخصي التي شاركها tom_doerr والتي تصل إلى 384GB من ذاكرة VRAM، نحسب كيف تحدد ذاكرة VRAM النماذج التي يمكن تشغيل...
نحلّل نصائح سير العمل مع Claude Fable 5 التي شاركها Theo مبتكر T3: مستويات الجهد، وتنسيق Codex، وأولوية النماذج في CLAUDE.md، وإسناد المهام كثيفة الرموز. ونض...
Claude Code의 아티팩트 기능이 Team·Enterprise를 넘어 Pro·Max 요금제까지 확대됐습니다. 세션의 작업을 실시간으로 갱신되는 공유 가능한 웹페이지로 바꾸는 이 기능을 뜯어보고, ThakiCloud의 Paxis와 ai-platform 관점에서 어떻게 쓸 수 있...
대부분의 에이전트 업무는 프론티어 모델이 필요 없습니다. 스킬을 비싼 모델로 한 번 완성한 뒤 포맷을 코드로 내리면, 같은 품질을 싼 모델로 돌릴 수 있습니다. 팩시스는 이 판단을 매일 밤 자동으로 측정하고, 안전할 때만 모델을 내리며, 품질이 흔들리면 되돌립니다. 실제 측정치와 ...
NVIDIA B200 두 장에서 Qwen3.6-27B-NVFP4와 gemma-4-26B-A4B를 대상으로 텐서병렬, 데이터병렬, Prefill/Decode 분리(1P1D)의 초당 생성 토큰을 실제로 측정했습니다. 두 장뿐일 때 총 처리량의 승자는 분리가 아니라 데이터병렬이었고, 이...
Claude Code artifacts have expanded beyond Team and Enterprise to the Pro and Max plans. We break down the feature that turns a coding session into a live, s...
Most agent work doesn’t need a frontier model. Build a skill once with an expensive model, push its format down into code, and you can run the same quality o...
We measured actual tokens-per-second across tensor parallelism, data parallelism, and Prefill/Decode disaggregation (1P1D) for Qwen3.6-27B-NVFP4 and gemma-4-...
توسّعت ميزة Artifacts في Claude Code لتتجاوز خطتي Team وEnterprise إلى خطتي Pro وMax. نحلّل الميزة التي تحوّل جلسة برمجية إلى صفحة ويب حية قابلة للمشاركة، ون...
معظم مهام الوكلاء لا تحتاج إلى نموذج طليعي. حين تُبنى المهارة مرة واحدة بنموذج مكلف ثم يُنقل التنسيق إلى الكود، يمكن تشغيل الجودة نفسها بنموذج أرخص. يقيس Pax...
قسنا فعلياً عدد الرموز المُولّدة في الثانية عبر التوازي على مستوى المُوتِّرات، والتوازي على مستوى البيانات، وفصل Prefill/Decode (1P1D) لنموذجَي Qwen3.6-27B-N...
87% 싸진 건 축하할 일인데, 주인만 바꾼 건 아니고요?
Claude Code 2.1.198에 추가된 /dataviz 스킬은 차트와 대시보드 설계 지침을 컨텍스트에 직접 로드합니다. 폼 휴리스틱, 색 공식, 실행 가능한 팔레트 검증기를 뜯어보고 ThakiCloud 플랫폼 관점에서 어떻게 활용할지 정리합니다.
NVIDIA가 Qwen3.6-27B를 NVFP4로 재양자화해 단일 Blackwell GPU에서 vLLM으로 바로 서빙할 수 있게 했습니다. MLP는 NVFP4로 내리고 어텐션과 KV 캐시는 FP8로 남기는 혼합 정밀도가 어떻게 22GB 안에 27B 모델을 담는지, 그리고 이 방식이...
앤트로픽이 공개한 Claude Fable 5 프롬프트 가이드를 뜯어봅니다. 이전 모델용 지시를 덜어내고, 진행을 도구 결과로 감사하고, 서브에이전트를 적극 쓰고, 지난 실행에서 배우고, 제약을 명시하라는 다섯 원칙을 ThakiCloud 에이전트 운영 관점에서 정리합니다.
LLM을 운영하면서도 KV 캐시가 왜 메모리를 잡아먹는지, GQA가 무엇을 절약하는지 설명하지 못한다면 최적화는 감에 의존하게 됩니다. amitshekhariitbhu/llm-internals는 토큰화, 어텐션 수식, 트랜스포머 블록, KV 캐시, MoE, GQA를 순서대로 엮은 ...
The /dataviz skill added in Claude Code 2.1.198 loads chart and dashboard design guidance directly into context. We break down the form heuristic, color form...
NVIDIA re-quantized Qwen3.6-27B to NVFP4 so it serves on a single Blackwell GPU with vLLM out of the box. We break down how the mixed precision (MLP in NVFP4...
We break down Anthropic’s official prompting guide for Claude Fable 5. It lays out five principles: strip out instructions written for older models, audit pr...
If you operate LLMs in production but can’t explain why the KV cache eats memory or what GQA actually saves, your optimization work is running on intuition. ...
87% cheaper is great. But you just swapped landlords, didn’t you?
مهارة /dataviz المضافة في الإصدار 2.1.198 من Claude Code تحمّل إرشادات تصميم الرسوم البيانية ولوحات المعلومات مباشرة إلى السياق. نستعرض قاعدة الشكل، وصيغة ال...
أعادت NVIDIA تكميم Qwen3.6-27B إلى NVFP4 ليُخدَم على GPU واحدة من Blackwell عبر vLLM مباشرةً. نفكّك كيف تُوائم الدقة المختلطة (MLP بصيغة NVFP4 والانتباه وذاك...
نحلل دليل التوجيه الرسمي الذي أصدرته Anthropic لنموذج Claude Fable 5. يطرح الدليل خمسة مبادئ: التخلص من التعليمات التي كُتبت للنماذج القديمة، ومراجعة التقدم ...
إذا كنت تشغّل LLM في الإنتاج ولا تستطيع أن تشرح لماذا يستهلك KV Cache هذا القدر من الذاكرة، أو ما الذي يوفره GQA بالضبط، فإن التحسين يصبح مجرد تخمين. مستودع ...
엔지니어·PM·디자이너가 프로토타이퍼·빌더·스위퍼·그로워·메인테이너로 녹아든다는데, 아무도 안 하려는 6번째가 있다.
스택이 통째로 남의 손에 넘어간 날, 파시스와 메티스의 대처법.
NVIDIA가 공개한 Qwen3.6-27B-NVFP4는 27B 하이브리드 어텐션 추론 모델을 4비트로 눌러 메모리를 약 2.5배 줄이면서도 FP8 대비 벤치마크 차이를 1%p 이내로 유지합니다. 지난 Gemma NVFP4가 Blackwell 전용이었던 것과 달리 이번 빌드는 Hop...
짧은 응답 요청이 긴 응답 요청에 밀려 기다리는 HoL 블로킹은 GPU 시간을 낭비하는 조용한 적입니다. 요청을 short-context 풀과 long-context 풀로 나눠 라우팅하는 Dual-Pool Token-Budget Routing은 arXiv 2604.08075에서 G...
엔지니어링·제품·디자인·데이터가 한 덩어리로 녹아드는 지금, Claude Code를 만든 보리스 체르니가 제안한 다섯 가지 역할 원형과 제품 생애주기별 팀 구성 공식을 살펴봅니다.
NVIDIA’s Qwen3.6-27B-NVFP4 compresses a 27B hybrid-attention reasoning model to 4-bit, cutting memory by roughly 2.5x while keeping benchmark gaps within 1 p...
Short requests waiting behind long ones in a single queue silently waste GPU time — this is Head-of-Line (HoL) blocking. Dual-Pool Token-Budget Routing, prop...
As engineering, product, design, and data blur into a single mass, Boris Cherny, the creator of Claude Code, proposes five role archetypes and a team-composi...
Roles blur into prototyper, builder, sweeper, grower, maintainer, and nobody wants the sixth.
The day the whole stack belonged to someone else, and Paxis and Metis cope.
نموذج Qwen3.6-27B-NVFP4 من NVIDIA يضغط نموذج استدلال بـ 27 مليار معامل ذا انتباه هجين إلى 4 بت، فيخفض الذاكرة بنحو 2.5 ضعف مع إبقاء فجوة المعايير ضمن نقطة وا...
الطلبات القصيرة التي تنتظر خلف الطلبات الطويلة في قائمة انتظار واحدة تُهدر وقت GPU في صمت — وهذا ما يُعرف بـ HoL Blocking. يقترح أسلوب Dual-Pool Token-Budget...
في عصر تتشابك فيه الهندسة والمنتج والتصميم والبيانات في كتلة واحدة، يستعرض هذا المقال النماذج الأصيلة الخمسة التي رصدها Boris Cherny صانع Claude Code، وصيغة ...
2026년 중반 오픈웨이트 모델은 프런티어와 3~6개월 격차로 좁혀졌고, 그 격차는 더 벌어지지 않고 있습니다. 이제 진짜 의사결정은 모델 성능이 아니라 어디서 어떻게 돌릴 것인가, 즉 self-hosting 경제학으로 옮겨갑니다. ThakiCloud의 K8s 서빙 관점에서 정리합...
By mid-2026, open-weight models had closed to within a 3-to-6-month capability gap of frontier labs, and that gap is no longer widening. The real decision ha...
في منتصف عام 2026، باتت النماذج مفتوحة الأوزان على بُعد ثلاثة إلى ستة أشهر من الحدود الأمامية، والفجوة لا تتسع. القرار الحقيقي الآن لم يعد عن أداء النموذج، ب...
NVIDIA가 공개한 GLM-5.2-NVFP4 체크포인트는 469B MoE 모델을 단일 Blackwell 노드(8× RTX PRO 6000)에서 vLLM으로 서빙할 수 있게 합니다. 혼합 정밀도 양자화 구조와 공식 서빙 명령을 정리하고, 공개 수치 기반 메모리 사이징을 직접 계산해...
The GLM-5.2-NVFP4 checkpoint published by NVIDIA lets you serve a 469B MoE model on a single Blackwell node (8x RTX PRO 6000) with vLLM. We break down the mi...
نقطة التفتيش GLM-5.2-NVFP4 التي أصدرتها NVIDIA تتيح تقديم نموذج MoE بحجم 469B على عقدة Blackwell واحدة (8× RTX PRO 6000) باستخدام vLLM. نحلّل بنية التكميم ال...
midudev이 공유해 화제가 된 browser-use의 video-use는 폴더에 원본 영상을 넣고 한 문장을 입력하면 컷 편집, 필러 제거, 자막, 색보정, 애니메이션, 렌더링까지 코딩 에이전트가 자동으로 끝내는 무료 오픈소스 스킬입니다. 컷마다 병렬 서브에이전트를 띄우는 이 ...
Z.ai의 1M 컨텍스트 오픈웨이트 모델 GLM-5.2의 후처리 학습을 떠받친 비동기 강화학습 인프라 slime이 완전 오픈소스로 공개되었습니다. Megatron 학습과 SGLang 롤아웃을 Data Buffer로 잇는 3-컴포넌트 구조, colocated/disaggregated...
코인베이스 CEO 브라이언 암스트롱이 공개한 AI 비용 통제법은 사용량 제한이나 경고 알림이 아니라 더 나은 기본값, 라우팅, 캐싱이었습니다. 직원의 91%가 애초에 사용 한도에 닿지도 않았다는 데이터를 근거로, 마찰을 늘리는 대신 LLM 게이트웨이의 기본 모델을 오픈웨이트로 바꾼...
Shared by midudev and quickly making the rounds, browser-use’s video-use is a free, open-source skill: drop raw footage into a folder, type one sentence, and...
slime, the asynchronous reinforcement-learning infrastructure behind the post-training of Z.ai’s 1M-context open-weight model GLM-5.2, has been fully open-so...
Coinbase CEO Brian Armstrong’s recipe for controlling AI cost was not usage caps or spend alerts, but better defaults, routing, and caching. Backed by the fi...
شاركها midudev فانتشرت بسرعة. مهارة video-use من فريق browser-use مفتوحة المصدر ومجانية بالكامل: ضع اللقطات الخام في مجلد، اكتب جملة واحدة، ويتولى الوكيل الب...
تم فتح المصدر بالكامل لإطار البنية التحتية للتعلّم المعزّز غير المتزامن slime، وهو الذي قاد مرحلة التدريب اللاحق للنموذج مفتوح الأوزان GLM-5.2 من Z.ai بسياق ...
وصفة الرئيس التنفيذي لـ Coinbase بريان أرمسترونغ للتحكم في كلفة الذكاء الاصطناعي لم تكن حدود الاستخدام ولا تنبيهات الإنفاق، بل إعدادات افتراضية أفضل وتوجيه و...
DeepReinforce가 2026년 6월 25일 공개한 Ornith-1.0은 모델이 자신의 강화학습 훈련 스캐폴드를 직접 작성하는 자가-스캐폴딩(self-scaffolding) 메커니즘으로 만든 오픈소스 코딩 모델 패밀리입니다. 9B/31B 밀집과 35B/397B MoE 네 가지...
NVIDIA가 ZAI의 753B MoE 추론 모델 GLM-5.2를 NVFP4(4비트)로 양자화해 Hugging Face에 공개했습니다. 모든 가중치를 일괄로 깎는 대신 MoE 전문가의 선형 연산자만 4비트로 줄이고 공유 전문가와 어텐션은 BF16으로 남기는 선택적 양자화로, FP8...
교수의 논문 작성 노하우를 Codex, Claude Code, Gemini 어디서나 불러 쓰는 Skill 패키지로 묶은 오픈소스 프로젝트가 화제입니다. 단순 프롬프트 모음과 무엇이 다른지, Agent Skill이라는 형식이 왜 중요한지, 그리고 수백 개의 Skill로 에이전트 플랫...
Released by DeepReinforce on June 25, 2026, Ornith-1.0 is an open-source coding model family built on a self-scaffolding mechanism: during reinforcement lear...
NVIDIA has released a NVFP4 (4-bit) quantization of ZAI’s 753B MoE reasoning model GLM-5.2 on Hugging Face. Rather than blanket-quantizing every weight, the ...
An open-source project bundles a professor’s paper-writing expertise into a Skill package that works across Codex, Claude Code, and Gemini. We examine how it...
Ornith-1.0 الصادر عن DeepReinforce في 25 يونيو 2026 هو عائلة نماذج برمجة مفتوحة المصدر تعتمد آلية التسقيل الذاتي (self-scaffolding)، حيث يكتب النموذج بنفسه س...
كمّمت NVIDIA نموذج الاستدلال GLM-5.2 من ZAI (MoE بحجم 753B) إلى NVFP4 (4 بت) ونشرته على Hugging Face. بدلاً من سحق كل الأوزان إلى 4 بت، تُكمَّم فقط المعاملات...
مشروع مفتوح المصدر يُحوّل خبرة الأستاذ في كتابة الأوراق البحثية إلى حزمة Skill قابلة للاستدعاء من Codex أو Claude Code أو Gemini. نستعرض الفارق عن مجموعات ال...
Ollama는 쉽고 vLLM은 빠르다는 통념을 2026년 RTX 4090 공개 벤치마크로 다시 검증합니다. 단일 사용자에서는 격차가 13% 안팎이지만, 동시 50명에서는 vLLM이 약 6배 처리량을 냅니다. PagedAttention과 연속 배칭이 만드는 확장 곡선의 차이, 그리고...
AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다. 정작 프로덕션에서 무너지는 지점은 루프를 멈추는 가드레일입니다. 외부 LLM 없이 순수 파이썬으로 가드레일이 붙은 최소 ReAct 루프를 직접 돌려, 단계 상한과 반복 탐...
The conventional wisdom that Ollama is easy and vLLM is fast gets re-examined with 2026 RTX 4090 public benchmarks. At a single user the gap is around 13%, b...
Most introductory guides to AI agents cover four pieces: the LLM brain, memory, tools, and the agent loop. What actually breaks in production is the part tha...
نعيد اختبار المفهوم الشائع بأن Ollama سهل وvLLM سريع، باستخدام معايير أداء RTX 4090 المنشورة عام 2026. الفجوة لا تتجاوز 13% عند مستخدم واحد، غير أنها تبلغ نح...
تقتصر معظم أدلة المبتدئين في وكلاء الذكاء الاصطناعي على شرح أربعة مكونات: دماغ نموذج اللغة الكبير، والذاكرة، والأدوات، وحلقة الوكيل. غير أن نقطة الانهيار الف...
Google DeepMind가 2026년 4월 공개한 Gemma 4는 E2B부터 31B까지 5종으로 구성된 멀티모달 오픈웨이트 패밀리입니다. Apache 2.0 라이선스, 256K 컨텍스트, 26B MoE와 31B Dense의 차이, 그리고 온프렘 서빙 관점에서 각 모델을 어떻게 ...
NVIDIA가 공개한 Gemma-4-26B-A4B-NVFP4를 DGX Spark 한 대에서 16배 병렬로 돌리면 스트림당 약 18토큰/초, 합산 약 300토큰/초가 나옵니다. 25.2B MoE를 4비트로 압축해 14GB대에 올리는 NVFP4의 원리, 단일 스트림 대 동시성의 트레이...
docker-android는 Android 에뮬레이터를 단일 컨테이너로 패키징해 헤드리스로 띄우는 오픈소스 프로젝트입니다. 이미지 크기와 KVM 요구사항을 실제 문서 기준으로 확인하고, ThakiCloud K8s 플랫폼에서 디바이스 패스스루 워크로드를 운용하는 관점을 정리합니다.
Released by Google DeepMind in April 2026, Gemma 4 is a multimodal open-weight family of five models spanning E2B to 31B. We break down the Apache 2.0 licens...
NVIDIA’s Gemma-4-26B-A4B-NVFP4 running 16 parallel streams on a single DGX Spark (128 GB unified memory) delivers roughly 18 tokens/s per stream and about 30...
docker-android packages an Android emulator into a single container and runs it headlessly. We verify image sizes and KVM requirements against the official d...
أصدرت Google DeepMind نموذج Gemma 4 في أبريل 2026، وهو عائلة متعددة الوسائط مفتوحة الأوزان مكوّنة من خمسة نماذج تمتد من E2B إلى 31B. نشرح رخصة Apache 2.0، وس...
نموذج Gemma-4-26B-A4B-NVFP4 الذي أصدرته NVIDIA يعمل على جهاز DGX Spark واحد (128 جيجابايت من الذاكرة الموحدة) بتوازي 16 ضعفاً، محققاً نحو 18 رمزاً في الثانية...
يُغلّف docker-android محاكي أندرويد في حاوية واحدة ويُشغّله بلا واجهة رسومية. نتحقق من أحجام الصور ومتطلبات KVM وفق التوثيق الرسمي، ونستعرض كيفية تشغيل أحمال...
Claude Code 안에서 슬래시 명령 한두 개로 1080p 영상을 렌더링하는 오픈소스 toolkit입니다. API 키 없이 examples/hello-world를 실제로 클론해 렌더했더니 750프레임 25초짜리 1080p 영상이 18초 만에 나왔습니다. 구조와 실측, 그리고 T...
An open-source toolkit that renders 1080p video from inside Claude Code with a couple of slash commands. I cloned examples/hello-world and rendered it with z...
أداة مفتوحة المصدر تعرض فيديو بدقة 1080p من داخل Claude Code بأمرين من أوامر الشرطة المائلة. استنسخت examples/hello-world وعرضته دون أي مفاتيح API، فخرج مقطع...
웹 디자이너 빅터 오디가 공개한 16분 튜토리얼은 Gemini 3.1로 사이트 구조를 짜고 Seedance 2.0으로 시네마틱 영상을 입혀, 과거 1만 달러를 받던 마케팅 사이트를 한 사람이 만드는 과정을 보여줍니다. 이 단일 운영자 워크플로가 무엇을 압축했는지, 그리고 멀티모달 ...
Anthropic이 Fable 5를 6월 22일까지만 구독 플랜에 무료로 포함하고, 23일부터는 종량제 크레딧으로 돌립니다. 프런티어 모델의 용량 경제학과, 그것이 LLM 소싱 전략과 소버린 AI에 주는 교훈을 ThakiCloud 관점에서 정리합니다.
AGI·인프라·노동이라는 세 렌즈로 AI의 미래를 달리 보는 허사비스, 황, 아모데이의 세계관을 비교하고, 불확실성이 겹치는 지금 빌더 조직이 각자에게서 무엇을 취해야 하는지 종합한다.
NVIDIA CEO 젠슨 황의 ‘엔지니어 1인당 수백 개 에이전트’ 비전이 현실화될 때 조직 구조와 일하는 방식은 어떻게 바뀌어야 하는가.
DeepMind CEO 허사비스의 ‘AGI와 거리가 멀다’ 발언을 출발점으로, AI 조직이 과대광고 대신 정직한 기대치 설정을 문화로 삼아야 하는 이유를 살핀다.
젠슨 황의 ‘시장이 붙인 별명’을 출발점으로, Moneyball 계승 심화, 데이터가 직관을 이기는 의사결정 문화를 어떻게 조직에 뿌리내릴 것인가
코드의 한계비용이 0에 수렴할 때, 엔지니어링 팀의 가치는 ‘무엇을 만드는가’에서 ‘무엇을 만들어야 하는가를 아는가’로 옮겨간다.
A 16-minute tutorial published by web designer Viktor Oddy demonstrates how one person can build a cinematic marketing site that once commanded $10,000 in fe...
Anthropic is including Fable 5 in subscription plans at no extra cost only through June 22, and from June 23 it shifts to pay-per-use credits. ThakiCloud exa...
A comparison of the worldviews of Hassabis, Huang, and Amodei, who read the same AI wave through three different lenses of AGI, infrastructure, and labor, an...
When NVIDIA CEO Jensen Huang’s vision of ‘hundreds of agents per engineer’ becomes reality, how must organizational structures and ways of working change?
Starting from DeepMind CEO Hassabis’s statement that we are ‘nowhere near AGI,’ this post explores why AI organizations should make honest expectation-settin...
Starting from a market-coined label about Jensen Huang, and deepening the Moneyball legacy, how to root a data-beats-intuition decision culture inside your o...
When the marginal cost of code approaches zero, the value of an engineering team shifts from ‘what we build’ to ‘knowing what should be built.’
يوضح برنامج تعليمي مدته 16 دقيقة نشره مصمم الويب فيكتور أودي كيف يمكن لشخص واحد بناء موقع تسويقي سينمائي كان يُكلّف عشرة آلاف دولار في السابق، وذلك باستخدام ...
تتضمّن Anthropic نموذج Fable 5 في خطط الاشتراك مجاناً حتى 22 يونيو فحسب، ومن 23 يونيو ينتقل إلى نظام الدفع حسب الاستخدام. تستعرض ThakiCloud اقتصاديات طاقة ال...
مقارنة بين رؤى هاسابيس وهوانغ وأموداي، الذين يقرؤون الموجة الذكائية الاصطناعية ذاتها من خلال ثلاثة عدسات مختلفة: الذكاء الاصطناعي العام، والبنية التحتية، وسو...
حين تتحقق رؤية الرئيس التنفيذي لـ NVIDIA جنسن هوانغ بـ’مئات الوكلاء لكل مهندس’، كيف يجب أن تتغير الهياكل التنظيمية وأساليب العمل؟
انطلاقًا من تصريح الرئيس التنفيذي لشركة DeepMind بأننا ‘لسنا قريبين على الإطلاق من الذكاء الاصطناعي العام’، نستعرض لماذا ينبغي لمنظمات الذكاء الاصطناعي أن تج...
انطلاقاً من لقب أطلقه المراقبون السوقيون على جنسن هوانغ، وتعمقاً في إرث Moneyball، كيف نُرسّخ ثقافة قرار تتفوق فيها البيانات على الحدس داخل المنظمة
حين يقترب التكلفة الحدية للكود من الصفر، تنتقل قيمة فريق الهندسة من ‘ماذا نبني’ إلى ‘معرفة ما يجب بناؤه’.
Moonshot AI의 Kimi K2.6은 1T 총 파라미터 중 32B만 활성화하는 MoE 구조로 dense 32B급 추론 비용을 유지하면서 256K 컨텍스트와 멀티모달을 지원한다. 300 서브에이전트 스웜 기능이 K8s 멀티테넌트 에이전트 환경과 자연스럽게 연결된다.
Z.ai의 GLM-5.2는 DSA(Dynamic Sparse Attention)로 1M 컨텍스트를 2.9x FLOPs 절감하며 처리한다. MIT 라이선스로 온프렘 배포가 자유롭고, GGUF 29종 양자화로 소비자급 GPU에서도 실행된다.
Microsoft가 공개한 FastContext-1.0-4B-SFT는 Qwen3-4B를 파인튜닝한 코딩 에이전트 서브에이전트 모델이다. READ/GLOB/GREP 세 가지 도구만 써서 저장소를 탐색하고 근거를 찾는다. 262K 컨텍스트, MIT 라이선스.
Google DeepMind가 공개한 DiffusionGemma-26B-A4B-it는 MoE 기반 VLM이되, 텍스트 생성을 autoregressive가 아니라 이산 확산(discrete diffusion)으로 수행한다. 25.2B 총 파라미터, 3.8B 활성, 256K 컨텍스트,...
lazarus19가 공개한 Vibe-Coding-Instruct는 Apache-2.0, 110만 개 코딩 instruction-response 쌍 데이터셋이다. 이미 7개 Gemma/Qwen 파생 모델을 훈련한 실적이 있으며, 커스텀 코드 에이전트 SFT 파이프라인 구축에 바로 쓸...
Glint-Research가 공개한 Fable 5(Claude Code) 에이전트 trace 4,665개. AGPL-3.0, HF Agent Traces 포맷, tool-use 81% 구성. 소형 모델 distillation과 자가호스팅 코드 에이전트 구축에 활용하는 실전 가이드.
agents-last-exam은 153개 장기 과제로 컴퓨터 사용 에이전트를 평가하는 벤치마크 데이터셋이다. Business, Computing, Engineering, Legal 등 5개 도메인, CC-BY-4.0 라이선스. 자체 모델 벤치마킹 파이프라인 구축 가이드.
Moonshot AI’s Kimi K2.6 is a MoE model with 1T total parameters but only 32B active per token, maintaining dense 32B inference costs while supporting 256K co...
Z.ai’s GLM-5.2 handles 1M context with 2.9x FLOPs savings using DSA (Dynamic Sparse Attention). The MIT license removes barriers to on-premises deployment, a...
Microsoft released FastContext-1.0-4B-SFT, a fine-tuned Qwen3-4B coding agent subagent model. It explores repositories using only three tools, READ, GLOB, an...
Google DeepMind released diffusiongemma-26B-A4B-it, a MoE-based VLM that generates text via discrete diffusion rather than autoregressive decoding. 25.2B tot...
Vibe-Coding-Instruct by lazarus19 is an Apache-2.0 dataset of 1.1 million coding instruction-response pairs. It has already been used to train 7 Gemma/Qwen d...
Glint-Research released 4,665 Fable 5 (Claude Code) agent traces in AGPL-3.0 under the HF Agent Traces format, with 81% tool-use composition. A practical gui...
agents-last-exam is a benchmark dataset of 153 long-horizon tasks for evaluating computer-use agents. Five domains including Business, Computing, Engineering...
يحتفظ Kimi K2.6 من Moonshot AI ببنية MoE تُنشّط 32B معاملًا فقط من أصل تريليون، محققًا تكلفة استدلال مماثلة لنماذج dense بحجم 32B مع دعم سياق 256K ومعالجة مت...
يعالج GLM-5.2 من Z.ai سياقًا بطول مليون رمز بتوفير 2.9x في FLOPs باستخدام DSA (الانتباه المتفرق الديناميكي). ترخيص MIT يتيح النشر المحلي بحرية، وتتوفر 29 نسخ...
FastContext-1.0-4B-SFT الصادر عن Microsoft هو نموذج وكيل فرعي مبني على Qwen3-4B ومخصص لاستكشاف مستودعات الشفرات. يستخدم ثلاثة أدوات فقط: READ وGLOB وGREP، وي...
أطلق Google DeepMind نموذج DiffusionGemma-26B-A4B-it، وهو نموذج متعدد الأوضاع مبني على بنية MoE، غير أنه يعتمد الانتشار المتقطع للنصوص بدلاً من التوليد التلق...
Vibe-Coding-Instruct الذي نشره lazarus19 مجموعة بيانات بأزواج تعليمات واستجابات برمجية تضم 1.1 مليون عينة برخصة Apache-2.0. استُخدمت بالفعل لتدريب 7 نماذج مش...
مجموعة بيانات تضم 4,665 أثراً لجلسات وكيل Fable 5 (Claude Code) نشرها Glint-Research. رخصة AGPL-3.0، بتنسيق HF Agent Traces، وتكوين tool-use بنسبة 81%. دليل ...
agents-last-exam مجموعة بيانات معيارية لتقييم وكلاء استخدام الحاسوب عبر 153 مهمة طويلة الأمد في خمسة مجالات: Business وComputing وEngineering وLegal وغيرها. ...
HTML, CSS, JavaScript, 이미지를 포함한 전체 웹사이트를 로컬 머신에 다운로드할 수 있는 강력한 Go 기반 웹사이트 클로너 Goclone 사용법을 배워보세요.
Learn how to use Goclone, a powerful Go-based website cloner that downloads entire websites including HTML, CSS, JavaScript, and images to your local machine.
تعلم كيفية استخدام Goclone، أداة قوية لاستنساخ المواقع تعتمد على Go لتنزيل مواقع الويب الكاملة بما في ذلك HTML و CSS و JavaScript والصور إلى جهازك المحلي.
RAGLight 프레임워크를 마스터하세요. RAG, Agentic RAG, RAT 파이프라인, MCP 통합을 통해 강력한 검색 증강 생성 시스템을 구축하는 실전 가이드입니다.
Master RAGLight framework with hands-on examples covering RAG, Agentic RAG, RAT pipelines, and MCP integration for building powerful retrieval-augmented gene...
إتقان إطار RAGLight مع أمثلة عملية تغطي RAG، Agentic RAG، RAT pipelines، وتكامل MCP لبناء أنظمة توليد معززة بالاسترجاع قوية.
LangGPT의 구조화된 프레임워크를 사용하여 고품질의 재사용 가능한 프롬프트를 만드는 방법을 배워보세요. 혼란스러운 프롬프트 엔지니어링을 체계적인 방법론으로 변환하는 템플릿, 예제, 모범 사례를 제공합니다.
Learn how to create high-quality, reusable prompts using LangGPT’s structured framework. Transform chaotic prompt engineering into systematic methodology wit...
تعلم كيفية إنشاء محفزات عالية الجودة وقابلة لإعادة الاستخدام باستخدام إطار عمل LangGPT المنظم. حول هندسة المحفزات الفوضوية إلى منهجية منظمة مع القوالب والأمث...
udocker를 사용하여 루트 권한 없이 Docker 컨테이너를 실행하는 방법을 배워보세요. HPC 환경, 공유 시스템, 보안 컨테이너 실행에 완벽한 솔루션입니다.
엔터프라이즈급 보안, 비용 제어, 벤더 유연성을 제공하는 오픈소스 AI 에이전트 오케스트레이터 Shannon의 설치부터 고급 멀티 에이전트 워크플로우까지 완전한 가이드를 제공합니다.
Learn how to run Docker containers without root privileges using udocker - perfect for HPC environments, shared systems, and secure container execution.
Learn how to set up and use Shannon, an open-source AI agent orchestrator with enterprise-grade security, cost controls, and vendor flexibility. A comprehens...
تعلم كيفية تشغيل حاويات Docker بدون صلاحيات الجذر باستخدام udocker - مثالي لبيئات الحوسبة عالية الأداء والأنظمة المشتركة والتشغيل الآمن للحاويات.
تعلم كيفية إعداد واستخدام Shannon، منسق وكلاء الذكاء الاصطناعي مفتوح المصدر مع أمان على مستوى المؤسسات وضوابط التكلفة ومرونة البائعين. دليل شامل من التثبيت إ...
Helm Dashboard에 대한 종합 튜토리얼 - 시각적 인터페이스로 Kubernetes 차트 관리를 단순화하고 리비전 히스토리와 손쉬운 롤백 기능을 제공하는 Helm의 필수 UI 도구.
A comprehensive tutorial on Helm Dashboard - the missing UI for Helm that simplifies Kubernetes chart management with visual interface, revision history, and...
برنامج تعليمي شامل حول Helm Dashboard - واجهة المستخدم المفقودة لـ Helm التي تبسط إدارة مخططات Kubernetes بواجهة مرئية وسجل المراجعات وإمكانيات الاستعادة الس...
GitHub Copilot, ChatGPT, Claude 등 AI 기반 코딩 도구를 마스터하여 개발 워크플로우를 가속화하고 더 나은 코드를 빠르게 작성하는 방법을 알아보세요.
Master AI-powered coding tools like GitHub Copilot, ChatGPT, and Claude to accelerate your development workflow and write better code faster.
تعلم كيفية إتقان أدوات البرمجة المدعومة بالذكاء الاصطناعي مثل GitHub Copilot وChatGPT وClaude لتسريع سير عمل التطوير وكتابة كود أفضل بشكل أسرع.
AI 코딩 에이전트를 위한 효과적인 에이전틱 루프 설계 방법을 마스터하세요. 안전 실습, 도구 선택, 실제 구현 전략을 학습합니다.
컨텍스트 엔지니어링을 마스터하세요 - 프롬프트 엔지니어링보다 10배, 바이브 코딩보다 100배 뛰어난 혁신적 접근법. AI 코딩 어시스턴트를 진정으로 효과적으로 만드는 방법을 배워보세요.
Master the art of designing effective agentic loops for AI coding agents. Learn safety practices, tool selection, and real-world implementation strategies.
Master Context Engineering - the revolutionary approach that’s 10x better than prompt engineering and 100x better than vibe coding. Learn how to make AI codi...
أتقن فن تصميم الحلقات الوكيلة الفعالة لوكلاء الترميز بالذكاء الاصطناعي. تعلم ممارسات الأمان واختيار الأدوات واستراتيجيات التنفيذ الواقعية.
أتقن هندسة السياق - النهج الثوري الذي يتفوق على هندسة التوجيهات بـ 10 أضعاف وعلى البرمجة العشوائية بـ 100 ضعف. تعلم كيفية جعل مساعدي البرمجة بالذكاء الاصطناع...
LandingAI의 Agentic Document Extraction 라이브러리를 활용한 지능형 문서 처리 마스터하기. 복잡한 PDF, 이미지, 문서에서 구조화된 데이터를 AI 파싱 기능으로 추출하는 방법을 학습합니다.
Master LandingAI’s Agentic Document Extraction library for intelligent document processing. Extract structured data from complex PDFs, images, and documents ...
إتقان مكتبة LandingAI’s Agentic Document Extraction لمعالجة المستندات الذكية. استخراج البيانات المنظمة من ملفات PDF والصور والمستندات المعقدة باستخدام قدرات ...
기술적 우수성은 모든 커리어의 기초이지만, 진정한 성장을 위해서는 기술적 능력, 제품 사고, 프로젝트 실행, 그리고 인간관계 기술이라는 네 가지 핵심 역량을 균형 있게 발전시켜야 합니다.
While technical excellence is the foundation of any career, true advancement requires mastering four essential disciplines: technical skill, product thinking...
بينما تُعد التميز التقني أساس أي مسار مهني، فإن النمو الحقيقي يتطلب إتقان أربع مهارات أساسية: المهارة التقنية، والتفكير في المنتج، وتنفيذ المشاريع، ومهارات ا...
LLM 후훈련을 위한 필수 데이터셋과 도구들을 탐구합니다. 지도 미세조정 데이터셋, 선호도 정렬 데이터, 그리고 고품질 AI 모델 구축을 위한 큐레이션 방법론을 다룹니다.
Explore the essential datasets and tools for LLM post-training, including supervised fine-tuning datasets, preference alignment data, and curation methodolog...
استكشف مجموعات البيانات والأدوات الأساسية للتدريب اللاحق للنماذج اللغوية الكبيرة، بما في ذلك مجموعات بيانات الضبط الدقيق المراقب وبيانات محاذاة التفضيلات ومن...
농업부터 e스포츠까지 다양한 분야의 엄선된 공개 데이터셋 컬렉션을 통해 전 세계 오픈 데이터 커뮤니티의 노하우를 만나보세요.
Discover the ultimate collection of curated public datasets across diverse domains, from agriculture to eSports, maintained by the global open data community.
اكتشف المجموعة النهائية من مجموعات البيانات العامة المنتقاة عبر مجالات متنوعة، من الزراعة إلى الرياضات الإلكترونية، يحتفظ بها مجتمع البيانات المفتوحة العالمي.
NVIDIA가 6백만 개의 다국어 추론 데이터셋을 공개하며 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 확장된 고품질 훈련 데이터를 제공합니다.
NVIDIA releases a 6-million-example multilingual reasoning dataset, providing high-quality training data expanded across five languages: French, Spanish, Ger...
تُطلق NVIDIA مجموعة بيانات استدلال متعددة اللغات تضم ستة ملايين مثال، وتوفر بيانات تدريب عالية الجودة تغطي خمس لغات: الفرنسية والإسبانية والألمانية والإيطالي...
64만 시간의 오디오 데이터로 구성된 NVIDIA의 최신 다언어 음성 인식 및 번역 데이터셋, Granary의 특징과 활용 방안을 알아봅니다.
NVIDIA’s latest multilingual speech recognition and translation dataset, Granary, covers 640,000 hours of audio across 25 European languages. This guide cove...
مجموعة بيانات NVIDIA Granary الصوتية متعددة اللغات تضم 640,000 ساعة من التسجيلات الصوتية عبر 25 لغة أوروبية. دليل شامل لخصائصها وأساليب توظيفها.
PDF, 이미지, 오디오 파일을 자동으로 구조화하는 오픈소스 AI 플랫폼 Rowfill의 핵심 기능과 활용법을 알아보세요.
Discover the core features and applications of Rowfill, an open-source AI platform that automatically structures PDF, image, and audio files.
اكتشف الميزات الأساسية وتطبيقات Rowfill، منصة الذكاء الاصطناعي مفتوحة المصدر التي تنظم ملفات PDF والصور والصوت تلقائياً.
Node.js/TypeScript로 구축된 AnyCrawl로 웹사이트를 LLM 친화적 데이터로 변환하고, Google/Bing SERP 결과를 효율적으로 수집하는 방법을 마스터해보세요.
Master how to transform websites into LLM-ready data and efficiently collect Google/Bing SERP results with AnyCrawl, built on Node.js/TypeScript.
أتقن كيفية تحويل مواقع الويب إلى بيانات جاهزة للنماذج اللغوية الكبيرة وجمع نتائج Google/Bing SERP بكفاءة باستخدام AnyCrawl المبني على Node.js/TypeScript.
ByteDance에서 공개한 Dolphin 프로젝트의 Fox 데이터셋과 벤치마크를 상세히 분석합니다. ACL 2025에 게재된 최신 문서 이해 기술과 3천만 개 이상의 샘플로 구성된 대규모 데이터셋을 알아보세요.
A detailed analysis of ByteDance’s Dolphin project Fox dataset and benchmark, including the Analyze-then-Parse paradigm from ACL 2025 and a large-scale datas...
تحليل مفصل لمجموعة بيانات Fox والاختبارات المرجعية لمشروع Dolphin الصادر عن ByteDance. تعرف على أحدث تقنيات فهم المستندات المنشورة في ACL 2025 ومجموعة البيان...
RedNote가 공개한 dots.ocr로 다국어 문서 레이아웃 분석과 OCR을 단일 비전-언어 모델에서 구현하는 방법을 알아봅니다.
How to implement multilingual document layout analysis and OCR in a single vision-language model using dots.ocr, released by RedNote.
استعراض النموذج البصري اللغوي dots.ocr الذي أصدرته RedNote، وكيفية تنفيذ تحليل تخطيط المستندات متعدد اللغات والتعرف الضوئي على الحروف في نموذج واحد.
프로덕션 환경에서 ML 애플리케이션을 구축하기 위해 필요한 핵심 기술 스택과 역량을 정리한 실무 중심 가이드
A practical guide outlining the core technology stack and competencies needed to build ML applications in production environments
دليل عملي يوضح المجموعة التقنية الأساسية والكفاءات المطلوبة لبناء تطبيقات التعلم الآلي في بيئات الإنتاج
Vibe Coding과 Agentic Coding이 가져온 새로운 개발 문화를 어떻게 받아들이고 발전시킬 것인가? 과거의 관습에서 벗어나 AI와 함께하는 협업 문화 구축 가이드
How to embrace and develop the new development culture brought by Vibe Coding and Agentic Coding? A guide to building collaborative culture with AI, breaking...
كيف نتبنى ونطور ثقافة التطوير الجديدة التي جلبتها البرمجة الإيقاعية والبرمجة الوكيلة؟ دليل لبناء ثقافة تعاونية مع الذكاء الاصطناعي، والانفصال عن التقاليد الس...
15분 설문과 행동 데이터로 팀 궁합을 정량화해 채용부터 온보딩까지 전 과정을 최적화하는 Saberr 알고리즘 활용법
데이터로 숨은 가치를 발굴해 자원 대비 최대 성과를 이끄는 머니볼 전략을 개발·제품·채용에 적용하는 방법
AI 시대의 개발자는 모든 것을 알 필요 없다. 해킹 마인드셋과 역엔지니어링 정신으로 무지를 강점으로 전환하는 새로운 패러다임을 탐구한다.
How to leverage Saberr algorithms to quantify team compatibility through 15-minute surveys and behavioral data, optimizing everything from hiring to onboarding
How to apply Moneyball strategy that discovers hidden value through data and achieves maximum performance relative to resources in development, product, and ...
In the AI era, developers don’t need to know everything. Explore a new paradigm that transforms ignorance into strength through hacking mindset and reverse e...
كيفية الاستفادة من خوارزميات سابر لقياس توافق الفريق من خلال استطلاعات 15 دقيقة والبيانات السلوكية، وتحسين كل شيء من التوظيف إلى الإعداد
كيفية تطبيق استراتيجية مونيبول التي تكتشف القيمة المخفية من خلال البيانات وتحقق أقصى أداء نسبة إلى الموارد في التطوير والمنتج والتوظيف
في عصر الذكاء الاصطناعي، لا يحتاج المطورون لمعرفة كل شيء. استكشف نموذجاً جديداً يحول الجهل إلى قوة من خلال عقلية القرصنة وروح الهندسة العكسية.
AI 엔지니어링을 시작하려는 분들을 위한 학습 로드맵입니다. 순서대로 따라가도 되고, 관심 있는 영역부터 먼저 파도 됩니다.
We’re sharing a learning roadmap for those who want to start AI engineering. This roadmap is structured to allow step-by-step learning of the core areas of A...
نحن نشارك خريطة طريق التعلم لأولئك الذين يريدون بدء هندسة الذكاء الاصطناعي. هذه الخريطة منظمة للسماح بالتعلم التدريجي للمجالات الأساسية لهندسة الذكاء الاصطنا...
백엔드·인프라 엔지니어 채용을 위한 10대 필독서와 실무 적용 사례를 통해 우리가 찾는 인재상과 채용 기준을 소개합니다.
Introducing the ideal candidate profile and hiring criteria through 10 must-read books for backend·infrastructure engineer recruitment and practical applicat...
تقديم الملف المثالي للمرشح ومعايير التوظيف من خلال 10 كتب يجب قراءتها لتوظيف مهندس البنية التحتية والخلفية وحالات التطبيق العملية.
ThakiCloud의 Three Vs(속도, 검증, 버전관리) 기반 MLOps 문화와 실전 사례, 그리고 함께할 동료를 찾는 채용 안내를 담았습니다.
KCD Seoul 2025에서 발표한 자료를 공유합니다. xPU as a Service 기반 Agentic AI 플랫폼Thaki Cloud에 대한 내용입니다
ThakiCloud’s Three Vs (Velocity, Validation, Versioning) based MLOps culture and practical cases, plus recruitment information for colleagues to join us.
Sharing materials presented at KCD Seoul 2025. Content about Thaki Cloud, an xPU as a Service-based Agentic AI platform
ثقافة MLOps القائمة على Three Vs (السرعة، التحقق، الإصدار) في ThakiCloud والحالات العملية، بالإضافة إلى معلومات التوظيف للزملاء للانضمام إلينا.
مشاركة المواد المقدمة في KCD Seoul 2025. محتوى حول Thaki Cloud، منصة الذكاء الاصطناعي الوكيلي القائمة على xPU كخدمة
Thaki Cloud의 기업 문화, 복지, 개발자들의 이야기, 채용 정보 등을 공유합니다.
Thaki Cloud의 미션, 원칙, 그리고 가치를 공유합니다.
Sharing Thaki Cloud’s corporate culture, benefits, developer stories, recruitment information, and more.
Sharing Thaki Cloud’s mission, principles, and values.
مشاركة ثقافة الشركة والمزايا وقصص المطورين ومعلومات التوظيف في Thaki Cloud والمزيد.
مشاركة مهمة ومبادئ وقيم Thaki Cloud.