통과율만 보면 안 보이는 실패: YouTube 광고팀의 프로덕션 Eval 운영법
프롬프트를 잘 쓰면 에이전트가 말을 듣는다는 기대는 데모까지만 유효하다. 프로덕션에 올리면 같은 프롬프트, 같은 입력에도 실행마다 결과가 달라진다. 어제 통과한 케이스가 오늘 실패하고, 어제 실패한 케이스가 오늘 통과한다. 이 상태에서 “출시해도 되는가"를 판단하려면 감이 아니라 측정 장치가 필요하다.
더 보기Eval 없는 Agent Skill은 배포하지 마라: Philipp Schmid의 스킬 테스트 방법론과 SkillsBench
Claude Code, Gemini CLI, Codex 같은 코딩 에이전트를 쓰다 보면 자연스럽게 스킬(Agent Skill)을 만들게 된다. 사내 코딩 컨벤션, 특정 SDK 사용법, 배포 절차 같은 지식을 Markdown 파일로 정리해 에이전트에게 물려주는 방식이다. 문제는 거의 아무도 이 스킬을 테스트하지 않는다는 점이다. 코드는 테스트 없이 배포하지 않으면서, 에이전트의 행동을 바꾸는 스킬은 몇 번 돌려 보고 “괜찮네” 수준의 감으로 배포한다.
더 보기GPT-5.6 Sol·Terra·Luna 코딩 에이전트 모델 선택 가이드
GPT-5.6 이야기를 하다 보면 “Luna Max가 Terra High보다 낫다더라” 식의 서열이 자주 돌아다닙니다. 이 문장은 애초에 성립하지 않는 비교입니다. Sol·Terra·Luna는 서로 다른 모델(능력 티어)이고, max·high·xhigh·ultra는 같은 모델 안에서 얼마나 오래 생각하고 얼마나 많은 에이전트를 병렬로 굴릴지 정하는 설정입니다. 티어와 설정을 한 줄로 섞어 서열화하면 비교 축이 다른 값을 나란히 놓는 셈입니다.
더 보기On-Policy Distillation: RL과 SFT 사이의 빈틈을 메우는 법
포스트 트레이닝에서 흔히 쓰는 두 방법에는 각자 구멍이 있습니다. SFT(supervised fine-tuning)는 교사가 만든 정답 시퀀스를 그대로 모방시키는데, 학생이 실제로 방문할 상태가 아닌 곳에서 배우다 보니 추론 단계가 길어질수록 오차가 쌓입니다. RL(강화학습)은 학생이 직접 생성한 궤적으로 배우니 이 문제는 없지만, 보상이 에피소드 하나당 한두 비트로 끝나는 경우가 많아 학습 신호가 지나치게 희박합니다. Thinking Machines Lab이 2025년 10월 공개한 글은 이 둘의 장점만 남기는 조합을 제안합니다. 학생이 스스로 궤적을 만들고, 강한 교사 모델이 그 궤적의 토큰 하나하나에 점수를 매기는 방식입니다.
더 보기AI 자기개선은 모델 밖 하네스에서 먼저 온다
AI가 스스로를 개선한다는 말을 들으면 보통 모델이 자기 가중치를 고치는 장면을 떠올립니다. 그런데 릴리안 웽(Lilian Weng)이 2026년 7월 4일 자신의 블로그 Lil’Log에 올린 글은 다른 그림을 보여줍니다. 당장 눈에 띄는 재귀적 자기개선(recursive self-improvement, RSI)은 모델 내부가 아니라 모델을 둘러싼 실행 환경, 즉 하네스(harness)에서 먼저 나타난다는 주장입니다. 이 글은 그 논지를 하네스 개념부터 위험까지 순서대로 정리합니다.
더 보기Hermes Agent v0.18: 스스로 배우는 에이전트와 MoA가 만났을 때
Nous Research가 만든 오픈소스 에이전트 Hermes Agent가 2026년 7월 1일 v0.18.0을 냈습니다. 릴리스 노트는 이번 버전을 “The Judgment Release"라고 부릅니다. 새 명령어 몇 개를 더한 마이너 업데이트로 보면 핵심을 놓치기 쉽습니다. 공식 문서는 Hermes Agent를 “스스로 배우는 AI 에이전트"라고 소개하는데, 실제로 이 프로젝트는 쓸수록 메모리와 스킬을 쌓아가는 학습 루프를 핵심 설계로 삼고 있습니다. 이 글은 그 자기개선 루프가 v0.18에서 어떻게 다듬어졌는지, 그리고 같은 버전에서 정식 모델 선택지가 된 Mixture of Agents(MoA)가 이 루프 안에서 어떤 역할을 맡는지를 정리합니다.
더 보기TradingAgents: LLM 에이전트로 만든 트레이딩 회사, 논문과 코드 읽기
먼저 밝혀둡니다. 이 글은 투자 조언이 아니고, 매수나 매도를 권하지도 않습니다. LLM 에이전트를 어떻게 조직해 하나의 의사결정을 만들어내는지, 그 설계를 연구와 코드 관점에서 읽는 글입니다. 트레이딩은 그 설계가 적용된 도메인일 뿐입니다.
더 보기Harness-1: 상태 외부화 하네스로 학습한 검색 에이전트
검색 에이전트와 상태 관리 문제 검색 에이전트(search agent)는 질문 하나에 답하기 위해 여러 차례 검색을 반복하는 AI 에이전트다. 키워드 하나로 끝나는 단순 검색과 달리, 중간 결과를 보면서 다음 검색 전략을 조정하고, 문서를 비교하고, 주장의 근거가 실제로 있는지 확인하는 과정을 거친다. 금융 공시 분석, 복잡한 법령 해석, 멀티홉 사실 확인처럼 한 번의 검색으로 답이 나오지 않는 작업에 쓰인다.
더 보기LLM Observability 오픈소스 스택: LangSmith 대안 5종 비교
LLM 앱이나 AI 에이전트를 운영하다 보면 “어떤 프롬프트가 실패했고, 어떤 도구 호출이 막혔고, 왜 에이전트가 루프에 빠졌는가"를 추적해야 하는 시점이 온다. LangSmith는 LangChain이 만든 상용 LLM 관측 플랫폼으로, trace 시각화, 프롬프트 버저닝, eval을 한 곳에서 제공한다. 사실상 기본 선택지로 자리 잡았지만, 사용량 기반 과금과 클라우드 중심 호스팅이 제약으로 작용해 자체 호스팅과 오픈소스를 선호하는 팀들이 대안을 찾기 시작했다. trace에는 사용자 입력과 내부 프롬프트가 그대로 담기기 때문에, 이 데이터가 외부 SaaS로 나가는 것 자체가 부담인 조직도 많다.
더 보기DeepSWE: 코딩 에이전트를 장기 과제로 평가하는 벤치마크
코딩 에이전트를 평가할 때 SWE-bench가 오랫동안 기준이었습니다. 그런데 SWE-bench의 태스크 대부분은 단일 파일 버그 수정이고, 정답이 이미 공개 커밋에 있습니다. 에이전트가 모델 학습 데이터에서 본 답을 그대로 재현하는 건지, 진짜로 코드를 이해하고 고치는 건지 구분하기 어렵습니다.
더 보기Mixture of Agents(MoA): 여러 LLM을 쌓아 GPT-4 Omni를 넘은 방법
모델 한 개를 더 크게 만드는 대신, 여러 모델을 계층으로 쌓아 서로의 출력을 다듬게 하는 방법이 있습니다. Together AI 연구진이 2024년 6월 발표한 논문 arXiv:2406.04692가 이 접근을 MoA(Mixture of Agents)라는 이름으로 정리했습니다. 오픈소스 모델만 조합한 MoA가 AlpacaEval 2.0에서 GPT-4 Omni를 7.6%p 앞섰습니다.
더 보기Open Knowledge Format(OKF): 에이전트용 지식 표현 개방형 포맷
AI 에이전트가 실패하는 원인을 들여다보면 모델 성능보다 맥락의 부재가 먼저 나오는 경우가 많습니다. 테이블 스키마, 지표 계산법, 장애 대응 런북, 두 시스템 사이의 join path가 카탈로그 벤더, 사내 위키, 코드 주석, 개인 노트에 흩어져 있고, 에이전트 개발자마다 같은 context assembly 문제를 처음부터 다시 풉니다.
더 보기Qwen3.6-35B-A3B 커뮤니티 리뷰: uncensored 변종, MTP 가속, Hermes 호환
Alibaba가 2026년 4월 출시한 Qwen3.6-35B-A3B는 총 파라미터 35B에 토큰당 활성 파라미터 약 3B인 MoE 모델이다. 기본 컨텍스트 262K, 공식 SWE-bench 점수 73.4%. 출시 두 달 만에 로컬 LLM 커뮤니티에서 가장 많이 테스트된 35B급 모델이 됐다.
더 보기Robot Learning: A Tutorial (고전 로보틱스에서 VLA까지)
“Robot Learning: A Tutorial”(arXiv:2510.12403)은 Francesco Capuano, Caroline Pascal, Adil Zouitine, Thomas Wolf, Michel Aractingi가 쓴 논문 형식의 튜토리얼입니다. University of Oxford와 Hugging Face 소속 저자들이 LeRobot 라이브러리를 바탕으로 고전 로보틱스부터 강화학습, 모방 학습, Vision-Language-Action(VLA) 모델까지 로봇 학습의 전체 흐름을 한 편에 담았습니다.
더 보기VibeThinker-3B: 검증 가능한 추론을 3B 모델에 압축한 실험
“작은 모델이 큰 모델을 이겼다"는 주장은 논문마다 나옵니다. 보통은 특정 벤치마크 하나에서의 결과를 두고 하는 말입니다. Sina Weibo의 WeiboAI팀이 2026년 6월 15일 공개한 VibeThinker-3B 역시 비슷한 구조의 주장을 합니다. 다만 논문이 조심스럽게 선을 긋는 부분이 있습니다. “작은 모델이 모든 걸 대체한다"가 아니라, 검증 가능한 추론(verifiable reasoning) 영역만큼은 작은 모델로 압축될 수 있다는 겁니다.
더 보기Future AGI: AI 에이전트 평가·관찰·개선을 한곳에서
AI 에이전트를 만들어 본 사람은 이 장면이 익숙합니다. 데모는 잘 돕니다. 그런데 프로덕션에 올리면 환각이 터지고, 뭐가 왜 틀렸는지 추적이 안 됩니다. 그래서 평가 도구 하나, 관측 도구 하나, 가드레일 하나를 따로 붙이죠. 진짜 문제는 이것들이 서로 말을 안 한다는 겁니다. 고치는 루프가 닫히지 않습니다.
더 보기태그
- A2a
- Act
- Agent
- Agent-Debate
- Agent-Finance
- Agent-Harness
- Agent-Skills
- Agentic-Payments
- Ai-Agent
- Ai-Architecture
- Ai-Blockchain
- Akash
- Apify
- Base
- Benchmark
- Bitcoin
- Bittensor
- Capital-Markets
- Ccip
- Cctp
- Chainlink
- Circle
- Coding
- Coding-Agent
- Coinbase
- Compliance
- Context-Engineering
- Cross-Chain
- Cryptography
- Decentralized-Compute
- Depin
- Dex
- Diffusion-Policy
- Distillation
- Eip
- Eip-3009
- Ensemble
- Erc-8001
- Erc-8004
- Erc-8041
- Erc-8126
- Erc-8183
- Erc-8196
- Erc-8226
- Ethereum
- Evals
- Evaluation
- Fhe
- Fido2
- Fintech
- Goldman-Sachs
- Google-Cloud
- Gpt-5-6
- Groth16
- Harness
- Heloc
- Hermes-Agent
- Identity
- Imitation-Learning
- Knowledge-Management
- Kya
- Langfuse
- Langgraph
- Lerobot
- Llama-Cpp
- Llm
- Llm-Agents
- Llm-as-Judge
- Llm-Observability
- Local-Llm
- Maci
- Math
- Mcp
- Memory
- Metadata
- Mev
- Moa
- Model-Routing
- Moe
- Mpp
- Mtp
- Multi-Agent
- Observability
- Okf
- Onchain
- Open-Source
- Open-Standard
- Opik
- Orderbook
- Passkey
- Physical-Ai
- Post-Quantum-Cryptography
- Post-Training
- Privacy
- Prompt-Engineering
- Provenance
- Python
- Quant-Finance
- Quantum-Computing
- Qwen
- Rag
- Reasoning
- Reinforcement-Learning
- Render
- Reputation
- Retrieval
- Reverse-Kl
- Rl
- Robot-Learning
- Rwa
- Search-Agent
- Security
- Self-Improvement
- Semaphore
- Skills
- Small-Language-Model
- Smart-Contract
- Smolvla
- Snark
- Solidity
- Sp1
- Stablecoin
- Swe-Bench
- Tokenization
- Tracing
- Trading
- Ucp
- Uncensored
- Usdc
- Vla
- Voting
- Wallet
- Webauthn
- X402
- Ylds
- Zero-Knowledge
- Zk-Proof
- Zk-Rollup