AI 에이전트를 만드는 입장에서는 오늘 가장 중요한 기술 뉴스입니다.
NVIDIA 연구진은 Claude Opus 5에 자체 에이전트 구조인 Agentic Variation Operators(AVO)를 적용해 ARC-AGI-3에서 100% 점수를 기록했다고 발표했습니다. TechCrunch가 확인한 비교에서 Opus 5를 일반적인 방식으로 실행했을 때는 약 30%였습니다. techcrunch.com, developer.nvidia.com
ARC-AGI-3는 단순 QA 벤치마크가 아니라 AI에게 규칙이나 목표를 알려주지 않은 채 새로운 2D 환경을 주고, 직접 탐색하면서 규칙을 알아내고 목표를 달성하게 하는 장시간 에이전트형 평가입니다. 인간은 공개 환경을 100% 해결할 수 있도록 보정돼 있습니다. arxiv.org
성능 향상의 핵심 중 하나는 Supervisor Agent였습니다. 실제 작업을 수행하는 에이전트가 막히거나 같은 길을 반복하면 별도의 감독 에이전트가 개입해 방향을 수정하는 구조입니다. techcrunch.com
즉 구조가 대략 이렇게 됩니다.
사용자 목표
↓
Supervisor
↓
Main Agent
↓
Memory / Tools / Environment
↓
실행 결과
↺
왜 중요한가
지금까지 AI 제품에서는 흔히:
어떤 모델이 제일 좋은가?
부터 결정했습니다.
하지만 장시간 에이전트에서는 점점:
같은 모델을 어떤 Harness에서 실행하는가?
가 더 중요해지고 있습니다.
Harness에는 Context 관리, Memory, Tool 선택, 반복 루프, 오류 복구, 평가, Subagent 운영 등이 모두 포함됩니다.
실제로 Databricks 역시 다른 하네스를 사용할 경우 동일 모델에서도 비용이 2배 수준 차이 날 수 있다는 연구를 공개한 바 있다고 TechCrunch는 전했습니다. techcrunch.com
실무 시사점
에이전트를 평가할 때 이제 다음 비교가 필요합니다.
Model A + Harness A
Model A + Harness B
Model B + Harness A
모델만 A/B 테스트하면 실제 시스템 성능의 상당 부분을 놓칠 수 있습니다.
특히 장시간 작업에서는 Supervisor / Retry policy / Memory 압축 / Tool routing이 모델 한 단계 업그레이드보다 큰 개선을 만드는 경우가 앞으로 더 많아질 가능성이 있습니다.