xAI가 8월 12일 Grok 4.6을 공개했습니다. 이번 버전은 모델 파라미터 확대 자체보다 장시간 이어지는 에이전트 작업, 복잡한 코드베이스 작업, 조사·분석 및 앱 제작에 초점을 맞췄습니다. GeekNews에서도 오늘 가장 최신 AI 뉴스로 올라왔습니다. x.ai, news.hada.io

xAI 자체 발표 기준 Artificial Analysis Intelligence Index에서 Grok 4.6은 61점으로 GPT‑5.6 Sol과 같은 점수를 기록했고, CursorBench 3.2에서는 69.9%, DeepSWE 1.1에서는 65.9%를 기록했습니다. 다만 이 비교에는 xAI 자체 발표와 각 개발사·벤치마크 리더보드 수치가 섞여 있으므로 독립적인 동일 조건 평가와 완전히 같지는 않습니다. x.ai

흥미로운 부분은 학습 방식입니다. xAI는 Grok 4.5가 생성한 SFT trajectory를 다시 활용하고, reasoning effort·agent harness·STEM·소프트웨어 엔지니어링 등 여러 환경에서 데이터를 재생성·필터링했다고 설명합니다. 이후 coding, knowledge work, CAD, kernel optimization 등의 에이전트 환경에서 RL을 수행했습니다. x.ai

산업 영향

모델 경쟁 지표가 빠르게 변하고 있습니다.

기존에는:

질문 → 좋은 답변

이었다면 이제는:

계획 → 탐색 → 코드 수정 → 실행 → 검증 → 재수정 → 완주

가 핵심입니다.

single-turn intelligence보다 trajectory reliability가 중요해지고 있습니다.

실무 시사점

코딩·업무 에이전트를 평가할 때 이제 단순 정답률보다 다음을 측정하는 것이 좋습니다.

  • Task completion rate
  • 평균 재시도 횟수
  • 도구 호출 실패율
  • 중간 결과 오류 전파율
  • 사람 개입 횟수
  • 작업 하나를 완료하는 총비용

특히 $/token보다 $/completed task가 훨씬 유용한 KPI가 됩니다.