핵심 내용
GeekNews 최신 글의 최상단 AI 개발 항목은 OpenAI의 Decisions API다. GeekNews 요약만 사용하지 않고 OpenAI DevDay 공식 발표를 확인하면, Decisions API는 GPT-6 Luna의 지능을 개발자가 미리 정의한 질문과 유한한 답변 후보에 집중시키는 API다.
개발자는 텍스트 또는 이미지 context와 가능한 답변을 전달하고, 모델은 그중 하나를 선택한다. OpenAI가 제시한 사용처는 콘텐츠 분류, 요청 라우팅, Agent의 다음 행동 선택이다. 일반 LLM처럼 임의의 긴 자연어를 생성한 뒤 JSON을 파싱하는 대신 애플리케이션이 요구하는 선택공간을 처음부터 제한하는 구조다.
9월 29일 기준 limited preview이며 OpenAI는 며칠 내 더 넓은 공개를 계획한다고 밝혔다. 공식 DevDay 발표에는 별도 가격과 정확도 benchmark가 공개되지 않았으므로 GPT-6 Luna의 일반 API 가격이나 제3자 benchmark를 Decisions API 가격·성능으로 그대로 가정해서는 안 된다.
배경
많은 AI 애플리케이션은 실제로 긴 문장이 필요한 것이 아니라 '승인/검토/차단', 'A/B/C 라우트', '다음 tool'처럼 몇 개의 선택지 가운데 하나를 고르는 기능이 필요하다. 지금까지 이런 작업에도 범용 LLM을 호출하고 structured output을 파싱하는 방식이 흔했다.
TypeSafe AI의 Jev 같은 decision-oriented 모델이 등장한 뒤 OpenAI도 동일한 문제영역에 전용 인터페이스를 추가하면서 생성 모델과 판단 모델을 분리하는 설계가 하나의 제품범주로 자리잡기 시작했다.
산업·시장에 미치는 영향
AI stack이 '모든 요청을 거대한 LLM 하나에 보낸다'는 구조에서 rules → decision model/API → 일반 LLM → 고성능 reasoning model → human escalation처럼 여러 계층으로 세분화될 가능성이 있다.
고빈도 moderation·routing·triage 작업에서 판단 전용 API가 충분한 정확도를 내면 latency와 비용을 줄이고 출력 schema 오류도 없앨 수 있다.
실무에서 바로 활용할 수 있는 시사점
현재 LLM으로 moderation이나 routing을 하는 시스템이라면 Decisions API가 일반 공개된 뒤 과거 실제 로그를 replay하는 shadow test가 적합하다. 특히 false positive/negative, confidence calibration, p95 latency, 1만 건당 비용을 기존 structured-output LLM과 비교해야 한다.
판단의 영향이 큰 결제·보안·계정정지 업무에서는 한 번의 선택을 바로 실행하기보다 낮은 confidence 결과를 강한 모델이나 사람에게 escalation하는 구조가 안전하다.