GeekNews 최근 신규 목록에서 계속 화제가 되는 모델이 Ox Alpha입니다. news.hada.io
OpenRouter의 공식 모델 목록에서 확인되는 사실은 다음과 같습니다.
- 약 1.05M context
- 텍스트·이미지·비디오 입력
- 코딩·장시간 agentic 작업을 주요 용도로 표방
- 현재 preview에서 입출력 $0
- 개발·운영사는 익명을 선택한 제3자 provider
- OpenRouter 자체 모델은 아님 openrouter.ai
여기서 성능보다 훨씬 중요한 문장이 있습니다.
OpenRouter는 prompt와 completion이 해당 익명 provider에게 보존된다고 명시합니다. 학습에는 사용하지 않는다고 하지만, 누가 운영하는지 공개되지 않은 상태입니다. openrouter.ai
현재 성능 평가는 혼재
일부 독립 agent benchmark에서는 비교적 강한 모습을 보이지만, raw coding benchmark에서는 훨씬 낮은 결과도 나왔습니다. 예를 들어 한 공개 DeepSWE agent harness 평가에서는 113문제 가운데 66개를 해결했지만, 별도의 최소 scaffold LiveCodeBench 실험에서는 pass@1 약 28%가 보고됐습니다. 두 실험의 harness·dataset·평가 방식이 완전히 다르므로 숫자를 직접 비교해서는 안 됩니다. github.com
오히려 이 차이는 최근 AI 업계에서 계속 관찰되는 현상을 보여줍니다.
모델 성능 = Model + Harness + Tools + Context
입니다.
실무 시사점
Ox Alpha는 테스트해볼 수는 있어도 현재 단계에서 사내 코드·고객 데이터·API key·비공개 문서를 넣는 것은 권하지 않습니다.
무료 모델을 볼 때는 가격보다 먼저:
Who operates it?
Where is data stored?
How long is it retained?
Is it used for training?
Can I sign a DPA?
를 확인해야 합니다.
무료 inference의 대가는 토큰 가격이 아니라 데이터일 수도 있습니다.