핵심 내용

Nvidia가 지원하는 미국 AI 스타트업 Reflection AI가 10월 5일 첫 오픈웨이트 프런티어 모델 Beam을 공개했다. Beam은 총 5,010억 개 파라미터 가운데 토큰당 약 230억 개만 활성화하는 sparse Mixture-of-Experts 구조이며, 코딩·추론·Agent 작업을 주요 목표로 한다. Reflection은 23.8조 토큰으로 사전학습했고 이후 약 10,500개의 NVIDIA GB300 GPU를 4주 동안 사용해 1억 회가 넘는 reinforcement-learning rollout을 생성했다고 밝혔다. 출처

회사 자체 평가에서 Beam은 SWE-bench Verified 80.9, Terminal Bench v2.1 80.1, SWE Bench Pro v2-Hard 77.2를 기록했다. Reflection은 고급 reasoning benchmark에서 GLM-5.2와 비슷한 점수를 3~4배 적은 추론 compute로 달성했다고 주장한다. 다만 이 비교는 prompt prefill, context-dependent attention, serving overhead 등을 제외한 추정 FLOPs 기반이며, 아직 독립적으로 검증된 실제 inference 비용 비교는 아니다. 출처

Beam은 현재 최종 red-teaming과 평가 단계에 있으며 early access만 제공된다. Reflection은 10월 후반 모델 weights, technical report, model card, 개발 artifact를 공개할 예정이며 Apache 2.0 라이선스를 계획하고 있다. 따라서 현재 시점에서는 완전한 self-hosting 가능한 공개모델이 아니라 공개를 앞둔 preview에 가깝다. 출처

배경

최근 오픈웨이트 모델 시장에서는 DeepSeek, Alibaba Qwen, Z.ai GLM, Moonshot Kimi 같은 중국계 모델이 코딩·reasoning 성능과 낮은 inference 비용을 앞세워 강한 존재감을 보였다. Reflection의 전략은 가장 큰 모델을 만드는 대신 토큰당 활성 파라미터 수와 reasoning 길이를 줄여 작업당 compute를 낮추는 것이다. 출처

산업·시장에 미치는 영향

Beam의 성능과 효율 주장이 공개 weights 이후 재현된다면 기업이 고성능 Agent를 자체 인프라에서 운영할 때 선택지가 넓어질 수 있다. 특히 proprietary API와 중국산 open model 사이에서 데이터 통제와 공급망을 이유로 서방권 open-weight 모델을 원하는 기업·정부 고객에 직접적인 대안이 될 수 있다.

반대로 501B 전체 파라미터 규모는 자체 호스팅에 여전히 상당한 메모리와 multi-GPU 인프라를 요구한다. 23B active라는 수치는 연산량을 낮추지만 모델 전체 weights를 저장·로드하는 문제를 없애지는 않는다.

실무에서 바로 활용할 수 있는 시사점

weights가 실제 공개되면 공개 benchmark 순위보다 자신의 workload에서 완료업무당 생성 토큰, tokens/s, GPU 메모리 요구량, tool-call 성공률, reasoning effort별 비용을 측정하는 것이 좋다. 기존 GLM·Qwen·DeepSeek 기반 Agent를 운영하는 팀이라면 동일한 repository와 task set으로 Beam을 비교하면 모델 교체의 실제 경제성을 판단하기 쉽다.

출처

Reflection AI — Introducing Beam: Reflection’s 501B open-weight model Reuters — Nvidia-backed Reflection unveils first AI model to take on Chinese open models