핵심 내용
GeekNews 최신 글에 올라온 StepFun의 차세대 플래그십 모델 Step 5 Preview를 공식 발표까지 확인했다. StepFun은 이 모델이 600B 총 파라미터의 sparse Mixture-of-Experts 구조이며 토큰당 약 27B 파라미터가 활성화되고, 1M-token context window와 이미지 입력을 지원한다고 밝혔다. 현재 StepFun 제품과 API에서 사용할 수 있고, 회사는 전체 weight를 2026년 10월 15일 공개하겠다고 예고했다. 따라서 현재 시점에는 ‘오픈 웨이트 모델’이라고 확정해 부르기보다 오픈 웨이트 공개가 예정된 API 모델로 보는 것이 정확하다.
StepFun은 소프트웨어 엔지니어링과 금융을 핵심 목표영역으로 내세웠다. 회사 자체 평가에서 DeepSWE v1.1은 67.7%, 자체 StepCodeBench의 avg@4는 49.0%였으며, 24시간 동안 H100에서 MLA GPU kernel을 반복 최적화한 실험에서는 최고 508 TFLOPS를 기록했다고 보고했다. 다만 이 수치들은 StepFun이 선택한 harness와 설정에서 측정한 회사 자체 benchmark이므로 GPT-6 Astra나 Claude Opus 5와의 직접적인 독립 검증으로 받아들여서는 안 된다. 별도의 Artificial Analysis 평가에서는 Step 5 Preview가 Intelligence Index 약 44 수준으로 측정돼, 최고 폐쇄형 모델보다는 낮지만 비용 대비 성능 경쟁력이 높은 모델군에 들어간 것으로 나타났다.
배경
2026년 중국 모델 경쟁은 단순히 benchmark 상위권 진입보다 낮은 활성 파라미터 수, 긴 컨텍스트, API 가격, 이후 weight 공개를 한 세트로 제공하는 방향으로 진행되고 있다. StepFun도 이전 세대에서 open-weight 모델을 공개해왔고, 이번에는 software engineering·금융·장기 Agent 작업을 앞세워 OpenAI·Anthropic의 기업용 프런티어 모델과 직접 겹치는 영역을 공략하고 있다.
산업·시장에 미치는 영향
최상위 closed model과의 절대 성능차가 남아 있더라도, API 비용과 자체 배포 가능성이 충분히 낮아지면 기업은 모든 업무를 프런티어 모델에 보내지 않고 저비용 open/open-planned 모델 → 고난도 요청만 프런티어 모델로 escalation하는 구조를 쓰기 쉬워진다. 특히 1M context와 장기 coding task가 실제 production에서도 안정적으로 유지된다면 coding agent·금융 research agent의 모델 선택지가 넓어진다. 다만 10월 15일 weight 공개 약속이 실제로 지켜지는지, 라이선스와 inference 요구사항이 무엇인지까지 확인해야 self-host 후보로 판단할 수 있다.
실무에서 바로 활용할 수 있는 시사점
현재는 weight가 없으므로 바로 자체 서버 배포를 전제로 하기보다 API POC로 repository-scale coding, long-context document analysis, financial research 세 종류의 실제 workload를 테스트하는 편이 적절하다. 평가할 때 provider benchmark 대신 동일 task set으로 성공률, tool-call 오류, latency, 총 output token, 사람 수정시간을 비교해야 한다. 10월 15일 weight가 공개되면 VRAM 요구량, quantization 품질, 라이선스, 1M context의 실제 KV-cache 비용을 다시 검증할 필요가 있다.
출처: GeekNews — 최신 글, StepFun — Step 5 Preview: Advancing the Pareto Frontier, Artificial Analysis — Step 5 Preview