GeekNews에 예고 글로 올라왔던 Qwen3.8-27B가 실제 공개됐습니다. 모델은 27B dense 구조이며 이미지·비디오를 이해하는 vision-language 모델입니다. Qwen은 코딩, 전문 업무, 리서치, 장시간 에이전트 작업과 환경 피드백에 따른 계획 수행 능력을 주요 개선점으로 내세우고 있습니다. news.hada.io

기본 컨텍스트는 262,144토큰, 확장 시 최대 100만 토큰을 지원합니다. 또한 reasoning_effort로 추론 강도를 조정할 수 있고, 과거 reasoning context를 유지하는 preserve_thinking도 제공합니다. huggingface.co

NVIDIA는 RTX 5090에서 Q4_K_M 양자화 모델을 이용했을 때 자체 테스트 기준 초당 131토큰 수준을 기록했다고 밝혔습니다. llama.cpp, Ollama, Unsloth, LM Studio 등에서 바로 사용할 수 있습니다. 이 수치는 NVIDIA 환경에서 측정된 것이므로 다른 하드웨어에서 동일하다고 보기는 어렵습니다. blogs.nvidia.com

산업 영향

로컬 AI의 위치가 바뀌고 있습니다.

기존에는:

로컬 모델 = 작은 모델 / 간단한 분류·요약

이었다면 이제는:

로컬 모델 = 코딩 + tool use + agent + 긴 프로젝트 context

까지 내려오고 있습니다. blogs.nvidia.com

특히 기업 코드나 내부 데이터를 외부 API로 보내기 어려운 환경에서는 클라우드 frontier 모델과 로컬 모델을 병행하는 구조가 점점 현실적이 됩니다.

실무 시사점

개발 환경에서는 다음 구조를 시험할 만합니다.

민감 코드·내부 문서 → Local Qwen

복잡한 최고난도 reasoning → Cloud frontier model

최종 리뷰 → 다른 모델로 cross-check

즉 모델을 하나 고르는 것보다 업무와 데이터 민감도에 따라 라우팅하는 방식이 더 합리적입니다.