The Brief FactStack이 되었습니다

FactStack
GeekNews

Qwen3.8-2.4T-A95B, Qwen 최초 Qwen-Max급 오픈 모델 공개

테크 프레스

한마디로

알리바바 Qwen이 코딩과 장기 에이전트 작업에 강한 초대형 오픈소스 AI 모델을 공개했는데, 전체 2.4조 파라미터 중 실제로는 950억 개만 작동시켜 효율을 높인 거예요

무슨 내용인가

Qwen3.8-2.4T-A95B는 Qwen 오픈 모델 계열 최초로 Qwen-Max급 성능을 낸 모델이에요. MoE 구조로 전체 2.4T 파라미터 중 95B만 활성화하고, 기본 컨텍스트 262,144토큰을 최대 1,010,000토큰까지 확장할 수 있어요. PaperBench 93.0, IFBench 82.8 같은 벤치마크에서는 최고 점수를 냈지만 SWE-bench Pro나 FrontierSWE 등 일부 평가에서는 Fable 5나 GPT 5.6 Sol보다 낮아 결과가 엇갈렸어요. Hugging Face Transformers 형식으로 가중치가 공개돼 vLLM, SGLang, TokenSpeed 등으로 직접 배포할 수 있고, 관리형 버전인 Qwen3.8-Max는 비전 입력과 비사고 모드, 기본 1M 컨텍스트, 내장 도구를 추가로 제공해요

에디터 노트 | FactStack

MoE로 2.4조 중 95B만 깨우는 설계는 오픈 웨이트 진영에서 이제 당연한 선택지가 됐고, 여기서 중요한 건 파라미터 수가 아니라 벤치마크가 엇갈린다는 사실 자체예요. PaperBench나 IFBench에서 1등이어도 SWE-bench Pro, FrontierSWE 같은 실전형 코딩 벤치마크에서 밀린다는 건 장기 에이전트 워크플로에 바로 투입하기 전에 자체 태스크로 반드시 검증해야 한다는 뜻이지 벤치마크 표만 보고 도입 결정하면 낭패 보기 쉽습니다. 자체 서버 운영 관점에서는 262K 기본 컨텍스트를 1M까지 늘렸을 때 vLLM이나 SGLang에서 메모리, 지연시간이 어떻게 튀는지가 실질적인 병목이라, 가중치 공개보다 이 배포 비용 계산이 팀 의사결정에 더 크게 작용할 겁니다.

실무 시사점

장기 에이전트, 코딩 자동화 워크플로를 자체 서버에서 대형 오픈 모델로 돌려보고 싶은 실무팀에게 벤치마크 상세 조건까지 참고할 만한 선택지가 하나 늘었습니다

태그

용어 풀이
Qwen
알리바바가 만든 오픈소스 AI 언어모델 시리즈
MoE
전체 파라미터 중 일부만 골라 활성화해 효율을 높이는 모델 구조
오픈소스모델
가중치와 설정을 공개해 누구나 내려받아 쓸 수 있는 AI 모델
벤치마크
AI 모델의 성능을 특정 과제로 비교 측정하는 평가 기준
공유

관련 글