GeekNews
Qwen3.8-2.4T-A95B, Qwen 최초 Qwen-Max급 오픈 모델 공개
한마디로
알리바바 Qwen이 코딩과 장기 에이전트 작업에 강한 초대형 오픈소스 AI 모델을 공개했는데, 전체 2.4조 파라미터 중 실제로는 950억 개만 작동시켜 효율을 높인 거예요
무슨 내용인가
Qwen3.8-2.4T-A95B는 Qwen 오픈 모델 계열 최초로 Qwen-Max급 성능을 낸 모델이에요. MoE 구조로 전체 2.4T 파라미터 중 95B만 활성화하고, 기본 컨텍스트 262,144토큰을 최대 1,010,000토큰까지 확장할 수 있어요. PaperBench 93.0, IFBench 82.8 같은 벤치마크에서는 최고 점수를 냈지만 SWE-bench Pro나 FrontierSWE 등 일부 평가에서는 Fable 5나 GPT 5.6 Sol보다 낮아 결과가 엇갈렸어요. Hugging Face Transformers 형식으로 가중치가 공개돼 vLLM, SGLang, TokenSpeed 등으로 직접 배포할 수 있고, 관리형 버전인 Qwen3.8-Max는 비전 입력과 비사고 모드, 기본 1M 컨텍스트, 내장 도구를 추가로 제공해요
에디터 노트 | FactStack
MoE로 2.4조 중 95B만 깨우는 설계는 오픈 웨이트 진영에서 이제 당연한 선택지가 됐고, 여기서 중요한 건 파라미터 수가 아니라 벤치마크가 엇갈린다는 사실 자체예요. PaperBench나 IFBench에서 1등이어도 SWE-bench Pro, FrontierSWE 같은 실전형 코딩 벤치마크에서 밀린다는 건 장기 에이전트 워크플로에 바로 투입하기 전에 자체 태스크로 반드시 검증해야 한다는 뜻이지 벤치마크 표만 보고 도입 결정하면 낭패 보기 쉽습니다. 자체 서버 운영 관점에서는 262K 기본 컨텍스트를 1M까지 늘렸을 때 vLLM이나 SGLang에서 메모리, 지연시간이 어떻게 튀는지가 실질적인 병목이라, 가중치 공개보다 이 배포 비용 계산이 팀 의사결정에 더 크게 작용할 겁니다.
실무 시사점
장기 에이전트, 코딩 자동화 워크플로를 자체 서버에서 대형 오픈 모델로 돌려보고 싶은 실무팀에게 벤치마크 상세 조건까지 참고할 만한 선택지가 하나 늘었습니다
태그
용어 풀이
- Qwen
- 알리바바가 만든 오픈소스 AI 언어모델 시리즈
- MoE
- 전체 파라미터 중 일부만 골라 활성화해 효율을 높이는 모델 구조
- 오픈소스모델
- 가중치와 설정을 공개해 누구나 내려받아 쓸 수 있는 AI 모델
- 벤치마크
- AI 모델의 성능을 특정 과제로 비교 측정하는 평가 기준
공유