본문으로 건너뛰기
CoderRed Blog

Article

Qwen3.8-Max 정식 출시 - 코딩 성능과 Token Plan 에이전트 활용

어제 Qwen3.8-Max가 정식으로 나왔습니다. 7월에 프리뷰를 Token Plan으로 직접 써봤던 모델이라 발표부터 눈에 들어왔어요.

처음에는 저도 기대가 컸습니다. 2.4조 파라미터짜리 Max 모델이고, Qwen이 장기 코딩과 에이전트 작업을 전면에 내세웠거든요.

“이 정도면 Claude Opus급까지 올라온 것 아닐까?”

그런데 Claude Opus 4.8, Fable 5, GPT-5.6 Sol과 공식 벤치마크를 나란히 놓고 보니 결론이 조금 달랐습니다. Qwen3.8-Max는 코딩도 잘하지만, 순수 코딩에 특화된 모델은 아니었어요. 복잡한 저장소 코딩에서는 Fable이나 GPT에 밀렸고, 문서, 시각, 컴퓨터 조작이 섞인 범용 에이전트 작업에서 더 강했습니다.

그러다 지난 알리바바 Token Plan 사용 후기를 다시 읽어봤습니다. Token Plan에는 이미 전용 API 키와 OpenAI 및 Anthropic 호환 엔드포인트가 있습니다. 이 구조라면 Qwen3.8-Max를 단독 코딩 모델로만 볼 이유가 없었습니다. Hermes나 OpenClaw 같은 에이전트 하네스에 붙여 쓰는 쪽이 더 맞아 보였습니다.

Token Plan이 Qwen3.8-Max를 거쳐 Hermes와 OpenClaw로 분기되는 구성도
Qwen3.8-Max와 Token Plan 에이전트 구성
Token Plan의 전용 API 키와 OpenAI 호환 엔드포인트를 이용해 Qwen3.8-Max를 Hermes나 OpenClaw에 연결하는 흐름입니다.

먼저 핵심부터 정리하면

  1. Qwen3.8-Max는 2.4조 파라미터, 토큰당 950억 활성 파라미터를 쓰는 멀티모달 MoE 모델입니다.
  2. 고난도 저장소 코딩에서는 Fable 5와 GPT-5.6 Sol보다 약하지만, 문서, 시각, 컴퓨터 조작과 범용 에이전트 작업은 강합니다.
  3. API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러입니다. 장시간 에이전트를 돌리기에 눈에 띄는 가격이에요.
  4. Alibaba Cloud와 QwenCloud Token Plan은 sk-sp- 전용 키와 OpenAI 및 Anthropic 호환 API를 제공합니다. Hermes와 OpenClaw 같은 커스텀 제공자 지원 하네스에 붙이기 좋은 구조입니다.
  5. 다만 아직 제가 Qwen3.8-Max 정식판을 Hermes나 OpenClaw에 직접 연결해 장기 테스트한 것은 아닙니다. 정식 모델 ID는 열렸지만 Hermes 머신으로 쓰던 BC250이 현재 벽돌이 된 상태라 당장 테스트하기 어렵습니다. 이 글의 연동 평가는 공식 지원 구조와 기존 Token Plan 실사용 경험을 바탕으로 한 판단입니다.

Qwen3.8-Max는 무엇이 달라졌나요?

Qwen은 8월 3일 Qwen3.8-Max를 공식 출시했습니다. QwenCloud에서 바로 API로 쓸 수 있고, Max급 모델로는 처음으로 오픈 웨이트도 공개할 예정입니다. Qwen3.8-27B와 함께 다음 주에 가중치를 배포한다고 밝혔어요.

기본 사양은 이렇습니다.

항목Qwen3.8-Max
구조Mixture-of-Experts
전체 파라미터2.4조
활성 파라미터토큰당 950억
주요 분야코딩, 업무, 연구, 장기 에이전트, 멀티모달
API 입력 가격100만 토큰당 2달러
API 출력 가격100만 토큰당 6달러
암묵적 캐시100만 토큰당 0.25달러
오픈 웨이트다음 주 공개 예정

Qwen이 특히 강조한 건 짧은 코드 생성보다 며칠씩 이어지는 작업입니다. 공식 사례에서는 약 16일 동안 자율 프로젝트를 운영하며 265개 커밋과 127개 PR을 만들었다고 합니다. 연구 논문을 재현하고 개선하는 작업에는 약 125시간 동안 1,100회 넘는 액션과 33회의 GPU 학습을 수행했다고 밝혔고요.

숫자는 인상적입니다. 다만 모두 Qwen이 설계하고 공개한 사례입니다. 실제 개발자가 같은 결과를 재현할 수 있는지는 독립 테스트를 더 봐야 합니다.

오퍼스급을 기대했는데, 실제 위치는 어디일까요?

Qwen 공식 표에 실린 결과를 네 모델로 나란히 정리했습니다. 모델마다 실행 하네스와 평가 조건이 완전히 같지는 않으므로 절대 서열표라기보다 강점이 드러나는 참고 자료로 보는 게 안전합니다.

평가 항목Claude Opus 4.8Claude Fable 5GPT-5.6 SolQwen3.8-Max
Terminal Bench 2.184.684.688.886.6
SWE-bench Pro69.280.064.667.7
DeepSWE 1.159.070.073.056.6
PaperBench80.388.890.593.0
CoWorkBench72.375.971.574.8
SkillsBench65.170.973.570.2
GPQA Diamond92.092.694.192.6
IFBench62.263.572.782.8
OSWorld-Verified83.485.083.286.1
AndroidWorld75.088.877.685.3
OmniDocBench 1.586.589.586.792.1
Parametric CAD Bench85.187.586.291.5

표만 보면 Qwen3.8-Max를 오퍼스급으로 기대한 게 완전히 틀리지는 않습니다. Terminal Bench와 GPQA에서는 비슷하고, PaperBench, IFBench, OSWorld, 문서, CAD에서는 Qwen이 앞선 항목도 있어요.

하지만 개발자가 체감하기 쉬운 저장소 코딩에서는 이야기가 달라집니다. SWE-bench Pro는 Fable 5가 80.0, Qwen이 67.7입니다. DeepSWE 1.1은 GPT-5.6 Sol이 73.0, Qwen은 56.6이고요.

Qwen3.8-Max는 코드를 가장 잘 고치는 모델이라기보다, 코드를 포함한 복합 작업을 오래 수행하는 범용 에이전트 모델에 가깝습니다.

이 차이가 중요합니다. 어려운 버그의 근본 원인을 추적하고 여러 파일의 호출부까지 정확하게 정리하는 작업이라면 Fable이나 GPT가 더 유리할 수 있습니다. 반면 문서와 이미지를 읽고, 화면을 조작하고, 코드를 실행하며 결과물을 완성하는 작업에서는 Qwen의 강점이 살아납니다.

그래서 Hermes나 OpenClaw가 떠올랐습니다

Hermes와 OpenClaw는 모델 자체가 아니라 모델이 오래 일하도록 감싸는 에이전트 하네스입니다. 작업을 나누고, 도구를 호출하고, 결과를 기억하고, 실패하면 다시 계획합니다.

이런 하네스는 토큰을 많이 씁니다. 계획과 재계획, 도구 결과, 테스트 로그, 메모리 요약, 재시도가 모두 대화 기록에 들어가거든요. 단발성 질문에서는 작아 보이던 가격 차이가 장기 세션에서는 크게 누적됩니다.

Qwen3.8-Max와 잘 맞는 이유는 세 가지입니다.

  1. 입력 2달러, 출력 6달러라 장시간 실행 부담이 상대적으로 낮습니다.
  2. Qwen이 장기 작업과 여러 에이전트 하네스를 염두에 두고 학습했다고 직접 밝혔습니다.
  3. 문서, 이미지, 화면, 코드를 한 작업 안에서 다루는 멀티모달 능력이 있습니다.

Hermes는 메모리와 스킬을 쌓아가며 긴 자율 작업을 돌리는 쪽에 어울립니다. OpenClaw는 여러 도구와 채널을 잇는 개인 에이전트에 더 가깝고요. 성격은 다르지만 둘 다 커스텀 OpenAI 호환 제공자를 구성할 수 있어 Token Plan을 붙일 수 있습니다.

Token Plan에는 이미 키와 엔드포인트가 있습니다

7월에 직접 결제해 확인해 보니 Alibaba Cloud와 QwenCloud는 같은 계정을 공유했습니다. Alibaba Cloud에서 Token Plan에 가입하자 QwenCloud에도 같은 플랜이 표시됐어요. 가입 페이지는 두 곳입니다. Alibaba Cloud Token Plan이나 QwenCloud Token Plan에서 플랜을 선택하면 됩니다.

공통 항목은 다음과 같습니다.

  • sk-sp-로 시작하는 전용 API 키
  • OpenAI 호환 API
  • Anthropic 호환 API
  • 라이트, 스탠더드, 프로 플랜
  • 5시간 및 7일 크레딧 구간
  • 플랜별 모델 목록과 차감 계수

국제판 OpenAI 호환 주소도 같습니다.

https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1

연동에 필요한 핵심 값은 세 개입니다.

base_url = https://token-plan.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1
api_key  = sk-sp-...
model    = qwen3.8-max

이 코드는 Hermes나 OpenClaw의 실제 설정 파일을 그대로 복사한 예제가 아닙니다. 어떤 값을 넣어야 하는지 보여주는 구성도에 가깝습니다. 각 하네스에서는 커스텀 제공자 형식과 모델 허용 목록에 맞춰 넣어야 합니다.

프리뷰 때 OMP에서 막혔던 이유도 엔드포인트나 API 키가 없어서가 아니었습니다. 커스텀 OpenAI 주소는 넣을 수 있었지만, 당시 OMP 17.0.8이 qwen3.8-max-preview를 모델 카탈로그에서 정상 선택하지 못했습니다. 결국 전용 제공자와 모델별 호환 설정이 필요했어요.

현재 Token Plan 모델 목록에는 qwen3.8-max가 정식 ID로 열렸습니다. 이제 남은 확인 사항은 Hermes와 OpenClaw에서 도구 호출이 완전히 호환되는지, 장기 작업에서 크레딧이 얼마나 소모되는지입니다.

아쉬운 건 바로 테스트할 머신이 없다는 점입니다. Hermes를 돌리던 BC250은 8코어 영구 언락 바이오스를 만들다가 벽돌이 됐습니다. 정식 ID가 열린 타이밍에 실제 연결과 크레딧 소비량을 재보고 싶었는데, 당분간은 보드를 복구하거나 대체 머신을 마련해야 합니다.

가격만 보고 바로 장기 자동화를 돌리면 안 됩니다

Token Plan은 무제한 요금제가 아닙니다.

제가 사용한 스탠더드는 월 18달러였습니다. 그런데 5시간 구간의 3,000크레딧을 약 3시간 만에 모두 썼습니다. 처음에는 응답이 빨랐지만 긴 세션에서는 들쭉날쭉했고요. 당시에는 프리뷰 할인 차감이 적용됐기 때문에 정식판 소비량을 그대로 예측하기도 어렵습니다.

Hermes나 OpenClaw로 반복 작업을 돌리면 사람이 채팅할 때보다 크레딧이 더 빠르게 줄어들 수 있습니다. 여러 에이전트를 병렬로 띄우면 더 그렇습니다. 제 사용량이라면 스탠더드보다 프로 플랜을 먼저 보게 될 것 같아요.

오픈 웨이트도 같은 맥락입니다. 가중치를 내려받을 수 있다는 것과 집에서 쉽게 돌릴 수 있다는 것은 다릅니다. 전체 2.4조, 활성 950억 파라미터 모델이라 일반 소비자 GPU 한두 장으로 가볍게 돌릴 규모는 아닐 가능성이 큽니다. 실제 정밀도별 용량과 하드웨어 요구량은 공개 파일을 확인해야 합니다.

이런 사람에게 잘 맞습니다

  • 이미 Alibaba나 QwenCloud Token Plan을 구독하고 있다
  • Hermes나 OpenClaw에서 장기 리서치와 반복 업무를 돌리고 싶다
  • 코딩뿐 아니라 문서, 이미지, 화면 작업도 한 모델에 맡기고 싶다
  • Claude Max 대신 가격이 낮은 에이전트 모델을 찾고 있다
  • 실패한 고난도 코딩을 GPT나 Claude로 넘길 보조 경로가 있다

반대로 이런 경우에는 아직 애매합니다

  • 가장 높은 저장소 코딩 성공률이 필요하다
  • 응답 속도가 항상 일정해야 한다
  • 커스텀 제공자와 모델 ID를 직접 설정하고 싶지 않다
  • 여러 에이전트를 사실상 무제한으로 병렬 실행하려 한다
  • 공식 벤치마크보다 독립 실사용 검증이 쌓일 때까지 기다리고 싶다

정리하면

Qwen3.8-Max가 Fable 5나 GPT-5.6 Sol을 모든 코딩 작업에서 이긴 것은 아닙니다. 오퍼스급을 기대했던 입장에서는 저장소 코딩 점수가 아쉬울 수 있어요.

Qwen3.8-Max의 장점은 저렴한 코딩 모델이라는 데 있지 않습니다. 코드, 문서, 화면, 도구를 한데 묶어 긴 작업을 끝내는 쪽에 강하고, Token Plan에는 이 작업을 외부 에이전트에서 돌릴 전용 키와 호환 엔드포인트도 있습니다.

Qwen3.8-Max는 단독 코딩 모델보다 Token Plan을 통해 Hermes나 OpenClaw에 붙였을 때 더 매력적인 모델입니다.

당장 구성한다면 Qwen에는 길고 비용 부담이 낮은 작업을 맡기고, 반복해서 실패하는 어려운 코딩만 Fable이나 GPT로 넘길 생각입니다. 정식 모델 ID가 열린 김에 Hermes에서 도구 호출과 크레딧 소비량을 다시 재볼 참이었는데, Hermes 머신인 BC250이 죽어버렸어요. 아쉽지만 보드를 복구하거나 대체 머신을 마련한 뒤 실제 연동 결과를 이어서 확인할 생각입니다.

참고 자료

댓글