大規模言語モデル 2026年8月4日 約 18 分 Qwen3.8-Max オープンソース

Qwen3.8-Max 正式導入:
2.4T パラメータが Arena テキスト第5位へ

8/3 GA · 950 億活性 · 千問オフィス · Kimi K3 / DeepSeek V4 比較 · Open-Source 表記の実態

阿里巴巴 Qwen3.8-Max 大規模言語モデル正式導入の概念図

誰が:阿里巴巴(Alibaba);いつ:2026 年 8 月 3 日;何を:フラッグシップ大規模言語モデル千問 Qwen3.8-Max を正式 GA し、Agent 製品「千問オフィス」を同時ローンチしました。規模:総パラメータ 2.4 兆、活性 950 億、1M token コンテキスト。結論:Arena テキスト競技場トップ 8 のうち唯一の非 Anthropic モデルですが、ベンチマークはすべて阿里巴巴自社計測、ウェイトは未公開——本稿では公開資料に基づきタイムライン、核心データ、横断比較、論点、5 ステップ導入、FAQを整理し、リモート Mac 上で OpenClaw / Qoder など Agent チェーンを検収する現実的なパスも説明します。

01

選定前の痛点:「世界前五」でも細部を読む理由

  1. 01

    「Open-Source」表記がウェイトより先:qwen.ai には Open-Source と記載されていますが、Hugging Face / ModelScope にリポジトリ・ライセンスはなく、「来週公開」の約束のみです。

  2. 02

    ベンチマークはすべてベンダー自社計測:PaperBench、QwenSWEBench、RecreationBench などは阿里巴巴の自社ベンチ。Arena ランキングも Preliminary(暫定)表記です。

  3. 03

    活性パラメータの開示が遅れた:7 月プレビュー版では活性量未公表。GA で初めて 950 億が追加され、透明性について独立機関から批判がありました。

  4. 04

    フルバージョンのローカル展開は非現実的:2.4T 総パラメータは MoE でもマルチノードデータセンターが必要。個人に現実的なのは API か Qwen3.8-27B 待ちです。

  5. 05

    Agent 検収には GUI が必要:OpenClaw、Claude Code、Qoder CLI 連携時、macOS 権限ダイアログとブラウザ OAuth は純 SSH では完結しません。

02

タイムライン:プレビューから GA まで、2 週間の速い展開

日付イベント
7 月 16 日月之暗面(Moonshot AI)が Kimi K3(2.8T、896 エキスパート中 16 活性)を公開。独立評価と技術レポートを強調
7 月 19 日Qwen3.8-Max プレビュー版オープン。正式価格の 10%、活性パラメータ・ベンチ未公表。ToS で自動化生産呼び出し禁止
7 月 27 日Kimi K3 が約束どおりウェイトをオープンソース化。Hugging Face 公開、MoonEP など基盤も同時公開
7 月 31 日DeepSeek V4-Flash 正式版。パラメータ不変のまま 9 項 Agent/コードベンチで V4-Pro を上回る
8 月 3 日Qwen3.8-Max GA、完全ベンチ表公開。「千問オフィス」ローンチ。阿里巴巴株 +7%(香港)/ +4.5%(米国)
8 月 10 日前後(予定)Qwen3.8-Max と Qwen3.8-27B のウェイトが Hugging Face / ModelScope へ(執筆時点未公開)
03

核心データ一覧

項目Qwen3.8-Max
公開日2026 年 8 月 3 日(GA)
総 / 活性パラメータ2.4 兆 / 950 億
アーキテクチャQwen3.5 ベースのスパース MoE + ハイブリッドアテンション
コンテキスト100 万 token(思考モード約 98.3 万、出力上限 13.1 万)
入力モダリティテキスト / 画像 / 動画
API 料金入力 $2/M、出力 $6/M(暗黙キャッシュ $0.25、明示キャッシュ書込 $2.5、読取 $0.17)
国内料金入力 12 元/M、出力 36 元/M、キャッシュヒット最低 1.5 元
Arena テキスト(8/1 スナップ)第 5 位、1496 点(Preliminary);トップ 8 中唯一の非 Anthropic
Arena ビジョン第 2 位、Claude Fable 5 に次ぐ
PaperBench(阿里巴巴自測)93.0(前世代比 +28.2)
SWE-bench Pro(阿里巴巴自測)67.7(Fable 5 の 80.0 に劣る)
ウェイトオープンソース「来週」約束、執筆時点未公開

引用可能な数値:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · OpenAI + Anthropic 互換 API。

04

アーキテクチャ:大容量・低活性の効率路線

Qwen3.8-Max は Qwen3.5 スパース MoE 路線を継承しています。総パラメータ 2.4 兆、token あたり活性 950 億のみ——推論コストは総量ではなく活性量に追従するため、API 料金は Claude Opus 5($5/$25)や Fable 5($10/$50)を大きく下回ります。

reasoning_effort 三档(low / medium / xhigh、デフォルト xhigh)は enable_thinking または Anthropic 互換インターフェースの reasoning.effort で速度と深度を調整でき、Agent モデルの定番コストダイヤルです。

長期自律タスクが今回の核心訴求です。16 日間無人介入コーディング、500+ ステップのチップ設計最適化、独自 RecreationBench(ブラックボックスで実アプリ再現)など。事例の一部は GitHub qwen-code-dev-bot/oh-my-cli で確認できますが、評価セットは阿里巴巴自社で第三者監査ではありません。

エコシステム:「千問オフィス」と同時接続。API は OpenAI および Anthropic プロトコル互換で、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw など主流 Agent ツールチェーンに直接接続できます。

05

横断比較:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4

モデル総/活性コンテキスト料金(入/出 per M)ウェイト独立評価
Qwen3.8-Max2.4T / 950B1M$2 / $6未公開(約束中)なし
Kimi K32.8T / ~500B~1.05M$3 / $15公開済(7/27)AA Index ≈57.1
DeepSeek V4-Pro1.6T / 490B1M未完全公開公開済SWE-bench Verified 80.6%
DeepSeek V4-FlashV4-Pro 同1M未完全公開公開済9 項ベンチで V4-Pro 超
Claude Fable 5非公開1M$10 / $50クローズドArena Text #1

比較可能な唯一の独立盲検(269 ファイルの実アーキテクチャタスク):Kimi K3 が 83 点、Qwen3.8-Max プレビュー版 80 点——同档位で互角であり、全面優位とは言えません。詳細は Kimi K3 オープンウェイト公開も参照してください。

06

論点:「Open-Source」表記がウェイトより先に付いた

  1. 01

    公式サイトに Open-Source 表記がある一方、Hugging Face / ModelScope にリポジトリ・ライセンス・確定日はありません。

  2. 02

    すべてのベンチマークは阿里巴巴自社フレームワーク由来。Artificial Analysis や Arena 公式チームは GA 版を未再現です。

  3. 03

    比較表脚注に「Fable 5 結果は fallback 関与の可能性」とある一方、自社テスト方法論は再現可能な水準まで公開されていません。

  4. 04

    プレビュー版 ToS は自動化生産呼び出しを禁止。model card や安全評価もなく、複数機関が本番移行を推奨していません。

注意:性能が劣るという意味ではありません——独立盲検では Kimi K3 と同档です。ただし「GPT-5.6 Sol を上回る」等の結論は現時点では主に阿里巴巴側の主張であり、ウェイト公開と第三者再現を待つべきです。

07

導入ステップ:API 検収から Agent 連調まで(5 ステップ)

  1. 01

    QwenCloud / Model Studio で API を開通し、OpenAI または Anthropic 互換エンドポイントで基本対話と reasoning.effort 三档を検証します。

  2. 02

    SWE-bench Pro、Arena 暫定ランキングと照合し、自社シナリオが強み(長期 Agent、多モーダル)か弱み(HLE 43.6)かを確認します。

  3. 03

    OpenClaw / Qoder 設定で base URL と API Key を切り替え、小流量プローブで Kimi K3 / DeepSeek のレイテンシとコストを比較します。

  4. 04

    Hugging Face 上の Qwen3.8-27B オープンソース進捗を注視します——ローカル私有化が必要なら 27B の方が 2.4T フルより現実的です。

  5. 05

    実 macOS グラフィック環境で OAuth、ブラウザ DevTools、システム権限の検収を完了します(後述 VNCMac シナリオ参照)。

json
{
  "model": "qwen3.8-max",
  "reasoning": { "effort": "xhigh" },
  "enable_thinking": true,
  "max_tokens": 8192
}
08

業界背景:パラメータ競争とアーキテクチャ効率への転換

  • 2026 年は兆パラメータ「増産年」ですが、DeepSeek V4-Flash はパラメータを増やさず Agent 能力を大幅向上させました。
  • 阿里巴巴が久々にオープンソースへ回帰:初めて Max 級ウェイトの公開を約束。Kimi K3、DeepSeek とともに国産トップが集体オープン化の流れを形成しています。
  • コンシューマー展開:圧縮 Qwen が Apple Intelligence 中国版のローカルエンジンとなり、数億台の iPhone をカバーしています。
  • 規制対照:同日、ホワイトハウスが OpenAI、Anthropic 等と Agent サイバーセキュリティテスト枠組みを協議——中美 AI 叙事の興味深い断面です。
09

よくある質問(FAQ)

API は QwenCloud 経由で利用可能です。OpenAI および Anthropic 互換プロトコルに対応しています。ウェイトは未公開で、8 月 10 日前後に Hugging Face / ModelScope のリポジトリとライセンスが公開される見込みです。

権威ある統一ベンチはまだありません。唯一の独立盲検では Kimi K3 83 点、Qwen3.8-Max プレビュー 80 点で同档位。K3 はウェイト公開済みで第三者データあり。Qwen は API が安く多モーダルが充実。Kimi K3 オープンウェイトも参照してください。

MoE 実活性 950 億で、API コストは千亿級に近い水準です。フルバージョンのローカル展開にはデータセンター級ハードが必要。現実的な選択肢は API か Qwen3.8-27B 待ちです。

参考にはなりますが結論ではありません。データは阿里巴巴自社フレームワーク由来、Arena は Preliminary 表記。第三者再現か自社 A/B テストを推奨します。

中国版 Apple Intelligence の生成 AI は圧縮 Qwen を端末ローカルで実行。開発者はより安価なフラッグシップ API で OpenClaw 等 Agent ツールチェーンに接続できます。

おわりに

Qwen3.8-Max は国産大規模言語モデルを Arena テキスト前五へ押し上げ、$2/$6 の API 料金と OpenClaw 互換プロトコルで Agent 移行のハードルを下げました——ただしウェイトは未着地、ベンチは第三者未再現であり、「Open-Source」表記は現時点では意図を示すもので、成果物ではありません。主力機が Windows/Linux でも、実 macOS グラフィック環境で千問オフィス連携、OpenClaw マルチモデルルーティング、iOS ビルドと Agent ベンチの並行検証が必要なら、Mac 自購は高コスト、純 SSH では OAuth とシステムダイアログが押せません。

VNCMac リモート Mac レンタルなら時間課金で VNC デスクトップを開通し、隔離ノード上で Qwen3.8-Max API と Agent ワークフローを検収できます。Mac レンタルプランをご確認ください。背景詳細は Kimi K3 オープンウェイト公開も参照してください。

出典:阿里巴巴公式ブログ、Arena.ai、Apidog、TechNode、Apple Intelligence 中国版関連報道等。最新情報は公式発表をご確認ください。