8/3 GA · 950 億活性 · 千問オフィス · Kimi K3 / DeepSeek V4 比較 · Open-Source 表記の実態
誰が:阿里巴巴(Alibaba);いつ:2026 年 8 月 3 日;何を:フラッグシップ大規模言語モデル千問 Qwen3.8-Max を正式 GA し、Agent 製品「千問オフィス」を同時ローンチしました。規模:総パラメータ 2.4 兆、活性 950 億、1M token コンテキスト。結論:Arena テキスト競技場トップ 8 のうち唯一の非 Anthropic モデルですが、ベンチマークはすべて阿里巴巴自社計測、ウェイトは未公開——本稿では公開資料に基づきタイムライン、核心データ、横断比較、論点、5 ステップ導入、FAQを整理し、リモート Mac 上で OpenClaw / Qoder など Agent チェーンを検収する現実的なパスも説明します。
「Open-Source」表記がウェイトより先:qwen.ai には Open-Source と記載されていますが、Hugging Face / ModelScope にリポジトリ・ライセンスはなく、「来週公開」の約束のみです。
ベンチマークはすべてベンダー自社計測:PaperBench、QwenSWEBench、RecreationBench などは阿里巴巴の自社ベンチ。Arena ランキングも Preliminary(暫定)表記です。
活性パラメータの開示が遅れた:7 月プレビュー版では活性量未公表。GA で初めて 950 億が追加され、透明性について独立機関から批判がありました。
フルバージョンのローカル展開は非現実的:2.4T 総パラメータは MoE でもマルチノードデータセンターが必要。個人に現実的なのは API か Qwen3.8-27B 待ちです。
Agent 検収には GUI が必要:OpenClaw、Claude Code、Qoder CLI 連携時、macOS 権限ダイアログとブラウザ OAuth は純 SSH では完結しません。
| 日付 | イベント |
|---|---|
| 7 月 16 日 | 月之暗面(Moonshot AI)が Kimi K3(2.8T、896 エキスパート中 16 活性)を公開。独立評価と技術レポートを強調 |
| 7 月 19 日 | Qwen3.8-Max プレビュー版オープン。正式価格の 10%、活性パラメータ・ベンチ未公表。ToS で自動化生産呼び出し禁止 |
| 7 月 27 日 | Kimi K3 が約束どおりウェイトをオープンソース化。Hugging Face 公開、MoonEP など基盤も同時公開 |
| 7 月 31 日 | DeepSeek V4-Flash 正式版。パラメータ不変のまま 9 項 Agent/コードベンチで V4-Pro を上回る |
| 8 月 3 日 | Qwen3.8-Max GA、完全ベンチ表公開。「千問オフィス」ローンチ。阿里巴巴株 +7%(香港)/ +4.5%(米国) |
| 8 月 10 日前後(予定) | Qwen3.8-Max と Qwen3.8-27B のウェイトが Hugging Face / ModelScope へ(執筆時点未公開) |
| 項目 | Qwen3.8-Max |
|---|---|
| 公開日 | 2026 年 8 月 3 日(GA) |
| 総 / 活性パラメータ | 2.4 兆 / 950 億 |
| アーキテクチャ | Qwen3.5 ベースのスパース MoE + ハイブリッドアテンション |
| コンテキスト | 100 万 token(思考モード約 98.3 万、出力上限 13.1 万) |
| 入力モダリティ | テキスト / 画像 / 動画 |
| API 料金 | 入力 $2/M、出力 $6/M(暗黙キャッシュ $0.25、明示キャッシュ書込 $2.5、読取 $0.17) |
| 国内料金 | 入力 12 元/M、出力 36 元/M、キャッシュヒット最低 1.5 元 |
| Arena テキスト(8/1 スナップ) | 第 5 位、1496 点(Preliminary);トップ 8 中唯一の非 Anthropic |
| Arena ビジョン | 第 2 位、Claude Fable 5 に次ぐ |
| PaperBench(阿里巴巴自測) | 93.0(前世代比 +28.2) |
| SWE-bench Pro(阿里巴巴自測) | 67.7(Fable 5 の 80.0 に劣る) |
| ウェイトオープンソース | 「来週」約束、執筆時点未公開 |
引用可能な数値:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · OpenAI + Anthropic 互換 API。
Qwen3.8-Max は Qwen3.5 スパース MoE 路線を継承しています。総パラメータ 2.4 兆、token あたり活性 950 億のみ——推論コストは総量ではなく活性量に追従するため、API 料金は Claude Opus 5($5/$25)や Fable 5($10/$50)を大きく下回ります。
reasoning_effort 三档(low / medium / xhigh、デフォルト xhigh)は enable_thinking または Anthropic 互換インターフェースの reasoning.effort で速度と深度を調整でき、Agent モデルの定番コストダイヤルです。
長期自律タスクが今回の核心訴求です。16 日間無人介入コーディング、500+ ステップのチップ設計最適化、独自 RecreationBench(ブラックボックスで実アプリ再現)など。事例の一部は GitHub qwen-code-dev-bot/oh-my-cli で確認できますが、評価セットは阿里巴巴自社で第三者監査ではありません。
エコシステム:「千問オフィス」と同時接続。API は OpenAI および Anthropic プロトコル互換で、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw など主流 Agent ツールチェーンに直接接続できます。
| モデル | 総/活性 | コンテキスト | 料金(入/出 per M) | ウェイト | 独立評価 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950B | 1M | $2 / $6 | 未公開(約束中) | なし |
| Kimi K3 | 2.8T / ~500B | ~1.05M | $3 / $15 | 公開済(7/27) | AA Index ≈57.1 |
| DeepSeek V4-Pro | 1.6T / 490B | 1M | 未完全公開 | 公開済 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | V4-Pro 同 | 1M | 未完全公開 | 公開済 | 9 項ベンチで V4-Pro 超 |
| Claude Fable 5 | 非公開 | 1M | $10 / $50 | クローズド | Arena Text #1 |
比較可能な唯一の独立盲検(269 ファイルの実アーキテクチャタスク):Kimi K3 が 83 点、Qwen3.8-Max プレビュー版 80 点——同档位で互角であり、全面優位とは言えません。詳細は Kimi K3 オープンウェイト公開も参照してください。
公式サイトに Open-Source 表記がある一方、Hugging Face / ModelScope にリポジトリ・ライセンス・確定日はありません。
すべてのベンチマークは阿里巴巴自社フレームワーク由来。Artificial Analysis や Arena 公式チームは GA 版を未再現です。
比較表脚注に「Fable 5 結果は fallback 関与の可能性」とある一方、自社テスト方法論は再現可能な水準まで公開されていません。
プレビュー版 ToS は自動化生産呼び出しを禁止。model card や安全評価もなく、複数機関が本番移行を推奨していません。
注意:性能が劣るという意味ではありません——独立盲検では Kimi K3 と同档です。ただし「GPT-5.6 Sol を上回る」等の結論は現時点では主に阿里巴巴側の主張であり、ウェイト公開と第三者再現を待つべきです。
QwenCloud / Model Studio で API を開通し、OpenAI または Anthropic 互換エンドポイントで基本対話と reasoning.effort 三档を検証します。
SWE-bench Pro、Arena 暫定ランキングと照合し、自社シナリオが強み(長期 Agent、多モーダル)か弱み(HLE 43.6)かを確認します。
OpenClaw / Qoder 設定で base URL と API Key を切り替え、小流量プローブで Kimi K3 / DeepSeek のレイテンシとコストを比較します。
Hugging Face 上の Qwen3.8-27B オープンソース進捗を注視します——ローカル私有化が必要なら 27B の方が 2.4T フルより現実的です。
実 macOS グラフィック環境で OAuth、ブラウザ DevTools、システム権限の検収を完了します(後述 VNCMac シナリオ参照)。
{
"model": "qwen3.8-max",
"reasoning": { "effort": "xhigh" },
"enable_thinking": true,
"max_tokens": 8192
}
API は QwenCloud 経由で利用可能です。OpenAI および Anthropic 互換プロトコルに対応しています。ウェイトは未公開で、8 月 10 日前後に Hugging Face / ModelScope のリポジトリとライセンスが公開される見込みです。
権威ある統一ベンチはまだありません。唯一の独立盲検では Kimi K3 83 点、Qwen3.8-Max プレビュー 80 点で同档位。K3 はウェイト公開済みで第三者データあり。Qwen は API が安く多モーダルが充実。Kimi K3 オープンウェイトも参照してください。
MoE 実活性 950 億で、API コストは千亿級に近い水準です。フルバージョンのローカル展開にはデータセンター級ハードが必要。現実的な選択肢は API か Qwen3.8-27B 待ちです。
参考にはなりますが結論ではありません。データは阿里巴巴自社フレームワーク由来、Arena は Preliminary 表記。第三者再現か自社 A/B テストを推奨します。
中国版 Apple Intelligence の生成 AI は圧縮 Qwen を端末ローカルで実行。開発者はより安価なフラッグシップ API で OpenClaw 等 Agent ツールチェーンに接続できます。
Qwen3.8-Max は国産大規模言語モデルを Arena テキスト前五へ押し上げ、$2/$6 の API 料金と OpenClaw 互換プロトコルで Agent 移行のハードルを下げました——ただしウェイトは未着地、ベンチは第三者未再現であり、「Open-Source」表記は現時点では意図を示すもので、成果物ではありません。主力機が Windows/Linux でも、実 macOS グラフィック環境で千問オフィス連携、OpenClaw マルチモデルルーティング、iOS ビルドと Agent ベンチの並行検証が必要なら、Mac 自購は高コスト、純 SSH では OAuth とシステムダイアログが押せません。
VNCMac リモート Mac レンタルなら時間課金で VNC デスクトップを開通し、隔離ノード上で Qwen3.8-Max API と Agent ワークフローを検収できます。Mac レンタルプランをご確認ください。背景詳細は Kimi K3 オープンウェイト公開も参照してください。
出典:阿里巴巴公式ブログ、Arena.ai、Apidog、TechNode、Apple Intelligence 中国版関連報道等。最新情報は公式発表をご確認ください。