2026年8月28日、騰訊(テンセント)混元チームは次世代大規模言語モデル「Hy4 preview」を公開し、オープンソースとして重みを公開した。総パラメータ7700億、トークンあたり活性490億、コンテキスト長は100万トークン超。「生産性のために作られた」というポジショニングは明確だ。騰訊社内のブラインド評価(内部専門家163名、エンジニアリングタスク203件)で、Hy4 previewは4点満点中2.99を記録し、智譜のGLM 5.3(2.92)と月之暗面のKimi K3(2.94)を僅差で上回った。バイトダンスの「豆包工作」発表とアリババのQwen3.8-Flash公開から数日という、3大企業がモデルとオフィスAgent製品を同時に投入した週で、AIオフィス戦争にモデルレイヤーの正面戦線が加わった。
1. 何が起きたか:リリース+重みの公開
Hy4 previewは、2026年2月にインフラを再構築して以来の混元最大のスケールアップだ。主要スペック:
| スペック | 値 |
|---|---|
| 総パラメータ | 770B |
| 活性パラメータ | トークンあたり49B |
| コンテキスト長 | 100万トークン超 |
| ポジショニング | 「生産性のために」——コーディング、オフィス、科学 |
| 状態 | 公開+オープンソース(騰訊発表ではオープンソースモデル第一梯団) |
WorkBuddy・CodeBuddy(中国版・国際版)、元宝、imaなど騰訊製品に同時搭載。開発者は騰訊雲TokenHubまたはOpenRouter経由でAPIを利用可能。
2. 重要な数字:GLM 5.3・Kimi K3とのブラインドテスト
最も引用に値する評価は騰訊社内のブラインドテストだ。内部専門家163名が203のエンジニアリングタスクを採点し、Hy4 previewは平均2.99/4、GLM 5.3が2.92、Kimi K3が2.94だった。差は僅少で、評価実施者は騰訊自身であるため、独立ベンチマークというより方向性のシグナルとして受け止めるべきだ。モデルと同時公開された公開ベンチマーク表では、Qwen 3.8 Max、DeepSeek V4 Pro、GPT 5.6 Sol、GLM 5.3、Kimi K3、Claude Opus 5を相手に、エージェント型コーディングスイート(Terminal Bench 2.1、DeepSWE、ALE-CLI、Toolathlon)や推論セット(Humanity's Last Exam、HorizonMath)で比較されている。
はっきりさせておくべき留意点が2つ。社内ブラインドテストは評価者のタスク分布に有利で、「preview」は正式版で変化がありうる。信頼できる中核の主張はより狭いが依然として重要だ——Hy4 previewはオープンソース頂上層で競争力があり、特に生産性ワークロードで差別化されている。
3. 生産性のために:4つのシナリオ強化
Hy4はWorkBuddy・CodeBuddyとCo-Designされ、ソフトウェア工学・ゲーム・金融・セキュリティの騰訊上級専門家との高品質データ共同構築で訓練されている:
| シナリオ | 新機能 |
|---|---|
| ソフトウェア工学 | 長期間開発タスクの理解・計画・デバッグ・検証を強化。フロントエンドの視覚品質も向上——複数章のキャラクター画風と物語の一貫性を維持するネイティブWebGLインタラクティブ漫画ページの生成をデモ |
| オフィス・分析 | 複雑な職場環境の理解と金融分析力を大幅強化。データ分析・ファイル横断コラボを最適化——72ファイルの請求書コンプライアンスチェックを3件の規定文書と照合し、文書・表・プレゼン納品まで実行するデモ |
| ゲーム開発 | 一文の要求からプレイ可能なプロトタイプを生成。ゲームエンジンを熟練操作——MCP経由でUnreal 5を接続し、会話だけでシューティングゲームのデモをゼロから構築するデモ |
| 科学研究 | AI研究開発、分子動力学シミュレーション、凝縮系物理、基礎数学など複雑な研究課題の推論・解決力が大幅向上 |
マーケターが注目すべきはオフィスシナリオだ。数十ファイルを取り込み、規定ルールを適用し、完成した文書やデッキを納品するモデルは、豆包工作や千問オフィスが競う「デジタル従業員」ワークフローそのものだ。
4. 再帰的自己改善:モデルが自分自身の開発に参加
技術的に最も注目すべき主張:Hy4 previewは自身の開発過程に参加した。訓練手法・データ戦略・評価体系・低レベル演算子の最適化について方案を提案し、実験を実行し、結果を次の反復に反映——初期段階の再帰的自己改善ループだ。さらに自身の推論インフラのボトルネックを自律分析し、演算子融合と通信最適化を複数ラウンド実施、ベースライン比でエンドツーエンドスループット31.8%向上(コンテキスト長・同時実行数を問わず安定)。この規模の自律的インフラチューニングは、モデルが自らの訓練パイプライン内でエージェントとして動く未来の初期の兆しだ。
5. 価格と提供状況
| 項目 | 価格 |
|---|---|
| 入力 | 100万トークン6元($0.834) |
| 出力 | 100万トークン18元($2.501) |
| キャッシュヒット | 100万トークン0.3元($0.042) |
Qwen3.8-Flash(1元/3元)より高額だが、コモディティではなくフラッグシップ級の価格設定だ。フィードバック収集を加速するため、WorkBuddyとCodeBuddyが2週間の期間限定無料となり、Hy3の無料提供は9月30日まで延長された。これはラングラブ(領土獲得)戦略だ——バイトダンスの30日間豆包工作トライアルがユーザーを奪う前に、Hy4でWorkBuddyに企業ユーザーを取り込む狙いだ。
6. プレビュー先行戦略と2か月サイクル
2026年2月のインフラ再構築以来、混元は約2か月ごとに大バージョンを反復し、プレビュー先行・正式版追従のリズムで実世界のフィードバックを開発に取り込んできた。次のHy4バージョンも近く展開開始という。これはアリババがQwen3.8-Flash-Nextで使った「アーキテクチャ・カナリア」と同じパターンだ。フロンティアをオープンで出し、エコシステムに適応させ、その後正式化する。Qwenのプレビュー戦略と混元のプレビューサイクルを見ると、中国の上位ラボは「継続的オープンリリース」をデフォルトの競争姿勢として収束させている——米国勢のクローズドな基調講演待ちとは対照的だ。
7. マーケターとブランドへの意味
- モデルレイヤーとオフィスAgentレイヤーは同一戦場になった。 騰訊はHy4×WorkBuddy、アリババはQwen×千問オフィス、バイトダンスは豆包モデル×豆包工作。中国のB2Bブランドへの実務的な問いはもう「どのモデルが最強か」ではなく「どのAgentエコシステムが顧客の日常業務をホストするか」だ。各エコシステムは無料期間(WorkBuddy 2週間、豆包工作30日)でユーザー確保を進めている。
- オープン重みがカスタムAIの障壁を下げる。 Hy4のオープン公開により、中国の企業やエージェンシーはコンプライアンスが厳しいワークフロー向けにトップクラスの生産性モデルをセルフホストできる。金融・医療・官公庁隣接マーケティングなど、海外APIにデータを送れない案件に関連する。
- 生産性ベンチマークが調達基準になりつつある。 実際のエンジニアリング・オフィスタスクでの専門家ブラインド評価(騰訊の203タスクテスト)は、チャットリーダーボードより企業価値の良い代理指標だ。クライアント向けモデル評価ではこの方式を踏襲し、クライアント自身の成果物で採点すべきだ。
まとめ: この1週間で、バイトダンス・アリババ・騰訊がそれぞれフロンティアモデルとオフィスAgentを出した。中国AIスタックは、各社が独自のモデル・Agent・流通面を持つ3つの垂直統合エコシステムに収束しつつある。ブランドは自社の中国オーディエンスがどのエコシステムで働いているかを把握し、そのAgent内で動くコンテンツとサービスを準備すべきだ。
出典:騰訊混元公式発表 via 騰訊新聞 (2026-08-28) https://new.qq.com/rain/a/20260828A07JQX00 ;智通財経 (2026-08-28) https://view.inews.qq.com/a/20260828A07PM500 ;Pandaily (2026-08-28);The Edge Malaysia (2026-08-28)。