HuggingFace の Kimi-K3

2026/07/27 15:18

HuggingFace の Kimi-K3

RSS: https://news.ycombinator.com/rss

要約

日本語翻訳:

Kimi K3 は、世界初のオープンウェイト型、ネイティブマルチモーダルエージェントモデルであり、合計 2.8 トリリオンのパラメータと大規模な 100 万トークンコンテキストウィンドウを備えることで画期的な成果を示しています。このモデルは長期間にわたるタスクを設計の目的としており、Stable LatentMoE アーキテクチャ内部における Kimi Delta Attention (KDA) および Attention Residuals (AttnRes) を活用することで、Kimi K2 に対して約 2.5 倍のスケーリング効率を実現しています。この高度な構成には、93 レイヤー、MXFP4 クアンタ化、MoonViT-V2 ビジョンエンコーダーが組み込まれており、複雑なコーディング、深い研究、自律エージェントワークフローの処理に優れた性能を発揮します。2026 年 7 月時点での独立したベンチマーク結果は、FrontierSWE(81.2)や DeepSearchQA(95.0)のような高度なタスクにおいてそのリーダーシップを確立しており、一方で Creative Problem Solving(CritPt)においては Claude Fable 5 に後れをとっています。プロプライエタリモデルとは異なり、Kimi K3 のオープンウェイト性と特定のライセンスの下では、研究者がチップデザインから自律的なゲーム開発に至るまで多岐にわたる分野で自由に展開しイノベーションを推進できることを可能にしています。ユーザーはこれらの機能を、vLLM、SGLang、TokenSpeed といったインференシングエンジンを通じて API またはインフェレンシングエンジンを用いてアクセスでき、特定のニーズに合わせて設定可能な推論努力(低/高/マックス)を利用しつつ、有効化された思考トレイルにより完全な透明性を維持できます。このリリースは、排他的な企業ライセンスへの依存を排除した上級 AI エージェントの構築に役立つアクセス可能で高機能なツールを提供することで、業界全体に変革をもたらします。

本文

Kimi K3:世界初のオープンソース化された 2.8T クラスネイティブ・マルチモーダル・エージェントモデル

1. モデルの概要と主な特徴

Kimi K3 は、2.8 兆パラメータを備えた当社史上最高性能のモデルであり、世界初としてオープンソース化されています。従来の手法に加え、Kimi Delta Attention (KDA)Attention Residuals (AttnRes) を採用し、長期的なコーディングや知識業務、推論といった最先端のインテリジェンスを実現するよう設計されています。

主要な特徴

  • 革新的なアーキテクチャ
    • KDA と AttnRes:Stable LatentMoE フレームワークにより MoE のスパース性を向上(896 エクスパート中 16 活性化)。
    • 効率性の向上:Kimi K2 に比べてスケーリング効率が約 2.5 倍改善。
  • 長期的コーディング支援
    • 人間介入を最小化し、長期間にわたるエンジニアリングセッションを維持。
    • 巨大なリポジトリのナビゲーションやターミナルツールの調整が可能。
    • GPU カーネル最適化、コンパイラ開発、ゲーム開発(ビジョン・イン・ザ・ループ)、CAD、チップ設計などに対応。
  • エージェント型知識業務
    • エンドツーエンドの知識業務を推進。
    • インタラクティブな可視化、ダッシュボードによる深い研究、モーションデザイン、ビデオ編集を生産。
  • ネイティブ・マルチモーダル性と超長コンテキスト
    • 同一モデル内でテキスト、画像、ビデオを理解。
    • 100 万トークンのコンテキストウィンドウを内蔵。
  • オープンな最先端重み
    • 「Kimi K3 ライセンス」の下で完全なモデル重みを公開(研究、デプロイメント、イノベーションの促進)。

2. モデル詳細仕様

項目数値/内容
総パラメータ数2.8T (2.8 兆)
活性化パラメータ数104B
層の数93
アテンション機構KDA & ゲート付き MLA
固有の層の数1
アテンション層構成69 KDA + 24 ゲート付き MLA
アテンション隠れ次元7168
アテンションヘッドの数96
潜在 MoE 次元3584
各エキスパートの MoE 隠れ次元3072
エキスパートの数896 (各トークンあたり選択数:16)
共有エキスパートの数2
語彙サイズ160K
コンテキスト長さ1,048,576 (100 万トークン)
活性化関数SiTU-GLU
ビジョンエンコーダMoonViT-V2 (401M パラメータ)
モーダルリティテキスト、画像、ビデオ
量子化対応MXFP4 重み / MXFP8 アクティベーション(量子化感知トレーニング)

3. 評価結果:ベンチマーク比較

Kimi K3 は推論・知識・コーディング・エージェント型・ビジョンの各分野において、主要な競合他社モデル(Claude, GPT, GLM など)と比較して卓越したパフォーマンスを発揮しています。

ベンチマークスコアサマリー (Top 5 指標)

  • 推論と知識: GPQA Diamond で 93.5 (GPT-5.6 Sol の 94.1 に次ぐ高水準)。
  • コーディング: Terminal-Bench 2.1 で 88.3、ProgramBench で 77.8
  • エージェント型: BrowseComp で 91.2、DeepSearchQA(F1) で 95.0
  • ビジョン: OmniDocBench で 91.1、MathVision で 97.8(ツール拡張あり)。

詳細ベンチマーク表

ベンチマークカテゴリ主要タスクKimi K3(max)他社代表モデル (最大値)備考
推論と知識GPQA Diamond93.5GPT-5.6 Sol: 94.1単一ステップタスクで高スコア維持
CritPt23.4GLM-5.2: 20.9専門知識问答
AA-LCR74.7GPT-5.5(xhigh): 74.3論理的推論能力
HLE-Full56.0Claude Opus 4.8: 57.9ツール拡張あり(最高スコア)
コーディングDeepSWE67.5GPT-5.6 Sol: 73.0Kimi Code ハネス評価
Terminal-Bench 2.188.3GPT-5.6 Sol: 88.8ターミナル操作能力
ProgramBench77.8GPT-5.6 Sol: 77.6コード生成精度
SWE-Marathon42.0Claude Fable 5: 35.0長期間にわたるタスク解決
FrontierSWE81.2Claude Opus 4.8: 86.6複雑なソフトウェア工学問題
エージェント型BrowseComp91.2GPT-5.6 Sol: 90.4ブラウザ操作能力
DeepSearchQA (F1)95.0Claude Fable 5: 94.2検索および情報抽出
MCPMark-Verified94.5GPT-5.6 Sol: 92.9マルチコンポーネント連携
OSWorld-Verified84.8Claude Fable 5: 85.0オペレーティングシステム操作
Harvey Lab-AA94.6GPT-5.6 Sol: 87.2高度な推論タスク
ビジョンOmniDocBench91.1GPT-5.5(xhigh): 89.4ドキュメント理解能力
Video-MME (w. sub)90.0GPT-5.6 Sol: 89.5ビデオ分析能力
MathVision97.8GPT-5.6 Sol: 97.8数式と画像の統合理解
MMMU-Pro83.4GPT-5.6 Sol: 84.6多模态大学入学試験

※注釈: すべての結果は推論努力

max
、temperature 1.0 で得られています。一部タスク(HLE-Full など)ではツール拡張の有無によるスコアが併記されています。

4. ネイティブ MXFP4 量子化

Kimi K3 は、SFT ステージから MXFP4 重みMXFP8 アクティベーション を使用しています。これにより、広いハードウェア互換性を確保しつつ、**量子化感知トレーニング(Quantization-Aware Training)**を適用したことで精度を維持しています。

5. デプロイメント方法

Kimi K3 にアクセスするには、platform.kimi.ai

kimi-k3
を選択して API に接続します。OpenAI や Anthropic と互換性のある API も提供されています。

推奨される推論エンジン:

  • vLLM(レシピ集参照)
  • SGLang(クックブック参照)
  • TokenSpeed(レシピ集参照)

6. モデルの使用法とコーディングエージェント

Kimi K3 は常に思考(リフレクション)が有効であり、

reasoning_content
を返します。思考努力は
reasoning_effort
パラメータで制御可能(low, high, max)。

保持された思考履歴モードのサンプルコード

マルチターン会話やツールコールでは、API から返される完全なメッセージ(

content
,
reasoning_content
,
tool_calls
)をそのまま入力する必要があります。

import openai

def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
    messages = [
        {
            "role": "user",
            "content": "Tell me three random numbers."
        },
        {
            "role": "assistant",
            "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
            "content": "473, 921, 235"
        },
        {
            "role": "user",
            "content": "What are the other two numbers you have in mind?"
        }
    ]

    response = client.chat.completions.create(
        model=model_name,
        messages=messages,
        stream=False,
        max_tokens=4096,
        reasoning_effort="max", # 思考努力レベルを最大に設定
    )
    
    # 思考プロセスを確認
    print(f"Thinking process: {response.choices[0].message.reasoning}")
    return response.choices[0].message.content

コーディングエージェントフレームワーク

Kimi K3 は Kimi Code CLI と組み合わせることで、エージェントとして最も効果的に動作します。

  • ターミナルで
    kimi code
    を実行してください。
  • /model
    コマンドを使用して Kimi K3を選択して利用できます。

さらに詳細なガイド(ビジョン入力、構造化出力、ツール選択など)については、Kimi K3 クイックスタート および 思考努力のドキュメント を参照してください。

7. ライセンスとアクセス情報

  • ライセンス: コードリポジトリおよびモデル重みは、Kimi K3 ライセンスの下でリリースされています。
  • ダウンロード数: 前月 2,850
  • オープンソース化: 最先端のインテリジェンスを研究・デプロイメント目的で完全開放。

8. お問い合わせ

詳細な質問やサポートが必要な場合は、以下までご連絡ください。

同じ日のほかのニュース

一覧に戻る →

2026/07/28 7:03

オープンウェイトモデルに関する当社の立場

## Japanese Translation: Anthropic の CEO ダリオ・アモデイは、オープンウェイトの AI モデルに対する全面的な禁止に反対し、同社がそのような制限を支持したことはないと主張している。彼は、危険な能力を持たないオープンウェイトモデルを不可欠な公共財として位置づけ、主な国家安全保障上の懸念として、共産主義中国(CCP)などの権威主義体制が、恒久的な軍事優位や抑圧のために優れた AI を構築しようとするリスクを挙げており、このリスクは副大統領ヴァンスの最近の警告や米国当局による世界的競争力に関する情報評価によって強調されている。彼の二次的な懸念には、サイバー攻撃、生物学的脅威、またはアライメント(調整)失敗への悪用が含まれる。アモデイは、オープンウェイトモデルはガードレールの実行が難しく、リリースされた重み(weights)を回収できないため、閉鎖型モデルよりも高いリスクをもたらすと指摘している。これらの脅威を緩和しつつ有益なイノベーションを維持するため、彼は以下の目標志向戦略を提唱している:中国への高度な半導体および装備の輸出制限、モデルの密輸入や産業規模での蒸留(distillation)操作への取り締まり、そして公開前に十分に能力のあるすべてのモデルに対して安全性テストの実施を義務付ける。彼は、全面的な禁止は効果的でもなく、Anthropic が求める解決策でもないとし、代わりに回収不能なシステムにおけるリスク管理を進めつつ、安全性にコミットしている者にとってのアクセスを維持することを主張している。

2026/07/25 16:55

Go の新しいガベージコレクションがヒープを走査していく様子

## Japanese Translation: Go の新しい Green Tea ゴー・コレクター(v1.26 以降のデフォルト)と C# を比較した評価から得られる主な示唆は、CPU キャッシュ効率とメモリアン断片化の間にある明確なトレードオフである。Green Tea は連続したスパンへの割り当てを最適化することでキャッシュミスが大幅に減少するが、オブジェクトを解放する際に移動やコンパクト化を行うことはできない。その結果、C# の移動式コレクターが積極的に関与してヒープをコンパクト化し OS に散在ページを返すのと異なり、Go は大量の解放後(例:90% のオブジェクトを解放)も未解放オブジェクトがばら撒かれたままとなる。 裸の金属 x86 システムでのテストにより、この断片化は介入なしに持続することが確認された。しかし、開発者は `unsafe` ポインタを使用して残存するオブジェクトを手動でパッケージ化することでこの制限を回避し、実質的にコンパクト化を模倣してシステムリソースを取り戻すことができる。結論として、Go は真の CPU パフォーマンス向上を提供するものの、複雑な回避策なしにヒープをコンパクト化できないという Go の不具合は依然として大きな制約であり、長期的動作を必要とし効率的なメモリ回収を要求するアプリケーションにおいては、C# が優れたアーキテクチャ上の振る舞いを提供することが組織にとって認識すべき点である。

2026/07/28 4:58

HN ランチ:Rise(YC S26)——廃棄物ガスを貴重な化学物質に変える

## Japanese Translation: Rise Reforming は、シカゴ郊外の下水処理施設でパイロットプラントの建設を正式に開始し、2026 年 7 月の稼働を目指しています。2025 年 12 月には 65 万ドルの前種投資を受け、初雇用の Nina Kritikos を擁し、同社は 2026 年 4 月に 1,800 時間以上の連続運転を通じて安定した概念実証結果を達成しました。また、プロジェクトはバイオガス生産者との拘束力のある供給契約および複数の覚書(MOU)を確保しています。 同社の固有技術では、下水処理廠などの発生源から排出される国内の滞留バイオガス(廃棄ガス)をメタノール、ジメチルエーテル(DME)、ジメチルカーボネート(DMC)といったグリーン化学物質に変換します。このアプローチは、化石燃料の採掘・精製・輸送に伴う環境コストを回避する低価格な代替策を提供することで、従来の石油化学製品と直接的に競合しています。主要な革新点は、許可手続きの長期遅延なく特定の施設の要件に合わせて迅速に導入および容易にスケールアップ可能なモジュール式でコンテナサイズの設計にあります。 Rise Reforming は 2026 年 7 月、成長とスケールアップのさらなる加速のために Y Combinator の S26 バッチに参加しました。廃棄物を価値ある化学物質に変えることで、即座の財政的リターンを提供しつつクリーンなエネルギー未来を支援することを目的としています。過去のマイルストーンには、2025 年 5 月に European Aerosols Federation 2025 Start-Up Award を受賞し、George Rose が 776 Foundation から Climate Fellow に選出されたことが含まれます。

HuggingFace の Kimi-K3 | そっか~ニュース