Kimi K2.5は、中国の人工知能企業であるMoonshot AIによって開発された大規模言語モデルのファミリーです。これらのモデルは、高度な推論、コーディング、および一般的なテキスト生成を目的として設計されており、以前のKimi K2アーキテクチャを基盤としています。2025年初頭の時点で、Kimi K2.5ファミリーは、LMArenaやOpen LLM Leaderboardを含む複数の公開LLMリーダーボードに登場しており、ベンチマークスナップショットには5つの異なるバリアントが記録されています。ただし、Moonshot AIはすべてのバリアントを公式にリリースしているわけではなく、一部のエントリは匿名のアリーナ提出としてリストされ、詳細な技術仕様は部分的に未公開のままです。
Kimi K2.5ファミリーは、2024年後半にリリースされた前身であるKimi K2に対する反復的な改善を表しています。これらのモデルはTransformer (architecture)アーキテクチャを採用し、マルチヘッドアテンションとクロスアテンションメカニズムを利用して、長いコンテキストを処理し、一貫性のある応答を生成します。各バリアントの正確なパラメータ数は公に確認されていませんが、ファミリーはより小さな効率的なモデルから、より大きく高性能なバージョンまで、さまざまなサイズにわたっています。モデルは、教師ありファインチューニングと人間のフィードバックからの強化学習(RLHF)の組み合わせを使用してトレーニングされ、出力を人間の好みに合わせています。
公開リーダーボードでの存在
Kimi K2.5モデルは、著名な公開ベンチマークで評価されています。人間の好みの対戦に基づいてモデルをランク付けするLMArenaリーダーボードでは、K2.5バリアントは競争力のあるEloスコアを達成し、OpenAI、Anthropic、Google DeepMindのモデルと並んでトップ層に位置することがよくあります。MMLU、GSM8K、HumanEvalなどのタスクからのスコアを集約するOpen LLM Leaderboardでは、K2.5ファミリーは、特に数学的推論とコード生成において強いパフォーマンスを示しています。たとえば、あるバリアントは、コード合成のベンチマークであるHumanEvalで90%以上、小学校レベルの数学問題集であるGSM8Kで85%以上のスコアを報告されています。ただし、これらのスコアは2025年初頭のスナップショットデータに基づいており、最新のモデルバージョンを反映していない可能性があります。
バリアントとスナップショット
ベンチマークスナップショットで特定されたKimi K2.5の5つのバリアントは、次のようにラベル付けされています:Kimi K2.5-7B、Kimi K2.5-14B、Kimi K2.5-32B、Kimi K2.5-70B、およびKimi K2.5-MoE。7Bおよび14Bバリアントは効率性を重視して設計されており、コンシューマーハードウェアやエッジデバイスでの展開に適しています。32Bおよび70Bバリアントは、パフォーマンスとリソース要件のバランスを提供します。MoE(混合エキスパート)バリアントは、総パラメータ数が約100Bで、アクティブなパラメータ数が少ない可能性が高く、低い推論コストで高いパフォーマンスを達成することを目指しています。最新のスナップショットの時点では、7Bおよび14BバリアントのみがMoonshot AIによって公式にリリースされています。より大きなバリアントは、リーダーボードに匿名エントリとしてのみ表示され、内部評価中または限定ベータ版である可能性を示唆しています。
技術的特徴
Kimi K2.5モデルには、いくつかの高度な技術が組み込まれています。長いシーケンスを処理するために位置エンコーディングを使用し、コンテキストウィンドウは最大128,000トークンで、長いドキュメントやマルチターン会話の処理を可能にします。モデルは生成中にトップkサンプリングとトップpサンプリングを採用し、出力のランダム性と多様性を制御できます。さらに、温度スケーリングを使用して応答の創造性を調整します。トレーニングプロセスには、モデルが徐々に難しい例でトレーニングされるカリキュラム学習や、トレーニングを安定させるための勾配クリッピングが含まれていた可能性があります。モデルは、深層ニューラルネットワークのトレーニングに人気のある選択肢であるAdamオプティマイザのバリアントを使用して最適化されています。
開発とリリース
2023年に設立されたMoonshot AIは、中国のAI環境における主要プレーヤーとしての地位を確立しています。K2やK2.5を含むKimiシリーズは、生成AIにおけるグローバルリーダーと競争するための同社の取り組みの一部です。Kimi K2.5の開発は研究者チームによって主導され、会社全体のエンジニアからの貢献がありました。小さなバリアントの公式リリースは2025年初頭に行われ、7BモデルはHugging Faceで、14Bモデルは同社の独自プラットフォームで利用可能になりました。より大きなバリアントは2025年3月の時点で未リリースのままであり、公開利用可能性に関する公式発表はありません。匿名のアリーナエントリはそのパフォーマンスについての憶測を引き起こしましたが、Moonshot AIはその存在を確認したり、公式のベンチマーク結果を提供したりしていません。
評価と影響
リーダーボードでのKimi K2.5の出現は、AIコミュニティの関心を集めています。独立した評価では、モデルは特に推論タスクにおいて、LlamaやMistralのような確立されたオープンソースモデルと競争力のあるパフォーマンスを発揮することが示唆されています。ただし、より大きなバリアントに関する公式ドキュメントの不足は、報告されたスコアに対する懐疑的な見方を引き起こしています。2025年初頭の時点で、Kimi K2.5ファミリーは、より広範なAIエコシステムにまだ大きな影響を与えていませんが、リーダーボードでの存在は、Moonshot AIがモデルパフォーマンスの限界を積極的に押し広げていることを示しています。将来のリリースと公式ベンチマークは、この分野におけるモデルの位置づけを明確にする可能性があります。