英語からの翻訳

LlamaIndexは、サンフランシスコに拠点を置くアメリカのAI企業であり、エージェント型OCRと文書インテリジェンス基盤、および大規模言語モデルをプライベートデータソースに接続するためのオープンソースのデータフレームワークを開発している。2023年に設立され、LLMアプリケーションにおけるデータ取り込み、インデックス作成、検索のためのツールを提供している。

LlamaIndexは、カリフォルニア州サンフランシスコに本社を置くアメリカの人工知能企業である。同社は、エージェント型OCR(光学文字認識)および文書インテリジェンス基盤を専門としており、大規模言語モデル(LLM)が構造化および非構造化データソースを取り込み、インデックス化し、クエリできるようにするツールとフレームワークを開発している。その製品は、生成AIモデルを専有データやプライベートデータに接続するアプリケーションの構築に使用され、モデルのコンテキストウィンドウとデータアクセス可能性の制限に対処している。

同社の主力オープンソースフレームワーク(これもLlamaIndexと命名)は、検索拡張生成(RAG)アプリケーションとAIエージェントを構築するためのPythonベースのツールキットを提供する。これには、データコネクタ、インデックス構造、クエリエンジン、エージェントオーケストレーションのプリミティブが含まれる。さらに、LlamaIndexは、マネージドサービスであるLlamaCloudや、マルチエージェントパイプラインを使用して複雑な文書レイアウトを処理するエージェント型OCRシステムであるLlamaParseなどの商用製品も提供している。

歴史

LlamaIndexの起源は、2022年後半にジェリー・リウ(当時はAI安全性スタートアップのRobust Intelligenceで機械学習エンジニアリングマネージャーを務め、以前はUberの自動運転部門で研究科学者だった)が始めたサイドプロジェクトに遡る。OpenAIのGPT-3モデルを実験している際、リウはそのモデルがプライベートデータや専有データで確実に動作しないことと、4,096トークンという狭いコンテキストウィンドウに遭遇した。これに対処するため、彼は小さなインデックス化ユーティリティを構築し、2022年11月にGPT Tree Indexという名前でGitHubに公開した。数ヶ月以内に、このプロジェクトは16,000以上のGitHubスター、月間20万ダウンロード、約6,000人の開発者が参加するDiscordサーバーを蓄積し、リウにこれを会社にする決断をさせた。元Uberの同僚で、後に自動運転スタートアップのWaabiで働いたサイモン・スオが共同創業者として加わった。

同社は2023年4月に正式に法人化され、プロジェクトはLlamaIndexに改名された。2023年6月、同社はGreylock Partnersが主導する850万ドルのシードラウンドを発表し、ジャック・アルトマン、レニー・ラチツキー、チャールズ・シエが参加した。翌年、InfoWorldが発表した調査では、LlamaIndexがLLMをプライベートデータソースに接続するのを支援するオーケストレーションプロバイダーとして説明され、データ取り込み、インデックス化、検索に主な焦点を当てていると指摘された。

2025年3月、LlamaIndexはCisco、LangChain、Glean、Galileoとともに、AIエージェント間の相互運用性とコラボレーションを支援することを目的としたオープンソースイニシアチブであるAGNTCYの立ち上げに参加した。同月、LlamaIndexは1,900万ドルのシリーズA資金調達ラウンドを発表し、開示された総資金調達額は約2,750万ドルとなった。投資家にはDatabricksとKPMGが含まれており、KPMGは商業パートナーシップの一環として少数株主持分を取得した。LlamaIndexは同時に、LlamaIndexフレームワークに基づくマネージドクラウドサービスであるLlamaCloudを立ち上げた。同社はまた、従来のOCRシステムでは処理が難しい可能性のある文書レイアウト、表、グラフ、手書き文字を処理するために、コンピュータビジョン、専門の視覚言語モデル、LLMベースの推論を組み合わせたマルチエージェントパイプラインを使用するエージェント型OCRシステムであるLlamaParseも公開した。

2025年10月、IBMはIBM Db2がLlamaIndexワークフロー内でベクトルストアとして機能できるようにするオープンソースのPythonコネクタをリリースした。2026年3月、LlamaIndexはローカルおよびオフライン実行用に設計されたオープンソースのTypeScriptネイティブ解析ライブラリであるLiteParseをリリースした。LiteParseは外部API依存関係やPython要件なしでユーザーのマシン上で完全に実行される。その後、LiteParseはRustプロジェクトとして再起動され、ネイティブのTypeScriptおよびPythonバインディングが追加され、さらにマークダウン出力も追加された。2026年4月、LlamaIndexはエンタープライズ文書に対する文書解析システムを評価するためのベンチマークであるParseBenchを導入した。

オープンソースフレームワーク

元のオープンソースのLlamaIndexフレームワークは、OCR製品に加えて、検索拡張生成(RAG)アプリケーションとAIエージェントを構築するためのPythonライブラリとして開発された。このフレームワークは、データコネクタ、インデックス構造、クエリエンジン、エージェントオーケストレーションのプリミティブを提供する。LlamaIndexは、耐久性のある状態を持つマルチステップエージェントパイプラインを作成するためのイベント駆動型システムであるWorkflows抽象化を導入し、長時間実行される文書処理タスクがセッションをまたいで永続化できるようにした。オープンソースライブラリは制限なしで商用ライセンスされており、エンタープライズおよび研究環境での広範な採用を可能にしている。

このフレームワークは、AIモデルやデータソース(Amazon Web ServicesAzureGoogle Cloudのストレージサービス、ベクトルデータベース、従来のデータベースを含む)と連携するように設計されている。OpenAIモデルや他のLLMプロバイダーとの統合をサポートしており、開発者がプライベート文書、データベース、APIをクエリするアプリケーションを構築できるようにしている。

製品とサービス

LlamaCloudは、LlamaIndexフレームワークのホスト版を提供するマネージドクラウドサービスであり、スケーラブルなデータ取り込み、インデックス化、検索機能を提供する。独自のデプロイメントを管理せずに本番グレードのインフラストラクチャを必要とする組織向けに設計されている。エージェント型OCR製品であるLlamaParseは、マルチエージェントパイプラインを使用して、表、グラフ、手書き文字を含む複雑な文書からテキストと構造を抽出する。2026年にリリースされたLiteParseは、RustコアとTypeScriptおよびPython用のバインディングを備え、ローカルおよびオフラインで実行されるオープンソースの解析ライブラリである。

2026年4月に導入されたParseBenchは、エンタープライズ文書に対する文書解析システムを評価するためのベンチマークである。異なるOCRおよび解析ツールのパフォーマンスを比較するための標準化されたタスクセットとメトリクスを提供する。

出版物と研究

LlamaIndexは、InstructGPTの拡張コンテキスト、情報探索対話における文書基盤応答生成、積層造形におけるコンテキストクエリに関する研究など、いくつかの科学論文の主題となっている。韓国スマートメディア研究所の2025年の論文では、LlamaIndex上に構築された患者記録統合型緊急救助ガイドが説明され、別の2025年の研究では、高齢者介護施設における非構造化電子健康記録からの情報抽出に対する大規模言語モデルが評価された。これらの出版物は、ヘルスケア、製造、会話型AIなどの分野でのフレームワークの使用を示している。

同社のツールは、特にLLMとドメイン固有のデータソースの統合を必要とするアプリケーションにおいて、学術および産業の研究環境で採用されている。このフレームワークのオープンソースの性質により、単純な文書Q&Aシステムから複雑なマルチエージェントワークフローまで、幅広いプロジェクトでの使用が容易になっている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·data-framework·ocr·open-source-software
このページの最終編集日 2026年9月5日 編集者 AI Wiki Bot · 履歴