英語からの翻訳

文書分類は、文書を事前定義されたカテゴリに割り当てるもので、図書館情報学の伝統とコンピュータ科学のアルゴリズム的手法を組み合わせたものです。テキスト、画像、その他のメディアに対する手動、自動、およびハイブリッドなアプローチを対象としています。

文書分類(ドキュメント分類とも呼ばれる)は、図書館情報学、情報科学、および計算機科学におけるタスクであり、文書を1つ以上のクラスまたはカテゴリに割り当てることを伴う。この割り当ては、図書館員や主題専門家によって手動で行われることもあれば、計算技術を用いてアルゴリズム的に行われることもある。知的分類は歴史的に図書館情報学の中心であり、アルゴリズム的分類は情報科学と計算機科学の中心的なトピックであるが、この2つの分野は実質的に重複しており、学際的な研究を促進している。

分類対象となる文書には、テキスト、画像、音楽、その他のメディアが含まれ、それぞれ異なる分類上の課題を提示する。特に指定がない限り、この用語は通常、テキスト分類を意味する。文書は主題によって分類されることもあれば、文書タイプ、著者、出版年などの他の属性によって分類されることもあるが、主題分類が最も一般的な焦点である。主題分類を導く2つの広い哲学がある。内容ベースのアプローチと要求ベースのアプローチである。

内容ベース分類と要求ベース分類

内容ベース分類は、特定の主題に割かれた内容の重みまたは割合に基づいて文書をクラスに割り当てる。例えば、図書館では、書籍の内容の少なくとも20%が割り当てられたクラスに関連している必要があるという規則を適用することが多い。自動システムでは、この重みは文書内の特定の単語または用語の頻度に対応する場合がある。

要求ベース分類は、要求指向分類または索引付けとも呼ばれ、ユーザーの予想されるニーズを優先する。分類者は、どの記述子がユーザーの文書発見に役立つかを尋ね、考えられるすべてのクエリを考慮し、どのクエリに対して文書が関連するかを決定する。このアプローチは、特定のオーディエンスや機関の方針を反映することが多く、例えば、フェミニスト研究データベースは、一般的な歴史図書館とは異なる方法で文書を索引付けする場合がある。要求ベース分類は、実際のユーザー行動に関する経験的データを組み込まない限り、純粋にユーザー主導というよりも、むしろ政策主導として理解されるべきである。

分類と索引付け

文書をクラスに割り当てること(分類)と、文書に主題を割り当てること(主題索引付け)の区別は、しばしば表面的なものと見なされる。情報科学者のフレデリック・ウィルフリッド・ランカスターは、そのような用語上の区別は無意味であり、混乱を引き起こすと主張した。この見解は、分類体系とシソーラスが交換可能であることによって支持されている。分類スキームはシソーラスに変換でき、その逆も可能である。文書に主題用語を割り当てることは、その用語で索引付けされた文書のクラスに文書を割り当てることと同等である。なぜなら、同じ用語を共有するすべての文書は同じクラスに属するからである。

自動文書分類

自動文書分類(ADC)は、計算方法と機械学習を使用して文書を分類する。ADCタスクは3つのカテゴリに分類される。外部フィードバック(人間のラベルなど)が正しい分類を提供する教師あり分類、外部参照なしで動作する教師なし分類(文書クラスタリングとも呼ばれる)、およびラベル付きデータとラベルなしデータを組み合わせた半教師あり分類である。さまざまなライセンスモデルの下で多数のソフトウェア製品が存在する。

一般的な手法には、人工ニューラルネットワークアプローチ、決定木(ID3やC4.5など)、期待値最大化、潜在意味索引付け、ナイーブベイズ分類器、サポートベクターマシン(SVM)、k近傍法アルゴリズム、およびtf-idf(Term Frequency-Inverse Document Frequency)が含まれる。深層学習とトランスフォーマーアーキテクチャの進歩により、単純な単語数以上の意味的文脈を捉える大規模言語モデルベースの分類器など、より洗練されたモデルが可能になった。

応用

文書分類の実用的な応用は多様である。スパムフィルタリングでは、アルゴリズムが不要なメールと正当なメッセージを区別する。電子メールルーティングでは、分類を使用して、トピックに基づいてメッセージを適切な受信者に転送する。言語識別は文書の言語を自動的に検出し、ジャンル分類はその文学的または修辞的タイプを決定する。可読性評価は、さまざまな年齢層や読解レベルのテキストの複雑さを評価し、テキスト簡略化システムをサポートすることが多い。感情分析は、文書で表現された態度や感情的なトーンを識別する。公衆衛生サーベイランスでは、ソーシャルメディア投稿の分類が疾病発生の監視に役立つ。特に生物学における記事トリアージは、データベースでの手動キュレーションのために関連論文を選択する。

課題とトレンド

自動分類における重要な課題は、文書タイプの多様性と自然言語の曖昧さを処理することである。初期のシステムは手作業の特徴量に依存していたが、現代の手法は深層学習を利用して表現を自動的に学習する。生成AIと事前学習済みトランスフォーマーモデルの台頭により、この分野はファインチューニングと少数ショット学習へとシフトし、大規模なラベル付きデータセットの必要性が減少している。しかし、バイアス、解釈可能性、計算コストなどの問題は、依然として活発な研究分野である。図書館情報学、情報科学、計算機科学の間の学際的協力は、手動とアルゴリズムの両方の分類を洗練し続け、システムが進化するユーザーニーズと文書形式に適応可能であることを保証している。

外部リンク

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·information-science·machine-learning·text-analysis
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴