Web収集・クローリング•Corpsta 編集部
#データ収集#オープンデータ#公式サイト

No.7 企業情報はどこから集めるべきか

企業情報データベースを構築・運営する上で、多くのプロジェクトが最初につまずくポイントがあります。それが「情報の収集元(ソース)」の選定です。 「データなんてネットにいくらでも転がっている」と考えて安易に収集を始めると、後で取り返しのつかない汚染データが出来上がります。信頼できるデータベースを作るためには、プロフェッショナルな視点でソースを選定し、その特性を理解して組み合わせる戦略が不可欠です。

本記事では、企業情報の種類と適切な収集元、そしてプロが実践する収集戦略について解説します。


1. 企業情報にはどんな種類があるのか

一口に「企業情報」と言っても、その性質は様々です。大きく以下の3つに分類して管理することが、構造化の第一歩です。

基本情報(Identity)

企業を特定するための最も基礎的な情報です。

  • 具体例:正式名称、法人番号、本店所在地、設立年月日
  • 特徴:頻繁には変わらないが、変更があった場合は過去との紐付け(名寄せ)が不可欠となります。これらが間違っていると、データベースとしての価値は限りなくゼロになります。

法的情報(Legal Status)

企業の法的状態やガバナンスに関わる情報です。

  • 具体例:資本金、役員構成、許認可情報、処分履歴
  • 特徴:公的な裏付けが必要な情報です。「自称」ではなく、登記や官報に基づいた正確性が求められます。

活動情報(Activity)

企業がどのような事業を行い、どのような状態にあるかを示す動的な情報です。

  • 具体例:事業内容、決算数値(売上・利益)、従業員数、ニュースリリース、拠点一覧
  • 特徴:更新頻度が高く、情報の鮮度が重要視されます。また、定性的な情報が多く、数値化・構造化が難しい領域でもあります。

2. 主な情報ソース一覧

信頼できるデータベースを作るために参照すべき主なソースは以下の通りです。

公的データ(Public Sector)

国や自治体が公開しているデータです。最も信頼性が高いと言えます。

  • 登記情報提供サービス:法務局が管理する商業登記情報。有料ですが、正確性は最強です。
  • 国税庁法人番号公表サイト:全ての法人に付与される13桁の番号。基本情報のマスターデータとして最適です。
  • EDINET(金融庁):上場企業の有価証券報告書。詳細な財務・事業情報が含まれます。

企業公式発表(Official Release)

企業自身が発信する情報です。最新の情報が得られますが、ポジティブな側面に偏る可能性があります。

  • コーポレートサイト:会社概要、沿革、役員一覧。
  • IR資料:決算説明資料、中期経営計画。
  • プレスリリース:新サービス、提携、人事異動。

Web APIの活用

大規模な収集においては、人間が見るためのWebサイト(HTML)スクレイピングだけでなく、システム連携用のAPI活用も検討すべきです。

  • gBizINFO(経済産業省):法人基本情報、補助金申請情報などをXML/JSONで取得可能。
  • 適格請求書発行事業者公表システムWeb-API:インボイス制度対応のために必須となるデータソース。精度の高い法人名と登録番号の紐付けが可能。 APIはスクレイピングに比べて仕様変更のリスクが低く、安定した運用が可能です。

民間データ(Private Sector)

調査会社やメディアが提供する情報です。

  • 信用調査会社:帝国データバンクや東京商工リサーチなど。独自の調査網による詳細な評点やリスク情報。
  • 求人サイト:現在の採用活動状況や、実際の勤務条件など、現場のリアルな情報。

3. 情報ソースごとの信頼性と限界

どのソースも完璧ではありません。それぞれの「限界」を理解しておく必要があります。

最新性の問題(Time Lag)

公的データは正確ですが、反映までにタイムラグがあります。例えば、登記情報の変更には申請から登記完了まで数日〜数週間かかります。逆に、企業のWebサイトは即座に更新されることもあれば、数年間放置されていることもあります。「いつ時点の情報か」を常に意識しなければなりません。

鮮度と信頼性のマトリクス

ソース種別 信頼性 鮮度 コスト
商業登記 ◎ △ 高
公式サイト ◯ ◎ or × 低
プレスリリース ◯ ◎ 低
求人サイト △ ◯ 中

このように、トリレンマ(三すくみ)の関係にあることを理解し、一つのソースで全てを解決しようとしないことが肝要です。

虚偽・誇張リスク(Falsehood)

企業自身が発信する情報には、見栄や誇張が含まれることがあります。例えば「資本金」などは登記を見れば真実がわかりますが、「従業員数」などは「グループ全体を含む」「アルバイトを含む」などの定義が曖昧なまま記載され、実態より大きく見せているケースが散見されます。

4. 複数ソースを組み合わせる理由

プロのデータベース運営者は、決して単一のソースを鵜呑みにしません。

単一ソース依存の危険性

例えば、国税庁のデータだけでは「事業内容」や「従業員数」はわかりません。逆に、企業のWebサイトだけでは「本当にその会社が存在しているか(ペーパーカンパニーではないか)」の確認が不十分です。複数の視点からクロスチェックすることで、情報の「厚み」と「確からしさ」を担保する必要があります。

矛盾が生まれる構造

複数のソースを集めると、必ず矛盾が生じます。

  • 登記上の住所:東京都千代田区…
  • Webサイト上の住所:東京都港区…(移転したが登記がまだ、あるいは実質的な本社機能が違う場所にある)

この「矛盾」こそが重要です。矛盾を発見し、「どちらが現在の実態に近いか」を判断するロジックを組むことこそが、付加価値の高いデータベースを作る鍵となります。

5. スクレイピング技術の選定戦略

収集元が決まったら、次は「どうやって集めるか」です。ここにも技術的な選択肢が存在します。

静的解析 vs 動的解析

  • Requests + BeautifulSoup (Python): 高速だが、JavaScriptで描画されるコンテンツ(SPAなど)には無力。
  • Selenium / Playwright / Puppeteer: ブラウザを自動操作するため、人間が見ているのと同じ画面を取得できるが、リソース消費が激しく速度が出ない。

多くの企業情報サイトは、トップページは軽量でも、詳細情報は動的にロードされるケースが増えています。リソース配分としては、まず軽量な静的クローラで全体を舐め、失敗したサイト、あるいは重要度の高いサイトのみヘッドレスブラウザで深掘りするといった「ハイブリッド構成」が定石です。

6. 企業情報サイト運営者の判断基準

最後に、情報を掲載する際の判断基準について触れておきます。

掲載可否の判断

全ての情報を載せれば良いわけではありません。風説や不確かな噂レベルの情報は排除すべきです。「出典が明記できるか」「第三者が検証可能か」を基準にしましょう。

更新頻度の設定

全企業を毎日更新するのはコスト的に不可能です。

  • 上場企業:毎日チェック(株価、リリースの変動が激しい)
  • 一般企業:月次や年次での定期クロール といったように、企業の重要度や変化の頻度に合わせて更新サイクルを設計することが、運用コストと品質のバランスを保つ秘訣です。

企業情報の収集において重要なのは、情報の「正確性」と「網羅性」のバランスです。 各ソースの特性(信頼性、更新頻度、コスト)を客観的に評価し、目的に応じて最適なポートフォリオを組むこと。この合理的な設計プロセスが、データベースの品質を決定づけます。

この記事をシェアする:

おすすめの関連記事