データ作成方針
このサイトは、公式ページ、公開資料、公開API、公開学会ページを優先してデータを作ります。 公開DBでは、取得元、最終確認日、分類軸、公開スナップショットを分けて扱います。
優先する出典
Section titled “優先する出典”| 対象 | 優先する出典 | 補足 |
|---|---|---|
| 求人 | 会社公式採用ページ、ATS上の公式求人詳細 | 一覧ページだけでなく個別求人URLを優先します。 |
| 企業指標 | EDINET、有価証券報告書、会社公式IR | 提出会社、親会社、グループ値を分けます。 |
| 学会 | 公式conferenceページ、CFP、program、proceedings | 締切種別と確認日を分けます。 |
| 研究室 | 大学公式ページ、研究室公式ページ、公開研究者DB | 所在地やテーマの根拠レベルを分けます。 |
| 技術解説 | 企業公式資料、学会資料、論文、標準的な公開資料 | 推測だけで断定しません。 |
自動取得と人手確認
Section titled “自動取得と人手確認”求人DBと企業分析DBは、公開ページの取得、分類、公開JSON生成をスクリプトで行います。 分類ミス、地名の正規化、求人終了検知、出典リンクの変更は、検証スクリプトと人手確認の両方で修正対象にします。
自動取得で得た値は、公開前に次の観点で確認します。
| 観点 | 確認すること |
|---|---|
| 出典 | 公式ページ、公開資料、一次情報にたどれるか |
| 日付 | 取得日、確認日、求人終了日、資料年度が混ざっていないか |
| 分類 | 会社分類、職種系統、工程カテゴリ、地域分類が本文と矛盾しないか |
| 表示 | 読者に断定して見せてよい値か、要確認として出す値か |
出典が消えている、個別ページに到達できない、または求人本文と分類が合わない項目は、公開DBで無理に確定値として扱いません。 必要に応じて、差分確認、リンク差し替え、要確認表示、または公開スナップショットからの除外を選びます。
扱わない情報
Section titled “扱わない情報”公開ページの作成では、次の情報をDB項目として使いません。
- 応募者、問い合わせ者、読者から送られた非公開の個人情報
- ログイン、契約、会員登録が必要なページからだけ確認できる情報
- 会社や大学が公開していない内部資料、未公開求人、非公開連絡先
- 出典を確認できないSNS投稿や伝聞だけの情報
読者から受け取った修正依頼は、公開情報の確認に使います。 ただし、連絡者の氏名、メール本文、非公開事情をそのまま公開ページへ載せることはありません。
スナップショット表示
Section titled “スナップショット表示”DBページでは、次の更新基準を分けて表示します。
- データ更新: 公開JSONを生成した時刻
- 求人スナップショット: 求人クロールが成功した時刻
- 企業指標スナップショット: 企業指標を反映した時刻
- snapshot_id: 求人DB、企業DB、技術レーダー、公開JSONで共通にする識別子
修正と再確認
Section titled “修正と再確認”修正依頼、リンク切れ、求人終了、分類ミスを見つけた場合は、該当するDBや技術ページを再確認します。 事実関係が変わった修正は、可能な範囲で 誤記修正ログ に残します。 判断基準そのものを変える必要がある場合は、分類ルール やこのページを更新します。
公開前の分離
Section titled “公開前の分離”作業中の取得結果、検証用のメモ、公開JSON、公開ページは分けて扱います。 取得できた情報がそのまま公開に適するとは限らないため、出典確認、分類確認、表示確認を通ったものだけ公開面に出します。
| 段階 | 目的 |
|---|---|
| 取得 | 公開ページや公開資料から候補データを集める |
| 検証 | リンク、分類、日付、件数、重複を確認する |
| 生成 | 公開JSONやページ表示に必要な形へ整える |
| 公開 | 読者が見るページ、DB、構造化データへ反映する |
この分離により、未確認データや作業メモが公開DBの確定値として混ざることを防ぎます。