{
  "note": "gxai.dev の概要ページが引用する証拠。書籍『証拠なき非財務情報』（三部作第3部・未公刊）第7章「PDF開示で失われる出所・座標・計算過程」の証拠台帳から、実際に引用した分だけを抜き出したもの。台帳側の verified は「実際に fetch / Read したときだけ true」という規律で付けられている。ここに無い ID をページの data-src に書くと scripts/verify-site.mjs が落ちる。",
  "extracted_from": "nonfin-evidence-book / manuscripts/ch07-pdf-disclosure-loss/sources.json",
  "extracted_at": "2026-08-10",
  "url_reachability_checked_at": "2026-08-10",
  "sources": [
    {
      "id": "B1",
      "type": "own-work",
      "verified": true,
      "public": false,
      "label": "書籍『証拠なき非財務情報』企画（未公刊）",
      "title": "非財務情報における問題の 8 類型と中心命題",
      "locator": "nonfin-evidence-book / BOOK_PLAN.md",
      "claim": "虚偽・数値粉飾・境界粉飾・方法論的粉飾・選択的開示・時間的粉飾・ナラティブ粉飾・情報の紛失の 8 類型。中心命題は「財務情報では取引・証憑・仕訳・承認・訂正履歴を保存する制度が発達したが、非財務情報では文章や最終数値の開示が先行し、その背後を保存する情報基盤が未成熟であるため、虚偽がなくても実態が失われる」。GAP との対応づけは本サイト側の整理であって、同書の記述ではない。"
    },
    {
      "id": "B2",
      "type": "own-work",
      "verified": true,
      "public": false,
      "label": "書籍『証拠なき非財務情報』第8章「証拠ネイティブなAPI・MCP開示」（未公刊・収束済み）",
      "title": "8 類型と GAP の対応（第12節）",
      "locator": "nonfin-evidence-book / manuscripts/ch08-evidence-native-api/draft.md",
      "claim": "仕様書本文のみに基づいて 8 類型との対応を導いた分析。届くのは情報の紛失・数値粉飾・方法論的粉飾の 3 類型だが、いずれも「登録済み記録を事後的にこっそり書き換える」という一経路に限られる。境界粉飾と選択的開示は部分的で、虚偽・時間的粉飾・ナラティブ粉飾は通信規約が原理的に持つ守備範囲の外。このページの対応表は、同章の分析に合わせてある。"
    },
    {
      "id": "B3",
      "type": "own-work",
      "verified": true,
      "public": false,
      "label": "書籍『証拠なき非財務情報』第9章「非財務情報の訂正・保証・内部統制」（未公刊・収束済み）",
      "title": "署名は改ざんの否定であって、真実の保証ではない（第8節）",
      "locator": "nonfin-evidence-book / manuscripts/ch09-correction-assurance-controls/draft.md",
      "claim": "GAP の設計文書を読み直したうえでの確認。算定の直前に署名とハッシュを取り直す仕組みはあるが、活動量の値そのものが現実を正しく計測しているかを検証する仕組みは仕様書のどこにも存在しない。制度が薄いままであれば、改ざんされていない誤った数字が、改ざんされていないという理由でかえって信頼されてしまう、という逆説的な事態も起こりえる（同章が証拠から導く懸念であって、測定した結果ではない）。"
    },
    {
      "id": "B4",
      "type": "own-work",
      "verified": true,
      "public": false,
      "label": "書籍『証拠なき非財務情報』第10章「実態を普通に伝えられる社会へ」（未公刊・収束済み）",
      "title": "GAP という一つの試み——解決策ではなく worked example（第5節）",
      "locator": "nonfin-evidence-book / manuscripts/ch10-toward-ordinary-truth/draft.md",
      "claim": "GAP は、隣接領域の部品を非財務情報の文脈で組み合わせたときに何が閉じ何が残るかを示す一つの worked example であって、解決策ではない。業界標準としての採用実績も外部からの検証もまだない。財務情報の領域には XBRL US による稼働中の公式 MCP サーバーという先例が既にあり、その差そのものが非財務情報の側で何が追いついていないかを示している。"
    },
    {
      "id": "S1",
      "type": "own-work",
      "verified": true,
      "public": false,
      "label": "著者らの JASAG v3.1 実験記録（未公刊）",
      "title": "pdf-inspector table-filter robustness test on a 462-page sustainability report",
      "locator": "非公開の内部記録（pdf_inspector_table_filter_robustness_20260802）",
      "claim": "生の解析結果は 462 頁中 460 頁を「テーブルを含む」と判定し、タスク固有の条件で機械的に絞り込むと 62 頁になった（86.5% の削減）。目視による全数検証は行っていない。"
    },
    {
      "id": "S4",
      "type": "official",
      "verified": true,
      "public": true,
      "label": "Library of Congress, Sustainability of Digital Formats: PDF 2.0",
      "title": "Format Description fdd000474 (ISO 32000-2:2020)",
      "locator": "https://www.loc.gov/preservation/digital/formats/fdd/fdd000474.shtml",
      "claim": "ISO 32000-2 の序文が掲げる PDF の目的は「デバイス・プラットフォーム・ソフトウェアに依存しない文書の忠実性の保存」であり、制作段階は「最終利用者への配布のための最終状態の形式」と位置づけられている。"
    },
    {
      "id": "S8",
      "type": "paper",
      "verified": true,
      "public": true,
      "label": "Deng et al. (2023), ESGReveal",
      "title": "ESGReveal: An LLM-based approach for extracting structured data from ESG reports",
      "locator": "https://arxiv.org/abs/2312.17264",
      "claim": "香港証券取引所上場 166 社の 2022 年版 ESG 報告書を対象に、GPT-4 に RAG を組み合わせた最良構成でもデータ抽出の正解率は 76.9% にとどまった。"
    },
    {
      "id": "S13",
      "type": "official",
      "verified": true,
      "public": true,
      "label": "XBRL US ESG Working Group, Supporting ESG Data with Standards",
      "title": "White paper (chaired by A. Kwok and D. Ritz, Workiva)",
      "locator": "https://xbrl.us/research/supporting-esg-with-standards/",
      "claim": "Morningstar のエクイティ・データ部門責任者の証言として、HTML から約20分・良質な PDF から約30分・画像から約50分かかる抽出が、XBRL からは1〜2秒で済むと引用されている。統制された測定ではなく実務者本人の証言。"
    },
    {
      "id": "S17",
      "type": "paper",
      "verified": true,
      "public": true,
      "label": "Adhikari & Agarwal (2024)",
      "title": "A Comparative Study of PDF Parsing Tools Across Diverse Document Categories",
      "locator": "https://arxiv.org/abs/2410.09871",
      "claim": "DocLayNet の財務文書カテゴリ（年次報告書・SEC 提出書類を含む 400 文書）での表検出 F1 は Camelot 0.10 / pdfplumber 0.06 / Tabula 0.24 で、トランスフォーマー系（TATR）は 0.79。同じ比較で本文抽出の F1 は 0.95〜0.99 に達する。"
    },
    {
      "id": "S22",
      "type": "paper",
      "verified": true,
      "public": true,
      "label": "Deußer et al. (ICMLA 2022), KPI-EDGAR",
      "title": "KPI-EDGAR: A Novel Dataset and Accompanying Metric for Relation Extraction from Financial Documents",
      "locator": "https://arxiv.org/abs/2210.09163",
      "claim": "SEC EDGAR から取得した実在の 10-K 81 件を人手注釈したデータセットで、経営指標とその数値を結びつける関係抽出は最良モデルでも Relation F1 22.68% にとどまった。"
    }
  ]
}
