複数の登記簿PDFを一括OCR処理する方法。まとめてデータ化して台帳作成を効率化
複数の登記簿謄本PDFをまとめて一括OCR処理してExcelにデータ化する方法を解説。閲覧専用PDFのテキスト化、項目別の構造化、1筆1行の一覧表作成まで、台帳作成を自動化する手順をまとめました。
用地取得・相続案件・不動産調査などで複数の登記簿謄本を処理する場合、1件ずつPDFを開いて手入力する方法では時間がかかりすぎます。複数のPDFをまとめてアップロードすることで、台帳作成作業を大幅に効率化できます。
一括OCR処理が役立つシーン
| シーン | 件数の目安 |
|---|---|
| 用地取得・土地仕入れ | 候補地の一括調査(数件〜100筆単位) |
| 相続案件 | 被相続人の全保有不動産(数筆〜10筆程度) |
| 競売調査 | 入札前の複数物件スクリーニング |
| 台帳整備 | 管理物件・自社保有物件の登記情報まとめ直し |
| 固定資産管理 | 固定資産台帳と登記情報の突合 |
| 過去案件のデータ化 | 紙保管の古い謄本のデジタル化 |
なぜ登記PDFはそのまま使えないのか
法務局から取得した登記簿謄本・地積測量図はPDF形式です。このPDFをそのまま業務に使うには、印刷して目視するか、情報を手動でコピーするしかありません。取得方法によってPDFの形式は異なります。
| 取得方法 | PDF形式 | テキスト選択 |
|---|---|---|
| 登記・供託オンライン申請システム | 閲覧専用PDF(Acrobat制限あり) | 不可 |
| 法務局窓口で取得した紙をスキャン | 画像PDF | 不可 |
| 一部の電子登記サービス | テキスト埋め込みPDF | 可 |
テキスト選択できないPDFは、OCRでテキスト化するか、手入力するしかありません。しかも仮にテキストがコピーできたとしても、それは人間が読むための書式で並んだ「非構造化データ」であり、台帳やデータベースにそのまま流し込める形ではありません。
| 形式 | 特徴 | 活用例 |
|---|---|---|
| 非構造化(PDF・画像) | 人が読む形式。検索・集計不可 | 書類の保管・閲覧 |
| 構造化(Excel・DB) | 列ごとに項目が整理されている | 検索・フィルタ・集計・API連携 |
一括OCR処理のゴールは、単に文字を読むことではなく、「所在」「地番」「地目」「地積」「所有者名」といった項目を個別の列に分けた構造化データに変換することです。
登記専用ツールが必要な理由
汎用のOCRソフト(スキャナ付属のものなど)でも文字を読み取ることはできますが、登記書類の一括処理には専用ツールが必要です。
- 登記簿の構造を理解していない:表題部・権利部(甲区・乙区)・共同担保目録の区別ができず、どの文字がどの項目かわからない
- 外字・旧字体に対応していない:「㊞」「髙」「﨑」「辻」など、一般的な文字コードにない文字が誤認識される
- 縦書き・横書き混在に弱い:欄外の注記が縦書きになっている場合がある
- SIMA形式に出力できない:地積測量図の座標を測量CADに使えるフォーマットに変換できない
- 検算機能がない:地積測量図の座標から辺長・面積を確認できない
登記情報の構造化には、書式の認識・項目の切り分け・旧字体や表記揺れのクレンジング・出力形式への整形という4段階の処理が必要で、これらは汎用OCRの守備範囲を超えています。
一括処理の手順
- 複数のPDFをまとめてアップロード(ドラッグ&ドロップ対応、最大10ファイル)
- AIが各PDFを解析(表題部・権利部の構造を認識して項目抽出)
- 全件を1ファイルのExcelに集約(1筆1行形式)
- 確認画面で抽出結果を目視チェック(元PDFと並べて確認)
- Excel・CSVをダウンロードして台帳・管理システムに活用
一括処理で生成されるExcelの構成
| 列 | 内容 |
|---|---|
| 所在 | 市区町村・丁目 |
| 地番 | 土地の番号 |
| 地目 | 田・畑・宅地・山林など |
| 地積(㎡) | 登記上の面積 |
| 所有者 | 登記名義人(持分も含む) |
| 所有者住所 | 登記上の住所 |
| 登記原因及び日付 | 取得原因・日付 |
| 抵当権 | 有 / 無 / 無(抹消済) |
全件が1シートに整列するため、フィルタリング・ソート・名寄せをそのまま行えます。地積測量図を含めて処理した場合は、座標値(X・Y)・辺長・面積が抽出され、SIMA形式(.sim)でも出力できます。
処理時間の目安
テキストPDF(法務局オンライン取得など)の場合、1ページあたり約20秒が目安です。
| 処理件数 | 手入力 | 一括OCR(テキストPDF) | 削減率 |
|---|---|---|---|
| 3件(約10ページ) | 約30〜45分 | 約3〜4分 | 約90% |
| 5件(約15ページ) | 約50〜75分 | 約5〜6分 | 約90% |
| 10件(約30ページ) | 約1.5〜2.5時間 | 約10〜15分 | 約85% |
| 30件 | 約7.5時間 | 約30〜40分 | 約90% |
| 100件 | 約25時間(3〜4日) | 約1〜2時間 | 約92% |
手作業との1件あたりの比較は次の通りです。
| 方法 | 1件あたりの時間 | 誤入力リスク |
|---|---|---|
| 手動でコピー・貼り付け | 5〜15分 | 中(コピー漏れ) |
| 手動でキーボード入力 | 10〜20分 | 高(数字・旧字体の誤入力) |
| AI OCRで自動抽出 | 約30秒 | 低(確認画面で補正) |
スキャンPDFはテキストPDFより処理に時間がかかります。解像度が低いスキャンや、かすれ・傾きがある書類は確認画面での目視チェックを省略しないでください。
スキャン品質による精度の違い
| スキャン品質 | 認識精度への影響 |
|---|---|
| 法務局オンライン取得PDF(テキスト層あり) | 高精度で処理可能 |
| 300dpi以上・カラースキャン | おおむね高精度 |
| 200〜300dpi・グレースケール | 旧字体や細い文字で精度が落ちる場合あり |
| 200dpi未満・白黒 | かすれた文字の誤読が増える |
一覧化・構造化した後の活用例
地目での絞り込み
農地(田・畑)と宅地・山林を地目列でフィルタリング。用地取得の際に農地転用が必要な物件を素早く特定できます。
所有者での名寄せ
VLOOKUP・UNIQUE関数などを使い、同じ所有者が複数筆を持つケースを名寄せ。アプローチ対象を効率的に絞れます。
抵当権ありのスクリーニング
抵当権列で「有」の物件を抽出し、決済前に抹消手続きが必要な物件を把握できます。
キーワード検索
Excel・CSVであれば、所有者名・地番・地目などでCtrl+Fで即座に検索できます。PDFでは困難だった地名・人名の検索が容易になります。
差分確認
前回取得したデータと今回のデータをExcelのVLOOKUP・比較関数で突合することで、所有者変更・地積変更・抵当権の追加などを素早く検出できます。定期的に登記簿を取り直して差分を見る運用にすると、権利変動の見落としを防げます。
外部システムへのインポート
CSV・Excel形式で出力された構造化データは、GISソフト(QGIS・ArcGISなど)・不動産管理システム・会計ソフト・Googleスプレッドシートへのインポートに直接使えます。PDFから手入力する中間工程がなくなります。
統計・分析
地目別・面積帯別・エリア別の集計が即座に行えます。不動産仕入れ分析や農地調査のサマリー作成に活用できます。
対応しているPDFの種類
- 法務局窓口・郵送で取得した登記事項証明書(スキャンPDF)
- 登記情報提供サービス(テキスト層あり)から取得したPDF
- 古い紙登記簿をスキャンしたPDF(300dpi以上推奨)
- 地積測量図のスキャンPDF
処理時の注意点
- 1回にアップロードできるのは最大10ファイルです。件数が多い場合は複数回に分けて処理してください
- 外字・旧字体を含む書類は確認画面での照合を省略しないでください
- 差押・仮差押・賃借権など乙区の詳細情報は抽出対象外です(抵当権の有無と「権利者その他の事項」の内容のみ)
- 登記情報はPDF取得日時点のものです。最新性の確認は別途行ってください
- 最終的な権利確認は必ず元の登記事項証明書で行ってください
よくある質問
Q: 1件のPDFが複数ページ(複数の登記簿が1ファイルにまとまっている)場合も処理できますか?
A: はい。複数の登記簿が1つのPDFにまとまっている場合も、各登記簿の境界を自動認識して処理します。結果は1筆1行形式でExcelに出力されます。
Q: 地積測量図と登記簿謄本が混在しているフォルダをそのまま一括アップロードできますか?
A: はい。書類の種類はAIが自動識別します。登記簿謄本と地積測量図が混在していても、それぞれの抽出処理が適用されます。
Q: 一括処理後に個別の確認ができますか?
A: はい。一括処理後も各件の元PDFと抽出結果を並べた確認画面でチェックできます。誤認識が疑われる箇所はその場で修正してExcelに反映できます。
Q: 「コピー禁止」の制限があるPDFでも使えますか?
A: AI OCRはPDFの画像を読み取るため、コピー制限があってもテキスト抽出できます。
Q: 共有名義の物件はどう出力されますか?
A: 共有の場合、所有者ごとに1行ずつ展開されます。例えば2名の共有なら2行になり、それぞれ持分も含めて「2分の1 山田太郎」のように出力されます。
Q: 外字・旧字体が含まれる所有者名を正確に抽出できますか?
A: 登記書類専用の外字辞書を搭載しており、髙(はしごたか)・﨑(異体字)・辻(二点しんにゅう)などの外字・旧字体に対応しています。認識に不安がある文字は確認画面でハイライト表示され、その場で修正できます。
Q: 縦書きの部分(欄外の注記など)は正しく読み取れますか?
A: 登記書類の横書き・縦書き混在のレイアウトに対応しています。縦書き部分も自動認識しますが、複雑なケースでは確認画面での修正が必要な場合があります。
Q: 建物の登記簿も一括処理できますか?
A: 土地および建物(一棟建物)の登記簿謄本に対応しています。区分所有建物(マンション等)は現在準備中です。
Q: 出力したExcelを物件管理システムに取り込めますか?
A: Excel(.xlsx)・CSV形式でダウンロードでき、多くの物件管理システムはCSVインポートに対応しています。列構成がシステムの形式と異なる場合は、Excelでの加工が必要です。
Q: 処理済みのデータはいつまで再ダウンロードできますか?
A: アカウントにログインした状態で、過去の処理結果を再ダウンロードできます。保存期間はプランの仕様に従います。
まとめ
- 登記PDFは閲覧専用・画像形式が多く、そのままでは検索も集計もできない
- 一括OCRのゴールは文字認識ではなく、項目別に列を分けた構造化データへの変換
- 表題部・権利部の構造理解と外字対応が必要なため、登記専用ツールが向いている
- 100件の台帳作成が約25時間から1〜2時間になる
- Excel化後は地目フィルタ・名寄せ・差分確認・システム連携に展開できる
複数の登記簿謄本を一括OCR処理したい場合は、tohonをお試しください。新規登録から累計30ページまで無料です。
関連記事: 不動産業務の登記確認を自動化する方法 / 登記簿をExcelにする方法3選 / 登記簿の抵当権を自動チェック / 外字・旧字体のOCR認識 / 登記簿謄本とは / 登記簿謄本のOCR精度の検証 / 物件資料PDFの一括管理とExcel台帳の作り方 / 用地取得の地権者台帳をAI OCRで作る方法 / 公図と登記簿から調査図を作成する方法
tohon — 無料トライアル
地積測量図の座標データを自動で取り出しませんか?
- ✓ 座標値・求積表を自動抽出
- ✓ SIMA形式・Excel形式でダウンロード
- ✓ 30ページ無料(カード不要)