For the complete documentation index, see llms.txt. This page is also available as Markdown.

PDFファイル登録の仕組み

文書DB画面で、画面にファイルをドラッグアンドドロップすると、文書登録ができます。 弁護革命にはどんなファイルでも登録できますが、特にPDFファイルを効果的に処理できる機能を備えています。 PDF化された文書の、タイトル・日付・証拠番号などの書誌情報を、画像解析により自動認識することができます。

解析機能は弁護革命サーバーと通信をおこなって実施します。

この記事ではPDFファイルのみについて説明します。

解析機能で何ができるか

PDFファイルのタイトル・日付・証拠番号などの書誌情報を自動認識します。 また、全文テキストを認識できます。 PDFファイルにあらかじめOCRをかけることは必要ありません。

書誌情報の認識

以下の情報を認識できます。

  • タイトル

  • 作成日

  • 証拠番号

  • 供述者(一部の書類に限る)

裁判所に提出されるような定型の書類では高い認識精度を発揮します。 全部事項証明書なども判別できます。 非定型な書類の認識率は落ちます。

全文テキストの認識

画像状態のPDFファイルを解析して、全文テキストを認識します。 この全文テキストは、「テキスト検索」機能などで、串刺し検索できるようになります。 PDFファイルにも全文テキストは埋め込まれます。

高精度かつ高速である点も特長です。 通信環境などによりますが、トップスピードで毎秒10ページ程度処理できます。

あらかじめOCRがかかっている(=テキスト認識済みの)PDFファイルの場合には、そのテキストデータをそのまま抽出します。この場合、弁護革命サーバーでの全文テキスト解析はおこないません。

解析できるファイル

画像解析の対象はPDFファイルです。 PNG, JPEG, TIFFなどの画像ファイルは対象外です。

ワード、エクセル、パワーポイント、テキストファイルに対しては、全文テキストをファイルからそのまま抽出して認識します。 もちろんテキスト検索機能で検索できます。

保護されたPDFは解析できないことがある

PDFファイルに編集不可のロックがかかっている場合などには、解析がおこなえない場合があります。 この場合は、次のように処理されます。

  • PDFのファイル名を解釈して、ファイル登録が実施される

  • 登録されたPDFは正常に閲覧できる

  • 解析機能は発動しない

  • 全文テキストデータは抽出できない

  • PDFファイルのページ数表示が0となる

オプション

登録確認画面には、「タイトル・日付等をAIで認識」というオプションがあります。

☑️ タイトル・日付等をAIで認識

ONの場合 タイトル、作成日、証拠番号、供述者(刑事事件の供述調書に限る)を、AIによる解析で自動認識します。

OFFの場合 ファイル名を解釈して、タイトル、作成日、証拠番号、供述者の情報を取り出します。

既にファイル名に正確に情報が書き込まれている場合には、このオプションをオフにすることを推奨します。

全文テキストの認識(OCR)は、このオプションのオン・オフにかかわらず、自動でおこなわれます。 既にテキスト認識済みのPDFの場合は、そのテキストをそのまま抽出します。

ルール「証拠番号だけは常にファイル名優先」

ファイル名に証拠番号だけ書き込むというケースは多いのではないでしょうか。

甲1.pdf 甲2.pdf 甲3の1.pdf 甲3の2.pdf 甲4.pdf 甲5.pdf

このようなイメージです。せっかく記入した証拠番号を無視してしまうのはもったいないです。

弁護革命は、解析機能をオンにした場合でも、ファイル名に書かれた証拠番号は温存します。 上記の例だと以下のように処理されます。

  • タイトル、作成日は、解析機能で自動認識

  • 証拠番号は、ファイル名をそのまま採用

セキュリティ

登録した文書は、安全なクラウドに暗号化して保管されます。通信もTLSで暗号化されます。 詳しくはセキュリティをご確認ください。

最終更新

役に立ちましたか?