> For the complete documentation index, see [llms.txt](https://docs.maiagent.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.maiagent.ai/maiagent-user-guide/ja/application/image-vision.md).

# 画像ビジョン

マルチモーダル AI を活用して請求書、公文書、名刺、証明書などの画像を認識し、業務システムと連携可能な構造化 JSON データを直接出力します

企業では請求書、伝票、公文書、名刺、証明書の処理にあたり、人手で一項目ずつシステムに入力するのが一般的ですが、時間がかかるだけでなく、疲労によるミスも発生しやすくなります。従来の OCR ツールは文字を読み取ることはできますが、業務上の文脈を理解できません。レイアウトごとにテンプレートを個別設計する必要があり、読み取った生のテキストもシステムに書き込むまでに大量の後処理が必要です。

MaiAgent の画像・ビジョン機能は、**マルチモーダル言語モデル**を使用してこの作業を処理します。ユーザーが対話画面で画像をアップロードするだけで、AI アシスタントがシステムプロンプトで定義されたフィールド仕様に従い、構造化された JSON データを直接出力します。結果は対話インターフェースにリアルタイムで表示したり、API を通じて ERP、CRM などの後続システムに連携したりできます。

## デモ動画 <a href="#demo-video" id="demo-video"></a>

{% embed url="<https://drive.google.com/file/d/1Xuso3cX8ZMChhWIa2rD7wafcDT2fUldr/view?usp=sharing>" %}

## 従来の OCR との違い <a href="#vs-traditional-ocr" id="vs-traditional-ocr"></a>

|          | 従来の OCR エンジン          | MaiAgent マルチモーダル AI          |
| -------- | --------------------- | ---------------------------- |
| レイアウト適応性 | レイアウトごとにテンプレートの設計が必要  | 異なるレイアウトを自動的に理解              |
| フィールド拡張  | コードの修正が必要             | システムプロンプトの JSON フィールドを変更するだけ |
| ビジネスルール  | テキストのみ出力し、ルールは別途実装が必要 | システムプロンプトに判断ロジックを直接記述可能      |
| 導入コスト    | 自社構築またはライセンス購入        | プラットフォーム設定のみ、コーディング不要        |

より詳細な比較（表裏面処理、エラーハンドリングなどを含む）は、[証明書認識](/maiagent-user-guide/ja/application/image-vision/id-card-recognition.md)をご覧ください。

## 適用シーン <a href="#use-cases" id="use-cases"></a>

* **経費精算・会計処理**：大量の光熱費、通信費、出張費の領収書から請求書番号、日付、金額を抽出し、ERP に書き込みます。
* **本人確認フロー**：銀行口座開設、入社手続き、医療受付などで証明書から基本情報を抽出し、フォームに自動入力します。
* **名刺のデータ化**：展示会や訪問で受け取った名刺を連絡先データに自動変換し、CRM にインポートします。
* **公文書・ファイルのアーカイブ**：スキャンした文書から文書番号、発行日、件名などのフィールドを抽出し、検索やアーカイブに活用します。

## 動作の仕組み <a href="#how-it-works" id="how-it-works"></a>

| ステップ                   | 内容                                                           |
| ---------------------- | ------------------------------------------------------------ |
| **① 画像アップロード**         | ユーザーが対話画面で請求書、名刺、証明書などの画像を添付ファイルとしてアップロードします                 |
| **② AI アシスタントによる認識**   | ビジョン機能を持つマルチモーダル言語モデルが画像の内容を読み取ります                           |
| **③ システムプロンプトによる形式決定** | システムプロンプトに定義されたフィールド定義、出力例、エラーフォーマットに従い、抽出するフィールドと回答形式を決定します |
| **④ 構造化出力**            | JSON 形式で結果を出力します                                             |
| **⑤ 後続活用**             | Web Chat でリアルタイム表示、または API を通じて ERP、CRM などの業務システムに連携します      |

ポイントは**システムプロンプト**です。システムプロンプトで AI アシスタントを「認識 API」として定義し、抽出するフィールドや成功・失敗時の JSON 出力例を明示することで、AI はそのフォーマットに従って安定的に回答します。フィールドの追加が必要な場合は、システムプロンプトを修正するだけで、コードを変更する必要はありません。

## 構築フロー <a href="#setup-workflow" id="setup-workflow"></a>

### 1. AI アシスタントを作成し、ビジョン対応モデルを選択する <a href="#step1-create-agent" id="step1-create-agent"></a>

<mark style="color:blue;">AI アシスタント</mark> ページで [AI アシスタントを作成](/maiagent-user-guide/ja/build/setup.md)します。この種のアプリケーションは画像認識と論理的な判断を伴うため、認識精度を確保するために Pro レベル以上のマルチモーダルモデルの使用を推奨します。

### 2. システムプロンプトで出力形式を定義する <a href="#step2-define-schema" id="step2-define-schema"></a>

[システムプロンプト](/maiagent-user-guide/ja/build/system-prompt.md)に認識タスクとフィールド仕様を記述し、成功時と失敗時の JSON 例を添付します。認識できないフィールドはフィールド名を残し、値を `null` に設定することで、後続システムの処理を容易にすることを推奨します。

### 3. 画像をアップロードしてテストする <a href="#step3-test" id="step3-test"></a>

対話画面で実際の伝票を添付ファイルとしてアップロードし、出力フィールドが揃っていること、フォーマットが正しいことを確認します。ぼやけた画像、傾いた画像、表裏面などのエッジケースもテストすることを推奨します。

### 4. 業務システムと連携する <a href="#step4-integrate" id="step4-integrate"></a>

出力が安定したら、API を通じて AI アシスタントを既存のフローに組み込み、JSON 結果を ERP、CRM、またはフォームシステムに直接書き込めます。連携状況は [API 呼び出しログ](/maiagent-user-guide/ja/developer/api-logs.md)で確認できます。

{% hint style="warning" %}
証明書、請求書などの画像には個人情報が多く含まれています。導入前に、組織の権限設定とデータ保存ポリシーが個人情報保護法の要件に準拠していることをご確認ください。
{% endhint %}

## 活用例 <a href="#examples" id="examples"></a>

* [請求書認識](/maiagent-user-guide/ja/application/image-vision/invoice-recognition.md)：請求書の種類、追跡番号、売り手・買い手の法人番号、品目明細を抽出し、JSON として出力します。
* [公文書スキャン](/maiagent-user-guide/ja/application/image-vision/document-scan.md)：公文書スキャン画像の主要フィールドを認識し、アーカイブと検索に活用します。
* [名刺スキャン](/maiagent-user-guide/ja/application/image-vision/business-card-scan.md)：名刺を氏名、役職、会社名、連絡先などの構造化フィールドに変換します。
* [証明書認識](/maiagent-user-guide/ja/application/image-vision/id-card-recognition.md)：1 枚の画像から証明書の表裏面を同時に認識し、口座開設や入社手続きなどで使用する標準フィールドを出力します。

以降の各セクションでは、実際のケースを通じて構築プロセスを示します。ご自身の業務シーンへ迅速に活用してください。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.maiagent.ai/maiagent-user-guide/ja/application/image-vision.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
