画像ビジョン
マルチモーダル AI を活用して請求書、公文書、名刺、証明書などの画像を認識し、業務システムと連携可能な構造化 JSON データを直接出力します
企業では請求書、伝票、公文書、名刺、証明書の処理にあたり、人手で一項目ずつシステムに入力するのが一般的ですが、時間がかかるだけでなく、疲労によるミスも発生しやすくなります。従来の OCR ツールは文字を読み取ることはできますが、業務上の文脈を理解できません。レイアウトごとにテンプレートを個別設計する必要があり、読み取った生のテキストもシステムに書き込むまでに大量の後処理が必要です。
MaiAgent の画像・ビジョン機能は、マルチモーダル言語モデルを使用してこの作業を処理します。ユーザーが対話画面で画像をアップロードするだけで、AI アシスタントがシステムプロンプトで定義されたフィールド仕様に従い、構造化された JSON データを直接出力します。結果は対話インターフェースにリアルタイムで表示したり、API を通じて ERP、CRM などの後続システムに連携したりできます。
デモ動画
従来の OCR との違い
レイアウト適応性
レイアウトごとにテンプレートの設計が必要
異なるレイアウトを自動的に理解
フィールド拡張
コードの修正が必要
システムプロンプトの JSON フィールドを変更するだけ
ビジネスルール
テキストのみ出力し、ルールは別途実装が必要
システムプロンプトに判断ロジックを直接記述可能
導入コスト
自社構築またはライセンス購入
プラットフォーム設定のみ、コーディング不要
より詳細な比較(表裏面処理、エラーハンドリングなどを含む)は、証明書認識をご覧ください。
適用シーン
経費精算・会計処理:大量の光熱費、通信費、出張費の領収書から請求書番号、日付、金額を抽出し、ERP に書き込みます。
本人確認フロー:銀行口座開設、入社手続き、医療受付などで証明書から基本情報を抽出し、フォームに自動入力します。
名刺のデータ化:展示会や訪問で受け取った名刺を連絡先データに自動変換し、CRM にインポートします。
公文書・ファイルのアーカイブ:スキャンした文書から文書番号、発行日、件名などのフィールドを抽出し、検索やアーカイブに活用します。
動作の仕組み
① 画像アップロード
ユーザーが対話画面で請求書、名刺、証明書などの画像を添付ファイルとしてアップロードします
② AI アシスタントによる認識
ビジョン機能を持つマルチモーダル言語モデルが画像の内容を読み取ります
③ システムプロンプトによる形式決定
システムプロンプトに定義されたフィールド定義、出力例、エラーフォーマットに従い、抽出するフィールドと回答形式を決定します
④ 構造化出力
JSON 形式で結果を出力します
⑤ 後続活用
Web Chat でリアルタイム表示、または API を通じて ERP、CRM などの業務システムに連携します
ポイントはシステムプロンプトです。システムプロンプトで AI アシスタントを「認識 API」として定義し、抽出するフィールドや成功・失敗時の JSON 出力例を明示することで、AI はそのフォーマットに従って安定的に回答します。フィールドの追加が必要な場合は、システムプロンプトを修正するだけで、コードを変更する必要はありません。
構築フロー
1. AI アシスタントを作成し、ビジョン対応モデルを選択する
AI アシスタント ページで AI アシスタントを作成します。この種のアプリケーションは画像認識と論理的な判断を伴うため、認識精度を確保するために Pro レベル以上のマルチモーダルモデルの使用を推奨します。
2. システムプロンプトで出力形式を定義する
システムプロンプトに認識タスクとフィールド仕様を記述し、成功時と失敗時の JSON 例を添付します。認識できないフィールドはフィールド名を残し、値を null に設定することで、後続システムの処理を容易にすることを推奨します。
3. 画像をアップロードしてテストする
対話画面で実際の伝票を添付ファイルとしてアップロードし、出力フィールドが揃っていること、フォーマットが正しいことを確認します。ぼやけた画像、傾いた画像、表裏面などのエッジケースもテストすることを推奨します。
4. 業務システムと連携する
出力が安定したら、API を通じて AI アシスタントを既存のフローに組み込み、JSON 結果を ERP、CRM、またはフォームシステムに直接書き込めます。連携状況は API 呼び出しログで確認できます。
証明書、請求書などの画像には個人情報が多く含まれています。導入前に、組織の権限設定とデータ保存ポリシーが個人情報保護法の要件に準拠していることをご確認ください。
活用例
請求書認識:請求書の種類、追跡番号、売り手・買い手の法人番号、品目明細を抽出し、JSON として出力します。
公文書スキャン:公文書スキャン画像の主要フィールドを認識し、アーカイブと検索に活用します。
名刺スキャン:名刺を氏名、役職、会社名、連絡先などの構造化フィールドに変換します。
証明書認識:1 枚の画像から証明書の表裏面を同時に認識し、口座開設や入社手続きなどで使用する標準フィールドを出力します。
以降の各セクションでは、実際のケースを通じて構築プロセスを示します。ご自身の業務シーンへ迅速に活用してください。
最終更新
役に立ちましたか?
