単純なOCR以上の処理が必要な場合はParseエンドポイントを使います。ページ順を保持し、Markdownまたはテキスト・画像・表の構造化ブロックを返せます。
Cohereの公開Parse APIが現在受け付けるのは、画像URLとbase64画像データURIのみです。PDFページは送信前に画像へ変換してください。各画像は20 MB以下、5,000万ピクセル以下、デコード後200 MB以下である必要があります。
Markdownとして解析する
Markdownでは読み取り順が保たれ、表はHTMLとして埋め込まれ、検出された画像はページ上のメタデータにリンクされます。
構造化ブロックを返す
output_formatをblocksに設定すると、順序付きのテキスト・画像・表領域が返されます。画像ブロックと表ブロックには、利用可能な場合、ピクセル単位と正規化された境界ボックスが含まれます。
Parseの使用量はページ単位で計測されます。レスポンスにはCohereのメタデータと、プロバイダーが課金対象ページを報告する場合は正規化されたusage.input_pages値が含まれます。Cohereは現在、レート制限付きの評価用APIを無料で提供しており、Parseの本番料金はまだ公開していません。