Skip to main content

概要

文書処理ツールを使用すると、PDF、DOCX、Word文書を含むさまざまな文書形式からテキストコンテンツを抽出できます。これらのツールは、文書分析、コンテンツ抽出、テキスト処理ワークフローに不可欠です。

主な機能

  • PDF_EXTRACT_TEXT
    • PDFファイルからテキストコンテンツを抽出
  • DOCX_EXTRACT_TEXT
    • DOCXファイルからテキストコンテンツを抽出
  • JINBA_FLEX_PARSER
    • Jinba Flex Parser APIを使用してドキュメントをテキストに解析。PDF、DOCX、画像など、さまざまなファイル形式をサポート
  • WORD_TABLE_EXTRACT
    • Word文書からテーブルデータをJSONとして抽出
  • WORD_TABLE_UPDATE
    • Word文書のテーブルデータを更新
  • TRANSLATE_PPTX_FILE
    • PowerPoint(PPTX)ファイルのテキストコンテンツを異なる言語に翻訳
HTMLコンテンツをPDFやDOCXファイルに変換する場合は、データ変換ツールページの CONVERTER_HTML_TO_PDF および CONVERTER_HTML_TO_DOCX を参照してください。

認証

認証は不要です。文書処理ツールは、ファイルURLまたはbase64エンコードされたファイルで直接動作します。

例: 基本的なテキスト抽出

例: Jinba Flex Parserでドキュメントを解析

JINBA_FLEX_PARSER は、URL上のドキュメントを解析して抽出したテキストを返します。URLベースのファイルをそのまま処理でき(base64エンコード不要)、PDF、DOCX、画像などをサポートしています。 入力: 設定: 出力:
  • result: ドキュメントから解析されたテキストコンテンツ

例: Wordテーブル処理

例: 文書分析パイプライン

例: PowerPoint翻訳

サポートされる言語

TRANSLATE_PPTX_FILEツールは標準言語コードを使用してさまざまな言語への翻訳をサポートします:

主要言語コード:

  • en: 英語
  • es: スペイン語
  • fr: フランス語
  • de: ドイツ語
  • it: イタリア語
  • pt: ポルトガル語
  • ru: ロシア語
  • ja: 日本語
  • ko: 韓国語
  • zh: 中国語(簡体字)
  • ar: アラビア語
  • hi: ヒンディー語
  • nl: オランダ語
  • sv: スウェーデン語
  • da: デンマーク語
  • no: ノルウェー語
  • fi: フィンランド語

使用上の注意:

  • 翻訳は元の書式とスライド構造を保持します
  • 画像内のテキストは翻訳できません(テキストボックスと図形のみ)
  • 複雑なアニメーションと画面切り替え効果は保持されます
  • 翻訳後のファイルサイズは若干変動する場合があります
  • 処理時間はプレゼンテーションのサイズと複雑さに依存します

ヒントとベストプラクティス

  • base64エンコードファイルのサポートにより安全なファイル処理が可能
  • 処理前に常にファイルタイプを検証する
  • 大きな文書を処理する際は適切なタイムアウトを検討する
  • 破損したファイルやサポートされていないファイルのエラーハンドリングを実装する
  • 構造化データ分析のためにテキストとは別にテーブルを抽出する
  • より良い分析結果のためにテキストのクリーニングと前処理を検討する