すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:文の分割

最終更新日:Apr 01, 2026

文の分割 コンポーネントは、句読点を使用してドキュメントテキストを個々の文に分割します。これは、ビジュアルモデリング パイプラインでテキスト要約を実行する前に、テキストを前処理するために使用します。

コンポーネントの構成

ビジュアルモデリング (旧 Machine Learning Studio) は、2つの構成方法をサポートしています。

方法 1: パイプラインページでの構成

[フィールド設定] タブで、入力カラムとデリミタを設定します。[チューニング] タブで、必要に応じて計算リソースを調整します。

フィールド設定タブ

パラメーター説明
マークされたドキュメント ID の列入力テーブル内のドキュメント ID 列の名前。
マークされたドキュメントコンテンツ列入力テーブル内のドキュメントコンテンツ列の名前。
文デリミタセット文の境界をマークする句読点文字。デフォルトはピリオド (.)、感嘆符 (!)、および疑問符 (?) です。

[Tuning] タブ

パラメーター説明
コア処理に使用するコアの数。デフォルトはシステムによって決定されます。
コアあたりのメモリサイズ各コアに割り当てられるメモリ。デフォルトはシステムによって決定されます。

方法 2: PAI コマンドの実行

SQL Script コンポーネントを介して PAI コマンドを送信します。SQL Script コンポーネントの設定の詳細については、「SQL Script」をご参照ください。

PAI -name SplitSentences
    -project algo_public
    -DinputTableName="test_input"
    -DoutputTableName="test_output"
    -DdocIdCol="doc_id"
    -DdocContent="content"
    -Dlifecycle=30

パラメーター

パラメーター必須説明デフォルト
inputTableNameはい入力テーブルの名前。
inputTablePartitionsいいえ処理に使用する入力テーブルのパーティション。すべてのパーティション
outputTableNameはい出力テーブルの名前。
docIdColはいドキュメント ID 列の名前。
docContentはいドキュメントコンテンツ列の名前。単一の列のみを受け入れます。
delimiterいいえ文の境界をマークする句読点文字。ピリオド (.)、感嘆符 (!)、および疑問符 (?)
lifecycleいいえ入力テーブルと出力テーブルのライフサイクル。
coreNumいいえ処理に使用するコアの数。システムによって決定されます
memSizePerCoreいいえ各コアに割り当てられるメモリ。システムによって決定されます

次の例は、コンポーネントがドキュメントを個々の文に分割する方法を示しています。

入力ドキュメント (doc_id = 1000894) には、ピリオドで区切られた2つの文が含まれています。処理後、出力テーブルには文ごとに1つの行が含まれます。

doc_id
10008942008年、上海証券取引所は、上場企業の企業の社会的責任 (CSR) に関する開示ガイドラインを公開しました。3種類の企業が CSR レポートの開示を求められ、その他の適格な上場企業は自発的に CSR レポートを開示するよう奨励されました。
10008942012年には、合計379社の上場企業が CSR レポートを開示し、これは全上場企業の40%を占めました。これらの企業のうち、305社は CSR レポートの開示が義務付けられており、74社は自発的に CSR レポートを開示しました。

出力テーブルには、doc_idsentence の2つの列が含まれます。