LLM-LaTeX ヘッダー削除 (MaxCompute) コンポーネントを使用して、大規模言語モデル (LLM) のトレーニングに使用される TeX テキストデータを前処理できます。このコンポーネントは、<section-type>[optional-args]{name} 形式に一致する最初のセクションより前のコンテンツを削除します。
サポート対象のコンピューティングリソース
アルゴリズム
このコンポーネントは、LaTeX 形式のテキスト内のセクション見出しを識別するために正規表現を使用します。正規表現は r'^(.*?)(\\\bchapter\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bpart\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\})' です。パイプ文字 (|) は、複数のマッチパターンを区切ります。
このコンポーネントは、最初に見つかったセクションより前のすべてのコンテンツを削除します。セクションの行とそれに続くコンテンツは保持されます。例:
処理前 | 処理後 |
コンポーネントの設定
Platform for AI (PAI) コンソールのビジュアルモデリングのパイプラインページで、 [LLM-LaTeX ヘッダー削除 (MaxCompute)] コンポーネントのパラメーターを設定します。次の表にパラメーターを示します。
タブ | パラメーター | 説明 |
Fields Setting | Select Target Column | 処理する列。複数の列を選択できます。 |
Whether Remove no Header Sample | セクションが見つからないテキストサンプルを削除するかどうかを指定します。 | |
Output table lifecycle | 値は正の整数です。単位:日。デフォルト値:28。テーブルのデフォルトのライフサイクルが経過すると、コンポーネントによって生成された一時テーブルは削除されます。 | |
Tuning | Number of CPUs per instance of map task | マップタスクの各インスタンスの CPU 数。有効値:50~800。デフォルト値:100。 |
The memory size per instance of map task | マップタスクの各インスタンスのメモリ サイズ。有効値:256~12288。デフォルト値:1024。単位:MB。 | |
The maximum size of input data for a map | マップタスクの各インスタンスが処理できるデータの最大量。有効値:1~Integer.MAX_VALUE。デフォルト値:256。単位:MB。 このパラメーターを使用して、入力データのサイズを制御できます。 |