すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:LLM-LaTeX ヘッダー削除 (MaxCompute)

最終更新日:Aug 22, 2026

LLM-LaTeX ヘッダー削除 (MaxCompute) コンポーネントを使用して、大規模言語モデル (LLM) のトレーニングに使用される TeX テキストデータを前処理できます。このコンポーネントは、<section-type>[optional-args]{name} 形式に一致する最初のセクションより前のコンテンツを削除します。

サポート対象のコンピューティングリソース

MaxCompute

アルゴリズム

このコンポーネントは、LaTeX 形式のテキスト内のセクション見出しを識別するために正規表現を使用します。正規表現は r'^(.*?)(\\\bchapter\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bpart\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\})' です。パイプ文字 (|) は、複数のマッチパターンを区切ります。

このコンポーネントは、最初に見つかったセクションより前のすべてのコンテンツを削除します。セクションの行とそれに続くコンテンツは保持されます。例:

処理前

\begin{teaserfigure}
\end{teaserfigure}
%% このコマンドは、著者、所属、タイトルを処理します
\maketitle
\section{Introduction}
\begin{itemize}
\end{itemize}
\section{Related Work}
\label{gen_inst} Self-supervised

処理後

\section{Introduction}
\begin{itemize}
\end{itemize}
\section{Related Work}
\label{gen_inst} Self-supervised

コンポーネントの設定

Platform for AI (PAI) コンソールのビジュアルモデリングのパイプラインページで、 [LLM-LaTeX ヘッダー削除 (MaxCompute)] コンポーネントのパラメーターを設定します。次の表にパラメーターを示します。

タブ

パラメーター

説明

Fields Setting

Select Target Column

処理する列。複数の列を選択できます。

Whether Remove no Header Sample

セクションが見つからないテキストサンプルを削除するかどうかを指定します。

Output table lifecycle

値は正の整数です。単位:日。デフォルト値:28。テーブルのデフォルトのライフサイクルが経過すると、コンポーネントによって生成された一時テーブルは削除されます。

Tuning

Number of CPUs per instance of map task

マップタスクの各インスタンスの CPU 数。有効値:50~800。デフォルト値:100。

The memory size per instance of map task

マップタスクの各インスタンスのメモリ サイズ。有効値:256~12288。デフォルト値:1024。単位:MB。

The maximum size of input data for a map

マップタスクの各インスタンスが処理できるデータの最大量。有効値:1~Integer.MAX_VALUE。デフォルト値:256。単位:MB。

このパラメーターを使用して、入力データのサイズを制御できます。