All Products
Search
Document Center

Platform For AI:LLM-LaTeX Remove Header (MaxCompute)

Last Updated:Aug 22, 2026

Anda dapat menggunakan komponen LLM-LaTeX Remove Header (MaxCompute) untuk memproses data teks TeX yang digunakan dalam pelatihan model bahasa besar (large language models/LLMs). Komponen ini menghapus seluruh konten sebelum bagian pertama yang sesuai dengan format <section-type>[optional-args]{name}.

Sumber daya komputasi yang didukung

MaxCompute

Algoritma

Komponen ini menggunakan ekspresi reguler untuk mengidentifikasi judul bagian dalam teks berformat LaTeX. Ekspresi tersebut adalah: r'^(.*?)(\\\bchapter\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bpart\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubsubsection\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\}|\\\bsubparagraph\b\*?(?:\[(.*?)\])?\{(.*?)\})'. Karakter pipa (|) memisahkan beberapa pola pencocokan.

Komponen ini menghapus seluruh konten sebelum bagian pertama yang ditemukan. Baris bagian tersebut dan konten setelahnya tetap dipertahankan. Contoh:

Sebelum diproses

\begin{teaserfigure}
\end{teaserfigure}
%% Perintah ini memproses penulis, afiliasi, dan judul
\maketitle
\section{Introduction}
\begin{itemize}
\end{itemize}
\section{Related Work}
\label{gen_inst} Self-supervised

Setelah diproses

\section{Introduction}
\begin{itemize}
\end{itemize}
\section{Related Work}
\label{gen_inst} Self-supervised
\section{Method}
\label{method}In this section,
\subsection{Framework} kkk

Konfigurasikan komponen

Konfigurasikan parameter komponen LLM-LaTeX Remove Header (MaxCompute) pada halaman pipeline Machine Learning Designer di Konsol Platform for AI (PAI). Tabel berikut menjelaskan parameter-parameter tersebut.

Tab

Parameter

Deskripsi

Fields Setting

Select Target Column

Kolom yang ingin Anda proses. Anda dapat memilih beberapa kolom.

Whether Remove no Header Sample

Menentukan apakah sampel teks yang tidak memiliki bagian akan dihapus.

Output table lifecycle

Nilai berupa bilangan bulat positif. Satuan: hari. Nilai default: 28. Setelah siklus hidup tabel berakhir, tabel sementara yang dihasilkan oleh komponen akan didaur ulang.

Tuning

Number of CPUs per instance of map task

Jumlah CPU untuk setiap instans task map. Nilai valid: 50 hingga 800. Nilai default: 100.

The memory size per instance of map task

Ukuran memori untuk setiap instans task map. Nilai valid: 256 hingga 12.288. Nilai default: 1.024. Satuan: MB.

The maximum size of input data for a map

Jumlah maksimum data yang dapat diproses oleh setiap instans task map. Nilai valid: 1 hingga Integer.MAX_VALUE. Nilai default: 256. Satuan: MB.

Anda dapat menggunakan parameter ini untuk mengontrol ukuran data masukan.