Komponen LLM-LaTeX Remove Bibliography melakukan pra-pemrosesan data teks dalam format TEX untuk Large Language Models (LLMs) dengan menghapus bagian bibliografi dari dokumen LaTeX.
Sumber daya komputasi yang didukung
Algoritma
Komponen ini mengidentifikasi bagian bibliografi dalam teks berformat LaTeX menggunakan ekspresi reguler r'(\\appendix|\\begin\{references\}|\\begin\{REFERENCES\}|\\begin\{thebibliography\}|\\bibliography\{.*\}).*$', di mana karakter pipa (|) memisahkan beberapa pola pencocokan.
Komponen ini menemukan semua string yang sesuai dengan ekspresi reguler tersebut dan menggantinya dengan string kosong. Contohnya:
|
Sebelum diproses
|
Setelah diproses Dalam kotak dialog Current field value, konten bidang ditampilkan dalam dua baris: |
Konfigurasi komponen
Di Machine Learning Designer, tambahkan komponen LLM-LaTeX Remove Bibliography ke pipeline Anda dan konfigurasikan parameternya di panel sebelah kanan.
|
Jenis parameter |
Parameter |
Deskripsi |
|
Pengaturan bidang |
Select target columns to process |
Pilih satu atau beberapa kolom untuk diproses. |
|
Set output table lifecycle |
Periode retensi dalam hari untuk tabel temporary yang dihasilkan oleh komponen ini. Nilainya harus berupa bilangan bulat positif. Setelah periode ini berakhir, tabel akan dihapus. Default: 28. |
|
|
Penyesuaian eksekusi |
Number of CPUs per instance |
Jumlah core CPU untuk setiap instans task map. Nilai yang valid berkisar antara 50 hingga 800. Default: 100. |
|
Memory size per instance (MB) |
Memori (dalam MB) yang dialokasikan untuk setiap instans task map. Nilai yang valid berkisar antara 256 hingga 12288. Default: 1024. |
|
|
Data size per instance (MB) |
Jumlah maksimum data (dalam MB) yang dapat diproses oleh setiap instans task map. Nilai yang valid berkisar antara 1 hingga Integer.MAX_VALUE. Default: 256. Anda dapat menyesuaikan parameter ini untuk mengontrol volume input pada tahap map. |
