Komponen LLM-Clean Copyright Information (MaxCompute) melakukan pra-pemrosesan data teks untuk model bahasa besar (large language models/LLMs), terutama dengan menghapus header komentar hak cipta dari kode.
Sumber daya komputasi yang didukung
Algorithm
Komponen ini menghapus informasi hak cipta atau komentar lain dari teks dalam dua langkah berikut:
-
Pertama, algoritma memeriksa apakah teks berisi string yang sesuai dengan ekspresi reguler
'/\\*[^*]*\\*+(?:[^/*][^*]*\\*+)*/'(karakter komentar).-
Jika ditemukan string yang sesuai, algoritma memeriksa apakah string tersebut berisi kata kunci
copyright. Jika ya, seluruh string tersebut dihapus dan hasilnya dikembalikan. Jika tidak, teks dikembalikan tanpa perubahan. -
Jika tidak ditemukan kecocokan dengan ekspresi reguler tersebut, algoritma melanjutkan ke Langkah 2.
-
-
Algoritma memisahkan teks berdasarkan jeda baris, lalu melakukan iterasi pada setiap baris untuk memeriksa apakah baris tersebut diawali dengan penanda komentar, seperti
//,#, atau--. Setelah menemukan baris yang sesuai, algoritma menghitung jumlah baris komentar berurutan hingga menemukan baris non-komentar, lalu menghapus blok komentar berurutan tersebut dari teks dan mengembalikan hasilnya.
Kedua langkah di atas hanya mendeteksi blok komentar pertama yang cocok, artinya komponen ini hanya memeriksa bagian header teks dan tidak memproses sisa konten. Contoh berikut menunjukkan kondisi sebelum dan sesudah.
|
Sebelum Jendela pop-up Current field value menampilkan kode sumber JavaScript untuk angular-spinner 0.3.1. Di bagian atas kode terdapat blok komentar lisensi MIT yang mencantumkan nomor versi, jenis lisensi (License: MIT), dan pemberitahuan |
Sesudah
|
Konfigurasikan komponen
Di Machine Learning Designer, tambahkan komponen LLM-Clean Copyright Information (MaxCompute) ke pipeline dan konfigurasikan parameternya di panel sebelah kanan.
|
Type |
Parameter |
Default |
Description |
|
Field settings |
Select target column |
None |
Pilih kolom atau beberapa kolom yang akan diproses. |
|
Output table lifecycle |
28 |
Siklus hidup tabel temporary output, dalam satuan hari. Tabel akan didaur ulang setelah periode ini. Default: 28. |
|
|
Tuning |
Number of CPUs per instance |
100 |
Jumlah CPU untuk setiap instans task map. Nilai harus berada dalam rentang [50, 800]. |
|
Memory size per instance (MB) |
1024 |
Ukuran memori untuk setiap instans task map, dalam satuan MB. Nilai harus berada dalam rentang [256, 12288]. |
|
|
Data size per instance (MB) |
256 |
Jumlah maksimum data yang dapat diproses oleh setiap instans task map. Anda dapat mengontrol input sisi map dengan mengatur parameter ini. Nilai, dalam satuan MB, harus berada dalam rentang [1, Integer.MAX_VALUE]. |