All Products
Search
Document Center

Platform For AI:LLM-Clean Copyright Information (MaxCompute)

Last Updated:Jun 21, 2026

Komponen LLM-Clean Copyright Information (MaxCompute) melakukan pra-pemrosesan data teks untuk model bahasa besar (large language models/LLMs), terutama dengan menghapus header komentar hak cipta dari kode.

Sumber daya komputasi yang didukung

MaxCompute

Algorithm

Komponen ini menghapus informasi hak cipta atau komentar lain dari teks dalam dua langkah berikut:

  1. Pertama, algoritma memeriksa apakah teks berisi string yang sesuai dengan ekspresi reguler '/\\*[^*]*\\*+(?:[^/*][^*]*\\*+)*/' (karakter komentar).

    • Jika ditemukan string yang sesuai, algoritma memeriksa apakah string tersebut berisi kata kunci copyright. Jika ya, seluruh string tersebut dihapus dan hasilnya dikembalikan. Jika tidak, teks dikembalikan tanpa perubahan.

    • Jika tidak ditemukan kecocokan dengan ekspresi reguler tersebut, algoritma melanjutkan ke Langkah 2.

  2. Algoritma memisahkan teks berdasarkan jeda baris, lalu melakukan iterasi pada setiap baris untuk memeriksa apakah baris tersebut diawali dengan penanda komentar, seperti //, #, atau --. Setelah menemukan baris yang sesuai, algoritma menghitung jumlah baris komentar berurutan hingga menemukan baris non-komentar, lalu menghapus blok komentar berurutan tersebut dari teks dan mengembalikan hasilnya.

Kedua langkah di atas hanya mendeteksi blok komentar pertama yang cocok, artinya komponen ini hanya memeriksa bagian header teks dan tidak memproses sisa konten. Contoh berikut menunjukkan kondisi sebelum dan sesudah.

Sebelum

Jendela pop-up Current field value menampilkan kode sumber JavaScript untuk angular-spinner 0.3.1. Di bagian atas kode terdapat blok komentar lisensi MIT yang mencantumkan nomor versi, jenis lisensi (License: MIT), dan pemberitahuan Copyright (C) 2013, 2014, Uri Shaked and contributors. Ini diikuti oleh IIFE dan baris kode seperti angular.module('angularSpinner', []).

Sesudah

(function(window, angular, undefined) {
'use strict';
angular.module('angularSpinner', [])
.factory('usSpinnerService', ['$rootScope', function ($rootScope) {
    var config = {};
    config.spin = function (key) {
        $rootScope.$broadcast('us-spinner:spin', key);
    };
}]);
})(window, window.angular);

Konfigurasikan komponen

Di Machine Learning Designer, tambahkan komponen LLM-Clean Copyright Information (MaxCompute) ke pipeline dan konfigurasikan parameternya di panel sebelah kanan.

Type

Parameter

Default

Description

Field settings

Select target column

None

Pilih kolom atau beberapa kolom yang akan diproses.

Output table lifecycle

28

Siklus hidup tabel temporary output, dalam satuan hari. Tabel akan didaur ulang setelah periode ini. Default: 28.

Tuning

Number of CPUs per instance

100

Jumlah CPU untuk setiap instans task map. Nilai harus berada dalam rentang [50, 800].

Memory size per instance (MB)

1024

Ukuran memori untuk setiap instans task map, dalam satuan MB. Nilai harus berada dalam rentang [256, 12288].

Data size per instance (MB)

256

Jumlah maksimum data yang dapat diproses oleh setiap instans task map. Anda dapat mengontrol input sisi map dengan mengatur parameter ini. Nilai, dalam satuan MB, harus berada dalam rentang [1, Integer.MAX_VALUE].