All Products
Search
Document Center

AI Guardrails:Moderasi Teks dengan LLM

Last Updated:Jul 01, 2026

Text Moderation 2.0 menggunakan large language models (LLMs) untuk mendeteksi teks yang tidak pantas. Dibandingkan dengan pendekatan berbasis aturan, LLM mampu mengidentifikasi pelanggaran yang kompleks dan halus dengan akurasi lebih tinggi.

Penting

Untuk memberikan masukan atau permintaan fitur, hubungi account manager Anda.

Layanan

Layanan moderasi teks berbasis LLM berikut tersedia:

Layanan

Deskripsi

Kasus penggunaan

Nama layanan: UGC Text Moderation (LLM)

Layanan: ugc_moderation_byllm_global

Layanan moderasi teks UGC yang mendukung 119 bahasa, termasuk Tiongkok, Inggris, Spanyol, Prancis, Portugis, Italia, Arab, Jepang, Korea, Indonesia, Rusia, Vietnam, Jerman, dan Thailand. Untuk daftar lengkap item yang dapat dideteksi, lihat Konsol Content Moderation.

Moderasi teks UGC tujuan umum.

Nama layanan: UGC Scenario Text Moderation Large Model Service_China Version

Layanan: ugc_moderation_byllm_ec

Layanan moderasi teks berbasis LLM untuk skenario UGC. Untuk daftar lengkap item yang dapat dideteksi, lihat Konsol Content Moderation.

Gunakan untuk moderasi teks UGC yang menargetkan pasar Tiongkok daratan.

Penagihan

Layanan moderasi teks berbasis LLM mendukung dua metode penagihan: bayar sesuai pemakaian.

Bayar sesuai pemakaian

Saat Anda mengaktifkan layanan Content Moderation, metode penagihan bayar sesuai pemakaian menjadi metode default. Anda ditagih setiap hari berdasarkan penggunaan aktual dan tidak dikenai biaya jika tidak menggunakan layanan.

Jenis moderasi

Layanan

Harga satuan

LLM-based text moderation (Advanced) (text_advanced)

  • UGC Text Moderation (LLM): ugc_moderation_byllm_global

  • Fitur terjemahan teks

USD 0,60 per 1.000 panggilan

Catatan
  • Anda dikenai biaya untuk setiap panggilan ke layanan di sebelah kiri. Misalnya, jika Anda melakukan 100 panggilan ke UGC Text Moderation (LLM), Anda dikenai biaya USD 0,06.

  • Fitur terjemahan teks: Setelah fitur terjemahan teks diaktifkan, setiap permintaan ditagih sekali per 500 karakter.

LLM-based text moderation (China-entry) (text_llm_standard_cn)

  • UGC Scenario Text Moderation Large Model Service_China Version: ugc_moderation_byllm_ec

USD 0,31 per 1.000 panggilan

Catatan

Anda dikenai biaya untuk setiap panggilan ke layanan di sebelah kiri. Misalnya, jika Anda melakukan 100 panggilan ke UGC Scenario Text Moderation Large Model Service_China Version, Anda dikenai biaya USD 0,031.

Catatan

Untuk metode penagihan bayar sesuai pemakaian Content Moderation 2.0, sistem menghasilkan tagihan setiap 24 jam. Dalam rincian penagihan Anda, bidang moderationType sesuai dengan jenis moderasi. Anda dapat melihat rincian penagihan Anda.

Rencana sumber daya

Untuk volume moderasi yang tinggi atau konsisten, paket sumber daya menawarkan diskon signifikan. Anda dapat membeli dan menumpuk beberapa paket. Untuk informasi selengkapnya, lihat Beli paket sumber daya untuk Content Moderation 2.0.

Jenis moderasi

Faktor offset

LLM-based text moderation (Advanced) (text_advanced)

Setiap panggilan API yang berhasil mengonsumsi 2 panggilan dari paket sumber daya Anda.

Catatan

Misalnya, jika paket sumber daya Anda memiliki kuota 10 panggilan, satu panggilan API yang berhasil mengonsumsi 2 panggilan, menyisakan 8 panggilan dalam paket Anda.

LLM-based text moderation (China-entry) (text_llm_standard_cn)

Setiap panggilan API yang berhasil mengonsumsi 1,04 panggilan dari paket sumber daya Anda.

Catatan

Misalnya, jika paket sumber daya Anda memiliki kuota 10 panggilan, satu panggilan API yang berhasil mengonsumsi 1,04 panggilan, menyisakan 8,96 panggilan dalam paket Anda.

Setelah Anda membeli paket sumber daya, penggunaan API Anda untuk Content Moderation 2.0 pertama kali dipotong dari paket sumber daya Anda. Ketika paket sumber daya habis, penggunaan selanjutnya ditagih dengan metode bayar sesuai pemakaian. Pantau sisa saldo paket dan biaya bayar sesuai pemakaian Anda. Anda dapat mengatur peringatan saldo rendah di Sistem Paket Sumber Daya.

Label risiko

Definisi label

Text Moderation 2.0 mendukung lebih dari 30 label detail di 6 kategori risiko, dan mengembalikan skor kepercayaan (0–100; semakin tinggi skor, semakin besar kepercayaannya) untuk masing-masing. Jika konten mengandung beberapa jenis risiko, layanan mengembalikan beberapa label detail. Tabel berikut mencantumkan nilai label risiko, rentang skor kepercayaan yang sesuai, dan maknanya.

Label

Skor kepercayaan

Deskripsi

pornographic_adult

0–100

Dicurigai konten pornografi

sexual_terms

0–100

Dicurigai konten kesehatan seksual

sexual_suggestive

0–100

Dicurigai konten vulgar

sexual_orientation

0–100

Dicurigai konten terkait orientasi seksual

regional_cn

0–100

Dicurigai konten sensitif politik terkait Tiongkok daratan

regional_illegal

0–100

Dicurigai konten politik ilegal

regional_controversial

0–100

Dicurigai kontroversi politik

regional_racism

0–100

Dicurigai rasisme

violent_extremist

0–100

Dicurigai organisasi ekstremis

violent_incidents

0–100

Dicurigai konten ekstremis

violent_weapons

0–100

Senjata dan amunisi yang diduga

violence_unscList

0–100

Daftar sanksi Perserikatan Bangsa-Bangsa

contraband_drug

0–100

Dicurigai konten terkait narkoba

contraband_gambling

0–100

Dicurigai konten terkait perjudian

inappropriate_ethics

0–100

Dicurigai konten tidak etis

inappropriate_profanity

0–100

Dicurigai konten ofensif atau kasar

inappropriate_oral

0–100

Dicurigai bahasa vulgar

inappropriate_religion

0–100

Dicurigai penistaan agama

pt_to_contact

0–100

Dicurigai informasi kontak untuk iklan

pt_to_sites

0–100

Dicurigai pengalihan ke situs eksternal

customized

0–100

Cocok dengan daftar kata kunci kustom

Konfigurasikan label risiko

Aktifkan atau nonaktifkan label risiko di Konsol. Anda juga dapat menyesuaikan cakupan deteksi untuk label tertentu. Lihat Konsol Content Moderation untuk detailnya.

  1. Di panel navigasi kiri, pilih Machine Moderation V2.0>Text Moderation>Rules.

  2. Di tab Rules Management, temukan solusi moderasi model besar, misalnya, aigc_moderation_byllm_global, lalu klik Set Thesaurus di kolom Operation.

    1. Pilih jenis deteksi yang akan dikonfigurasi, seperti deteksi konten tidak pantas.

    2. Klik Edit dan ubah pengaturan deteksi.

    3. Klik Save. Konfigurasi baru berlaku di lingkungan produksi dalam 2 hingga 5 menit.

Integrasi

Langkah 1: Aktifkan layanan

Untuk mengaktifkan layanan Text Moderation 2.0, kunjungi aktifkan layanan.

Langkah 2: Berikan izin kepada Pengguna RAM

Sebelum menggunakan SDK atau memanggil API, berikan izin yang diperlukan kepada Pengguna RAM. Buat Pasangan Kunci Akses untuk Akun Alibaba Cloud atau Pengguna RAM Anda guna mengautentikasi panggilan API. Untuk petunjuknya, lihat Dapatkan kunci akses.

  1. Masuk ke Konsol RAM menggunakan Akun Alibaba Cloud Anda.

  2. Buat Pengguna RAM. Untuk detailnya, lihat Buat Pengguna RAM.

  3. Berikan kebijakan sistem AliyunYundunGreenWebFullAccess kepada Pengguna RAM. Kebijakan ini memberikan akses penuh ke Content Moderation. Untuk detailnya, lihat Kelola izin Pengguna RAM.

Pengguna RAM kini dapat memanggil API Content Moderation.

Langkah 3: Instal dan integrasikan SDK

Referensi API

Ikhtisar

Gunakan operasi TextModerationPlus untuk membuat tugas moderasi konten teks. Untuk konstruksi permintaan HTTP, lihat Struktur Permintaan. Anda juga dapat menggunakan permintaan yang telah dikonstruksi sebelumnya seperti yang dijelaskan dalam panduan Memulai.

Anda dapat menguji operasi ini di OpenAPI Explorer tanpa perhitungan tanda tangan manual. Setelah menguji panggilan, OpenAPI Explorer secara otomatis menghasilkan contoh kode SDK.

  • Antarmuka layanan: TextModerationPlus

  • Wilayah dan titik akhir yang didukung:

Wilayah

Titik akhir publik

Titik akhir VPC

Layanan yang didukung

Tiongkok (Shanghai)

green-cip.cn-shanghai.aliyuncs.com

green-cip-vpc.cn-shanghai.aliyuncs.com

ugc_moderation_byllm_ec

Tiongkok (Beijing)

green-cip.cn-beijing.aliyuncs.com

green-cip-vpc.cn-beijing.aliyuncs.com

Tiongkok (Hangzhou)

green-cip.cn-hangzhou.aliyuncs.com

green-cip-vpc.cn-hangzhou.aliyuncs.com

Tiongkok (Shenzhen)

green-cip.cn-shenzhen.aliyuncs.com

green-cip-vpc.cn-shenzhen.aliyuncs.com

Tiongkok (Chengdu)

green-cip.cn-chengdu.aliyuncs.com

Tidak tersedia

Tiongkok (Hong Kong)

green-cip.cn-hongkong.aliyuncs.com

green-cip-vpc.cn-hongkong.aliyuncs.com

ugc_moderation_byllm_global

Singapura

green-cip.ap-southeast-1.aliyuncs.com

green-cip-vpc.ap-southeast-1.aliyuncs.com

AS (Virginia)

green-cip.us-east-1.aliyuncs.com

green-cip-vpc.us-east-1.aliyuncs.com

Jerman (Frankfurt)

green-cip.eu-central-1.aliyuncs.com

green-cip-vpc.eu-central-1.aliyuncs.com

Penting

Untuk wilayah Jerman (Frankfurt) dan Tiongkok (Hong Kong), node di wilayah Singapura melakukan inferensi moderasi teks. Layanan memproses hasil inferensi, data, dan log secara lokal di wilayah Jerman (Frankfurt) dan Tiongkok (Hong Kong).

  • Penagihan: Operasi ini dikenai biaya. Anda hanya dikenai biaya untuk permintaan yang mengembalikan kode status HTTP 200. Tidak ada biaya untuk permintaan yang mengembalikan kode kesalahan lainnya. Untuk informasi lebih lanjut tentang penagihan, lihat Harga.

Batas QPS

Batas laju default adalah 50 permintaan per detik per akun. Melebihi batas ini memicu pembatasan kecepatan, yang dapat mengganggu aplikasi Anda. Untuk meminta batas laju yang lebih tinggi, hubungi account manager Anda.

Parameter permintaan

Parameter

Tipe

Wajib

Contoh

Deskripsi

Service

String

Ya

ugc_moderation_byllm_global

  • ugc_moderation_byllm_global: UGC Text Moderation (LLM)

  • ugc_moderation_byllm_ec: UGC Scenario Text Moderation Large Model Service_China Version

ServiceParameters

JSONString

Ya

Parameter layanan moderasi, ditentukan sebagai string JSON. Untuk detailnya, lihat ServiceParameters.

Tabel 1. ServiceParameters

Parameter

Tipe

Wajib

Contoh

Deskripsi

content

String

Ya

testing content

Konten teks yang akan dimoderasi. Konten dapat memiliki panjang hingga 2.000 karakter.

dataId

String

Tidak

text0424****

Identifikasi unik untuk data bisnis Anda.

Maksimum 64 karakter. Karakter yang diizinkan: huruf, angka, garis bawah (_), tanda hubung (-), dan titik (.).

accountId

String

Tidak

ID0728****

ID akun pengguna akhir di platform Anda. Gunakan parameter ini untuk menghubungkan hasil dengan pengguna tertentu. Misalnya, jika pengguna A mengobrol dengan pengguna B, kirimkan ID A untuk pesan A dan ID B untuk pesan B.

Catatan

Mengaktifkan moderasi sadar konteks. Untuk mengaktifkan fitur ini, hubungi account manager Anda atau buat tiket.

infoType

String

Tidak

llmContent

Jenis informasi tambahan yang akan diambil. Nilai yang valid:

  • llmContent: Mengembalikan hasil deteksi mentah dari LLM.

Parameter respons

Parameter

Type

Contoh

Deskripsi

Code

Integer

200

Kode status HTTP. Untuk informasi lebih lanjut, lihat Kode status.

Data

JSONObject

{"Result":[...]}

Data hasil moderasi. Untuk informasi lebih lanjut, lihat Data.

Message

String

OK

Pesan hasil untuk permintaan.

RequestId

String

AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****

ID permintaan.

Tabel 2. Data

Parameter

Tipe

Contoh

Deskripsi

Result

JSONArray

Hasil deteksi, termasuk label risiko dan skor kepercayaan. Untuk informasi lebih lanjut, lihat Result.

RiskLevel

String

high

Tingkat risiko, yang ditentukan berdasarkan ambang batas skor risiko tinggi dan rendah yang dikonfigurasi. Nilai yang valid:

  • high: Risiko tinggi (Jika konten cocok dengan pustaka kustom, tingkat risikonya adalah high.)

  • medium: Risiko sedang

  • low: Risiko rendah

  • none: Tidak ada risiko yang terdeteksi

Catatan

Ambil tindakan segera terhadap konten berisiko tinggi dan tinjau secara manual konten berisiko sedang. Tangani konten berisiko rendah hanya jika Anda memerlukan tingkat recall yang tinggi; jika tidak, perlakukan sama seperti konten dengan tingkat risiko none. Anda dapat mengonfigurasi ambang batas skor risiko di Konsol Content Moderation.

DataId

String

text0424****

ID data konten yang dimoderasi.

Catatan

Jika Anda menentukan parameter dataId dalam permintaan, nilai yang sama dikembalikan di bidang ini.

AccountId

String

10123****

ID akun.

Catatan

Jika Anda menentukan parameter accountId dalam permintaan, nilai yang sama dikembalikan di bidang ini.

Ext

Object

Informasi tambahan untuk teks. Untuk informasi lebih lanjut, lihat Ext.

TranslatedContent

String

Konten teks yang diterjemahkan. Dikembalikan hanya ketika fitur terjemahan teks diaktifkan.

Catatan

Fitur terjemahan teks saat ini hanya tersedia di wilayah Singapura (Singapura). Anda dapat mengonfigurasinya dengan mengelola aturan deteksi di Konsol. Biaya tambahan berlaku.

Tabel 3. Hasil

Parameter

Tipe

Contoh

Deskripsi

Label

String

political_xxx

Label risiko untuk konten yang dimoderasi. Beberapa label dan skor dapat dikembalikan. Untuk daftar label yang didukung, lihat Label risiko.

Description

String

Dicurigai konten pornografi

Deskripsi untuk bidang Label.

Penting

Bidang ini hanya untuk referensi dan dapat berubah. Untuk logika penanganan Anda, gunakan bidang Label daripada bidang ini.

Confidence

Float

81,22

Skor kepercayaan, berkisar antara 0 hingga 100. Nilainya akurat hingga dua tempat desimal. Beberapa label tidak mengembalikan skor kepercayaan.

Riskwords

String

AA,BB,CC

Kata risiko yang terdeteksi, dipisahkan koma. Bidang ini tidak dikembalikan untuk beberapa label.

CustomizedHit

JSONArray

[{"LibName":"...","Keywords":"..."}]

Jika konten cocok dengan entri dalam pustaka kustom, Label adalah customized, dan bidang ini mengembalikan nama pustaka dan kata kunci yang cocok. Untuk informasi lebih lanjut, lihat CustomizedHit.

RiskPositions

JSONArray

Informasi tentang posisi kata risiko yang terdeteksi. Untuk informasi lebih lanjut, lihat RiskPositions.

Tabel 4. CustomizedHit

Parameter

Tipe

Contoh

Deskripsi

LibName

String

Pustaka Kustom 1

Nama pustaka kustom.

Keywords

String

Kata Kunci Kustom 1,Kata Kunci Kustom 2

Kata kunci kustom yang cocok, dipisahkan koma.

Tabel 5. RiskPositions

Parameter

Tipe

Contoh

Deskripsi

RiskWord

String

AA

Kata risiko yang terdeteksi.

StartPos

Integer

10

Posisi awal kata risiko dalam teks.

EndPos

Integer

12

Posisi akhir kata risiko dalam teks.

Tabel 6. Ext

Parameter

Tipe

Contoh

Deskripsi

Tabel 7. LlmContent

Parameter

Tipe

Contoh

Deskripsi

OutputText

String

Dicurigai bahasa vulgar

Hasil deteksi mentah dari model moderasi teks berbasis LLM.

Contoh

Contoh permintaan:

{
    "Service": "ugc_moderation_byllm_global",
    "ServiceParameters": {
        "content": "testing content",
        "dataId": "text0424****"
    }
}

Contoh respons:

  • Cocok dengan kebijakan sistem:

{
    "Code": 200,
    "Data": {
        "Result": [
            {
                "Label": "political_entity",
                "Description": "Dicurigai entitas politik",
                "Confidence": 100.0,
                "RiskWords": "WordA,WordB",
                "RiskPositions": [
                    {
                        "EndPos": 14,
                        "RiskWord": "WordA",
                        "StartPos": 16
                    }
                ]
            },
            {
                "Label": "political_figure",
                "Description": "Dicurigai tokoh politik",
                "Confidence": 100.0,
                "RiskWords": "WordB,WordC",
                "RiskPositions": [
                    {
                        "EndPos": 24,
                        "RiskWord": "WordC",
                        "StartPos": 26
                    }
                ]
            }
        ],
        "RiskLevel": "high",
        "DataId": "text0424****"
    },
    "Message": "OK",
    "RequestId": "AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}
  • Cocok dengan pustaka kustom:

{
    "Code": 200,
    "Data": {
        "Result": [
            {
                "Description": "Cocok dengan pustaka kustom",
                "CustomizedHit": [
                     {
                        "LibName": "Nama Pustaka Kustom 1",
                        "Keywords": "kata kunci kustom"
                     }
                ],
                "Confidence": 100,
                "Label": "customized"
             }
        ],
        "RiskLevel": "high",
        "DataId": "text0424****"
    },
    "Message": "OK",
    "RequestId": "AAAAAA-BBBB-CCCCC-DDDD-EEEEEEEE****"
}
  • Hasil mentah LLM:

{
  "RequestId": "ZZZZZ-2024-0307-FORYOU-EVER",
  "Message": "OK",
  "Data": {
    "Ext": {
      "LlmContent": {
        "OutputText": "Dicurigai konten ofensif atau kasar"
      }
    },
    "Result": [
      {
        "RiskWords": "kata risiko",
        "Description": "Dicurigai konten ofensif atau kasar",
        "Confidence": 100.0,
        "Label": "inappropriate_profanity",
        "RiskPositions": [
          {
            "RiskWord": "kata risiko",
            "EndPos": 5,
            "StartPos": 2
          }
        ]
      }
    ],
    "RiskLevel": "high"
  },
  "Code": 200
}

Kode status

Kode

Teks status

Deskripsi

200

OK

Permintaan berhasil.

400

BAD_REQUEST

Permintaan tidak valid. Periksa parameter permintaan Anda.

408

PERMISSION_DENY

Akun Anda mungkin tidak sah, memiliki pembayaran tertunda, atau layanan belum diaktifkan.

500

GENERAL_ERROR

Kesalahan server internal. Coba ulang permintaan. Jika kesalahan berlanjut, hubungi Dukungan Online.

581

TIMEOUT

Permintaan melebihi waktu tunggu. Coba ulang permintaan. Jika kesalahan berlanjut, hubungi Dukungan Online.

588

EXCEED_QUOTA

Batas laju terlampaui. Kurangi frekuensi permintaan Anda.