All Products
Search
Document Center

DataWorks:Gunakan model bahasa besar

Last Updated:Jun 21, 2026

Jika konektivitas jaringan telah ditetapkan, Anda dapat menggunakan model yang telah diterapkan di ruang kerja DataWorks mana pun dalam wilayah yang sama. Bagian berikut menjelaskan cara memanggil dan menggunakan layanan model bahasa besar yang telah diterapkan di DataWorks.

Prasyarat

Persiapan

Sebelum memanggil model, pastikan aplikasi Anda dapat mengakses layanan model bahasa besar. Untuk memanggil model, peroleh titik akhir layanan model dan Kunci API untuk otentikasi identitas.

1. Konfigurasikan konektivitas jaringan

Pastikan VPC yang dilampirkan ke kelompok sumber daya DataWorks Anda untuk pemanggilan model termasuk dalam daftar VPC yang diizinkan terhubung ke model tersebut.

  1. Identifikasi VPC pertama yang dilampirkan ke kelompok sumber daya Anda.

    1. Buka halaman DataWorks Resource Groups. Di bilah navigasi atas, alihkan ke wilayah tempat kelompok sumber daya target berada. Lalu, temukan kelompok sumber daya tersebut dalam daftar.

    2. Klik Operation pada baris kelompok sumber daya target, lalu pilih Network Settings untuk membuka halaman VPC Binding.

    3. Di bawah Data Scheduling & Data Integration, lihat vSwitch CIDR Block yang sesuai.

      Penting

      Saat memanggil model bahasa besar, Anda harus menggunakan VPC pertama yang tercantum dalam konfigurasi jaringan kelompok sumber daya sebagai dasar komunikasi.

  2. Untuk melihat daftar VPC yang diizinkan terhubung ke model atau menambahkan pengikatan VPC baru, lihat Manage model network.

2. Peroleh informasi pemanggilan

Setelah penerapan, layanan model secara otomatis menghasilkan titik akhir internal dalam wilayah yang sama. Buka halaman detail layanan model untuk mengambil titik akhir ini. Format nama domain-nya adalah: http://<model-service-id>.<region>.dataworks-model.aliyuncs.com. Untuk petunjuknya, lihat View model service.

3. Peroleh Kunci API

Peroleh Kunci API Anda untuk autentikasi dari Manage API Key.

Panggil layanan model bahasa besar

Anda dapat memanggil model bahasa besar di Data Integration dan Data Development untuk mengaktifkan pemrosesan data cerdas.

Panggil di Data Integration

Pada tugas sinkronisasi offline untuk tabel tunggal, Anda dapat menerapkan AI-assisted processing pada data selama sinkronisasi menggunakan layanan model bahasa besar.

Pada tab Configuration node AI-assisted processing, pilih Model Provider (opsi termasuk Alibaba Cloud DataWorks Model Service, Alibaba Cloud Model Studio, dan Alibaba Cloud PAI Model Marketplace). Lalu konfigurasikan Model Name, Processing Task Description (misalnya, terjemahan teks, ringkasan konten, atau analisis sentimen), dan Target Field.

Pemanggilan dalam Pengembangan Data

1. Gunakan node model bahasa besar

DataWorks Data Development mendukung penggunaan large language model node untuk memproses data. Di node ini, Anda dapat mengonfigurasi dan memanggil layanan model bahasa besar.

2. Node Shell memanggil model bahasa besar

Contoh ini menunjukkan cara memanggil model bahasa besar dari node Shell untuk menjawab pertanyaan tertentu.

  1. Buat node Shell dan tambahkan perintah contoh berikut:

    Catatan

    Ganti titik akhir layanan model yang dimulai dengan http dan token yang dimulai dengan DW dengan nilai aktual yang Anda peroleh di bagian Persiapan.

    curl -X POST http://ms-xxx.cn-beijing.dataworks-model.aliyuncs.com/v1/completions -H "Authorization: DW-ms-xxx" -H "Content-Type: application/json" -d '{"prompt":"Differences and connections among AI, machine learning, and deep learning", "stream":"false", "max_tokens": 1024}' -v    
  2. Setelah mengedit node, pada panel Run Configuration di sisi kanan editor node, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan dengan layanan model.

  3. Klik Run untuk memanggil layanan model yang telah diterapkan.

    Catatan
    • Konfigurasi penjadwalan node: Jika node perlu dijalankan sesuai jadwal, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan di panel Scheduling Settings di sisi kanan. Lalu konfigurasikan properti penjadwalan di Scheduling Policy.

    • Penerbitan node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image di antarmuka untuk memulai alur kerja penerbitan. Node hanya akan dijalankan sesuai jadwal setelah diterbitkan ke lingkungan produksi.

3. Panggil model bahasa besar dengan node Python

Contoh ini menunjukkan cara memanggil model bahasa besar dari node Python untuk menghasilkan puisi.

  1. Contoh ini memerlukan library Python requests. Buat custom image berbasis Alibaba Cloud Image untuk menginstal dependensi ini. Gunakan parameter berikut:

    Parameter custom image

    Deskripsi

    Image name/ID

    Pilih image yang kompatibel dengan Python dari DataWorks image list.

    Supported task type

    Pilih Python.

    Installation packages

    • Python3: requests.

    • Script: /home/tops/bin/pip3 install 'urllib3<2.0'.

  2. Buat node Python dan tambahkan kode contoh berikut:

    Catatan

    Ganti titik akhir layanan model yang dimulai dengan http dan token yang dimulai dengan DW dengan nilai aktual yang Anda peroleh di bagian Persiapan.

    import requests
    import json
    import time
    import sys
    def stream_print_response():
        httpUrl = "http://ms-xxxx.cn-beijing.dataworks-model.aliyuncs.com"
        apikey = "DW-ms-xxxx"
        url = httpUrl + "/v1/completions"
        headers = {
            "Authorization": apikey,
            "Content-Type": "application/json"
        }
        data = {
            "prompt": "Write a poem about spring",
            "stream": True,
            "max_tokens": 512
        }
        try:
            response = requests.post(url, headers=headers, json=data, stream=True)
            response.raise_for_status()
            full_text = ""  # Accumulate full response to prevent loss
            buffer = ""     # Optional: handle incomplete JSON lines
            for line in response.iter_lines():
                if not line:
                    continue  # Skip empty lines
                line_str = line.decode('utf-8').strip()
                # print(f"[DEBUG] Received line: {line_str}")  # For debugging
                if line_str.startswith("data:"):
                    data_str = line_str[5:].strip()  # Remove "data: "
                    if data_str == "[DONE]":
                        print("\n[Streaming response ended]")
                        break
                    # Attempt to parse JSON
                    try:
                        parsed = json.loads(data_str)
                        choices = parsed.get("choices", [])
                        if choices:
                            delta_text = choices[0].get("text", "")
                            if delta_text:
                                # Accumulate into full text
                                full_text += delta_text
                                # Print characters one by one
                                for char in delta_text:
                                    print(char, end='', flush=True)
                                    sys.stdout.flush()
                                    time.sleep(0.03)  # Typewriter effect
                    except json.JSONDecodeError as e:
                        # print(f"[Warning] JSON parsing failed: {e}, raw: {data_str}")
                        continue
            print(f"\n\n[Full response length: {len(full_text)} characters]")
            print(f"[ Full content]:\n{full_text}")
        except requests.exceptions.RequestException as e:
            print(f" Request failed: {e}")
        except Exception as e:
            print(f" Other error: {e}")
    if __name__ == "__main__":
        stream_print_response()
    
  3. Setelah mengedit node, pada panel Run Configuration di sisi kanan, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan dan Image kustom dari langkah 1 yang mencakup library requests.

  4. Klik Run untuk memanggil layanan model yang telah diterapkan.

    Catatan
    • Konfigurasi penjadwalan node: Jika node perlu dijalankan sesuai jadwal, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan dan Image kustom dari langkah 1 yang mencakup library requests di panel Scheduling Settings. Lalu konfigurasikan properti penjadwalan di Scheduling Policy.

    • Penerbitan node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image di antarmuka untuk memulai alur kerja penerbitan. Node hanya akan dijalankan sesuai jadwal setelah diterbitkan ke lingkungan produksi.

Panggil layanan model vektor

Anda dapat memanggil model vektor di Data Integration dan Data Development untuk melakukan vektorisasi pada data. Contoh berikut menunjukkan cara memanggil layanan model vektor BGE-M3 yang diterapkan pada kelompok sumber daya DataWorks.

Panggil di Data Integration

Pada tugas sinkronisasi offline untuk tabel tunggal, Anda dapat menerapkan vektorisasi pada data selama sinkronisasi menggunakan layanan model besar.

Setelah mengaktifkan toggle Data Processing, tambahkan node Data Vectorization ke daftar pemrosesan. Di panel konfigurasi di sisi kanan, pilih Model Provider (seperti Alibaba Cloud DataWorks Model Service) dan Model Name. Atur Batch Size, pilih bidang sumber untuk divectorisasi (urutan kolom memengaruhi hasil akhir—seret untuk mengubah urutan), dan masukkan nama untuk Vectorized Result Field. Anda juga dapat memperluas Advanced Options untuk pengaturan tambahan.

Panggil dalam Pengembangan Data

1. Node LLM memanggil layanan model vektor

DataWorks Data Development mendukung penggunaan large model node untuk memproses data. Di node ini, Anda dapat mengonfigurasi dan memanggil layanan model vektor.

2. Node Shell memanggil model vektor

Contoh ini menunjukkan cara mengonversi teks menjadi vektor dengan memanggil model vektor dari node Shell.

  1. Buat node Shell dan tambahkan perintah contoh berikut:

    Catatan

    Ganti titik akhir layanan model yang dimulai dengan http dan token yang dimulai dengan DW dengan nilai aktual yang Anda peroleh di bagian Persiapan.

    curl -X POST "http://ms-xxx.cn-beijing.dataworks-model.aliyuncs.com/v1/embeddings" \
      -H "Authorization: DW-ms-xxx" \
      -H "Content-Type: application/json" \
      -d '{
        "input": "This is a piece of text that needs to be converted into a vector",
        "model": "bge-m3"
          }'
  2. Setelah mengedit node, pada panel Run Configuration di sisi kanan, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan dengan layanan model.

  3. Klik Run untuk memanggil layanan model yang telah diterapkan.

    Catatan
    • Konfigurasi penjadwalan node: Jika node perlu dijalankan sesuai jadwal, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan di panel Scheduling Settings. Lalu konfigurasikan properti penjadwalan di Scheduling Policy.

    • Penerbitan node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image di antarmuka untuk memulai alur kerja penerbitan. Node hanya akan dijalankan sesuai jadwal setelah diterbitkan ke lingkungan produksi.

3. Panggil model vektor dari node Python

Contoh ini menunjukkan cara mengonversi teks menjadi vektor dengan memanggil model vektor dari node Python.

  1. Contoh ini memerlukan library Python requests. Buat custom image berbasis Alibaba Cloud Image untuk menginstal dependensi ini. Gunakan parameter berikut:

    Parameter custom image

    Deskripsi

    Image name/ID

    Pilih image yang kompatibel dengan Python dari DataWorks image list.

    Supported task type

    Pilih Python.

    Installation packages

    • Python3: requests.

    • Script: /home/tops/bin/pip3 install 'urllib3<2.0'.

  2. Buat node Python dan tambahkan kode contoh berikut:

    Catatan

    Ganti titik akhir layanan model yang dimulai dengan http dan token yang dimulai dengan DW dengan nilai aktual yang Anda peroleh di bagian Persiapan.

    import requests
    import json
    import sys
    # Replace with your API endpoint and token
    api_url = "http://ms-xxx.cn-beijing.dataworks-model.aliyuncs.com" + "/v1/embeddings"
    token = "DW-ms-xxx"
    print("api_url:"+api_url)
    print("token:"+token)
    headers = {
        "Authorization": f"{token}",
        "Content-Type": "application/json"
    }
    payload = {
        "input": "Test text",
        "model": "bge-m3"
    }
    try:
        response = requests.post(api_url, headers=headers, data=json.dumps(payload))
        print("Response status code:", response.status_code)
        print("Response content:", response.text)  # View detailed error messages
    except Exception as e:
        print("Request error:", e)
  3. Setelah mengedit node, pada panel Run Configuration di sisi kanan, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan dan Image kustom dari langkah 1 yang mencakup library requests.

  4. Klik Run untuk memanggil layanan model yang telah diterapkan.

    Catatan
    • Konfigurasi penjadwalan node: Jika node perlu dijalankan sesuai jadwal, pilih kelompok sumber daya yang telah menyelesaikan konfigurasi konektivitas jaringan di panel Scheduling Settings. Lalu konfigurasikan properti penjadwalan di Scheduling Policy.

    • Penerbitan node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image di antarmuka untuk memulai alur kerja penerbitan. Node hanya akan dijalankan sesuai jadwal setelah diterbitkan ke lingkungan produksi.

Bacaan terkait

Untuk detail lebih lanjut tentang perintah untuk memanggil model bahasa besar, lihat OpenAI-Compatible Server.