All Products
Search
Document Center

Alibaba Cloud Model Studio:Integrasikan model generasi multimodal

Last Updated:Sep 02, 2026

Model generasi gambar, generasi video, dan sintesis suara dalam Token Plan harus diintegrasikan melalui mekanisme ekstensi masing-masing tool (Skill, Slash Command, atau Agent).

Contoh: Integrasikan model generasi gambar di Claude Code

Contoh ini menunjukkan cara mengintegrasikan model generasi gambar di Claude Code menggunakan Slash Command. Prosesnya serupa untuk tool lain, dengan perbedaan pada mekanisme ekstensi dan path file konfigurasi.

Langkah 1: Buat Slash Command

Tetapkan API Key khusus paket (dengan awalan sk-sp-) sebagai variabel lingkungan $ANTHROPIC_AUTH_TOKEN untuk otentikasi curl pada langkah-langkah berikutnya.

Buat file .claude/commands/text-to-image.md di direktori root proyek Anda dengan konten berikut:

Panggil API text-to-image Token Plan untuk menghasilkan gambar berdasarkan deskripsi.

Permintaan pengguna: $ARGUMENTS

## Langkah

1. Ekstrak prompt (deskripsi gambar), model, dan ukuran (default 1024*1024) dari permintaan pengguna. Jika pengguna secara eksplisit menentukan model (misalnya, "model=wan2.7-image" atau "gunakan wan2.7-image untuk menggambar"), Anda harus menggunakan nama model tersebut secara tepat dan tidak boleh kembali ke default; gunakan qwen-image-2.0 sebagai default hanya jika tidak ada model yang ditentukan. Model generasi gambar umum mencakup qwen-image-2.0, qwen-image-2.0-pro, wan2.7-image, dan wan2.7-image-pro; lihat daftar model Studio Model untuk daftar lengkapnya.

2. Panggil API untuk menghasilkan gambar (gunakan tool Bash untuk menjalankan curl):

```
curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {
      "messages": [{"role":"user","content":[{"text":"<prompt>"}]}]
    },
    "parameters": {"size":"<size>"}
  }'
```

3. Ekstrak URL gambar dari output.choices[*].message.content[*].image dalam respons JSON.

4. Unduh gambar ke direktori saat ini dengan curl -s -o "generated_$(date +%Y%m%d_%H%M%S).png" "<URL>".

5. Tampilkan path file gambar yang dihasilkan kepada pengguna.

Langkah 2: Hasilkan gambar

Di Claude Code, ketik /text-to-image draw a cat. Untuk menggunakan model generasi gambar selain default, sertakan nama model dalam perintah, misalnya /text-to-image draw a cat using wan2.7-image.

Contoh: Integrasikan model generasi video di Claude Code

Contoh ini menunjukkan cara mengintegrasikan model generasi video di Claude Code menggunakan Slash Command. Generasi video menggunakan API asinkron dengan alur kerja: kirim tugas, periksa status secara berkala, dan unduh video.

Langkah 1: Buat Slash Command

Tetapkan API Key khusus paket (dengan awalan sk-sp-) sebagai variabel lingkungan $ANTHROPIC_AUTH_TOKEN untuk otentikasi curl pada langkah-langkah berikutnya.

Buat file .claude/commands/text-to-video.md di direktori root proyek Anda dengan konten berikut:

Panggil API text-to-video Token Plan untuk menghasilkan video berdasarkan deskripsi dan unduh secara otomatis ke lokal.

Permintaan pengguna: $ARGUMENTS

## Langkah

1. Ekstrak prompt (deskripsi video), model (default happyhorse-1.1-t2v), resolusi (default 720P), rasio (default 16:9), dan durasi (default 5 detik) dari permintaan pengguna. Jika pengguna secara eksplisit menentukan model (misalnya, "model=happyhorse-1.1-r2v"), Anda harus menggunakan nama model tersebut secara tepat.

2. Gunakan tool Bash untuk menjalankan skrip berikut, yang mengirimkan tugas, menunggu hingga selesai, dan mengunduh video sekaligus:

```bash
#!/bin/bash
set -e

TASK_RESPONSE=$(curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis" \
  -H "X-DashScope-Async: enable" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": {"prompt": "<prompt>"},
    "parameters": {"resolution": "<resolution>", "ratio": "<ratio>", "duration": <duration>}
  }')

TASK_ID=$(echo "$TASK_RESPONSE" | grep -o '"task_id":"[^"]*"' | head -1 | cut -d'"' -f4)
if [ -z "$TASK_ID" ]; then echo "Submission failed: $TASK_RESPONSE"; exit 1; fi
echo "Task submitted, ID: $TASK_ID. Waiting for generation..."

while true; do
  sleep 15
  STATUS_RESPONSE=$(curl -s "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/tasks/$TASK_ID" \
    -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN")
  STATUS=$(echo "$STATUS_RESPONSE" | grep -o '"task_status":"[^"]*"' | cut -d'"' -f4)
  if [ "$STATUS" = "SUCCEEDED" ]; then
    VIDEO_URL=$(echo "$STATUS_RESPONSE" | grep -o '"video_url":"[^"]*"' | cut -d'"' -f4)
    OUTPUT="generated_$(date +%Y%m%d_%H%M%S).mp4"
    curl -s -o "$OUTPUT" "$VIDEO_URL"
    echo "Video downloaded: $(pwd)/$OUTPUT"
    exit 0
  elif [ "$STATUS" = "FAILED" ]; then
    echo "Generation failed: $STATUS_RESPONSE"; exit 1
  fi
  echo "Generating..."
done
```

3. Tampilkan path file video yang dihasilkan kepada pengguna.

Langkah 2: Hasilkan video

Di Claude Code, ketik /text-to-video a white cat sunbathing on a balcony. Untuk menggunakan model generasi video yang berbeda, sertakan nama model dalam perintah, misalnya /text-to-video generate a video of a cat jumping using happyhorse-1.1-r2v.

Contoh: Integrasikan model sintesis suara di Claude Code

Contoh ini menunjukkan cara mengintegrasikan model sintesis suara di Claude Code menggunakan Slash Command. Sintesis suara menggunakan API sinkron dan mendukung mode non-streaming maupun streaming.

Langkah 1: Buat Slash Command

Tetapkan API Key khusus paket (dengan awalan sk-sp-) sebagai variabel lingkungan $ANTHROPIC_AUTH_TOKEN untuk otentikasi curl pada langkah-langkah berikutnya.

Buat file .claude/commands/text-to-speech.md di direktori root proyek Anda dengan konten berikut:

Panggil API sintesis suara Token Plan untuk mengonversi teks menjadi file audio.

Permintaan pengguna: $ARGUMENTS

## Langkah

1. Ekstrak text (teks yang akan disintesis), voice (gaya suara, default longanhuan_v3.6), format (audio format, default mp3), dan sample_rate (laju sampel, default 24000) dari permintaan pengguna. Jika pengguna secara eksplisit menentukan model, gunakan nama model tersebut; jika tidak, gunakan default qwen-audio-3.0-tts-plus.

2. Panggil API untuk mensintesis suara (gunakan tool Bash untuk menjalankan curl):

```
curl -s -X POST "https://token-plan.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer" \
  -H "Authorization: Bearer $ANTHROPIC_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -o "speech_$(date +%Y%m%d_%H%M%S).<format>" \
  -d '{
    "model": "<model>",
    "input": {
      "text": "<text>",
      "voice": "<voice>",
      "format": "<format>",
      "sample_rate": <sample_rate>
    }
  }'
```

3. Tampilkan path file audio yang dihasilkan kepada pengguna.

Langkah 2: Sintesis suara

Di Claude Code, ketik /text-to-speech Hello, welcome to Model Studio.

Tool lainnya

Tabel berikut mencantumkan mekanisme ekstensi dan path file konfigurasi untuk tool coding AI utama yang mendukung ekstensi. Simpan konten yang sama dari contoh Claude Code di atas ke path yang sesuai.

Tool

Mekanisme ekstensi

Path file konfigurasi

Claude Code

Slash Command

.claude/commands/text-to-image.md

Codex

Skill

~/.codex/skills/token-plan-image/SKILL.md

Qwen Code

Skill

~/.qwen/skills/text-to-image/SKILL.md

OpenCode

Agent

.opencode/agents/text-to-image.md

OpenClaw

Skill

~/.openclaw/workspace/skills/token-plan-image/SKILL.md

Hermes Agent

Skill

~/.hermes/skills/media/text-to-image/SKILL.md

Qoder

Skill

~/.qoder/skills/text-to-image/SKILL.md

CatatanTool berbasis Skill (Codex, Qwen Code, OpenClaw, Hermes Agent, Qoder) memerlukan front matter YAML di awal file konfigurasi:

---
name: "token-plan-image"
description: "Panggil model text-to-image Token Plan untuk menghasilkan gambar dari deskripsi teks. Diaktifkan ketika pengguna meminta untuk menggambar atau menghasilkan gambar."
---

(... konten yang sama seperti contoh Claude Code di atas ...)

Agent OpenCode memerlukan format front matter yang berbeda:

---
description: "Panggil model text-to-image Token Plan untuk menghasilkan gambar dari deskripsi teks."
mode: subagent
tools:
  bash: true
  write: false
  edit: false
---

(... konten yang sama seperti contoh Claude Code di atas ...)