All Products
Search
Document Center

Alibaba Cloud Model Studio:Siklus hidup dan pembaruan model

Last Updated:Sep 09, 2026

Tabel berikut mencantumkan rilis model . Untuk aturan dan daftar depresiasi model , lihat Kebijakan depresiasi .

Global

Saat cakupan penerapan layanan adalah Global, penyimpanan data berada di wilayah akses Amerika Serikat (Virginia)atau Jerman (Frankfurt). Sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia.

Type

Waktu

Model

Deskripsi

Reasoning model

2026-04-02

qwen3.6-plus, qwen3.6-plus-2026-04-02

Qwen3.6-Plus menampilkan peningkatan signifikan pada kemampuan pengembangan kode, seperti Agentic Coding dan pemrograman frontend, serta menyediakan pengalaman Vibe Coding yang jauh lebih baik. Kemampuan inferensinya dalam skenario generalisasi semakin ditingkatkan. Untuk kemampuan multimodal, kinerjanya dalam pengenalan objek universal, OCR, dan lokalisasi objek ditingkatkan secara signifikan. Versi ini juga memperbaiki masalah yang diketahui setelah rilis Qwen3.5-Plus. Metode penggunaannya sama dengan qwen3.5-plus. Ikhtisar generasi teks

Reasoning model

2026-03-04

qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b

Model-model terbaru dari Alibaba, Qwen3.5-Flash dan model open-source lainnya, mendukung input teks, gambar, dan video. Model-model ini memberikan respons cepat, kinerja keseluruhan yang mendekati Qwen3.5-plus, dan mendukung tool calling bawaan. Ikhtisar generasi teks

Reasoning model

2026-03-04

qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b

Model terbaru Alibaba, Qwen3.5-Plus, dan model open-source lainnya mendukung input teks, gambar, dan video. Model-model ini unggul dalam berbagai tugas, seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan tugas antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks

Image generation and editing

2026-01-04

wan2.6-image

Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - image generation and editing 2.6

Image-to-video - first frame

2026-01-04

wan2.6-i2v

Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - image-to-video - first frame-based

Reference video

2026-01-04

wan2.6-r2v

Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Fitur ini juga mendukung dubbing otomatis. Wan - reference-to-video

Text-to-video

2026-01-04

wan2.6-t2v

Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - text-to-video

Visual understanding

2026-01-04

qwen3-vl-flash, qwen3-vl-flash-2025-10-15

Model pemahaman visual berukuran kecil dari seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Dibandingkan Qwen3-VL-30B-A3B open-source, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video

Visual understanding

2026-01-04

qwen3-vl-8b-thinking, qwen3-vl-8b-instruct

Model dense open-source 8B dari seri Qwen3-VL, tersedia dalam versi berpikir dan non-berpikir. Model ini menggunakan lebih sedikit memori GPU dan melakukan pemahaman dan inferensi multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, posisi visual 2D/3D, serta kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video

Visual understanding

2026-01-04

qwen3-vl-32b-thinking, qwen3-vl-32b-instruct

Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial, pengenalan objek, deteksi visual 2D, dan penalaran spasial. Hal ini membuatnya cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video

Visual understanding

2026-01-04

qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct

Model pemahaman visual dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir, serta kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini juga secara signifikan meningkatkan kemampuan persepsi dan pengenalan visual. Pemahaman gambar dan video

Reasoning model

2026-01-04

qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct

Generasi baru model open-source berbasis Qwen3. Model `thinking` memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan respons ringkasan yang lebih ringkas dibandingkan `qwen3-235b-a22b-thinking-2507`. Lihat Pemikiran mendalam. Model `instruct` memiliki peningkatan kemampuan pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks dibandingkan `qwen3-235b-a22b-instruct-2507`. Lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen3-max, qwen3-max-2025-09-23

Dibandingkan versi qwen3-max-preview, model ini telah secara khusus ditingkatkan untuk pemrograman agen dan tool calling. Rilis resmi ini mencapai kinerja mutakhir (SOTA) di bidangnya dan mendukung persyaratan agen yang lebih kompleks.

Reasoning model

2026-01-04

qwen3-max-preview

Model Qwen-Max adalah versi pratinjau berbasis Qwen3. Dibandingkan seri Qwen 2.5, kemampuan tujuan umumnya sangat meningkat, memberikan peningkatan signifikan dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, tugas subjektif terbuka, pemrosesan multibahasa, dan tool calling. Model ini juga menghasilkan halusinasi pengetahuan yang lebih sedikit. Qwen-Max

Code model

2026-01-04

qwen3-coder-flash, qwen3-coder-flash-2025-07-28

Model tercepat dan paling hemat biaya dalam seri Qwen-Coder. Kemampuan kode (Qwen-Coder).

Code model

2026-01-04

qwen3-coder-plus, qwen3-coder-plus-2025-07-22, qwen3-coder-30b-a3b-instruct, qwen3-coder-480b-a35b-instruct

Model generasi kode berbasis Qwen3. Model ini memiliki kemampuan Coding Agent yang kuat dan unggul dalam tool calling dan interaksi lingkungan. Model ini menggabungkan keterampilan kode yang luar biasa dengan kemampuan tujuan umum. Kemampuan kode (Qwen-Coder)

Reasoning model

2026-01-04

qwen3-30b-a3b-thinking-2507, qwen3-30b-a3b-instruct-2507

Versi peningkatan dari qwen3-30b-a3b. Model berpikir memiliki peningkatan dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen3-235b-a22b-thinking-2507, qwen3-235b-a22b-instruct-2507

Versi peningkatan dari qwen3-235b-a22b. Model berpikir memiliki peningkatan besar dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas, sehingga cocok untuk skenario inferensi intensif tingkat tinggi. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen3-30b-a3b, qwen3-32b, qwen3-14b, qwen3-8b

Model Qwen3 mendukung mode berpikir dan non-berpikir. Anda dapat beralih antara dua mode tersebut menggunakan parameter enable_thinking. Selain itu, kemampuan model Qwen3 telah sangat ditingkatkan:

  1. Kemampuan penalaran: Dalam evaluasi matematika, kode, dan penalaran logis, model ini secara signifikan mengungguli QwQ dan model non-penalaran dengan ukuran serupa, serta mencapai kinerja tingkat atas di industri untuk skalanya.

  2. Penyelarasan preferensi manusia: Kemampuan penulisan kreatif, bermain peran, percakapan multi-turn, dan mengikuti instruksi sangat ditingkatkan. Kemampuan umumnya secara signifikan melebihi model dengan ukuran serupa.

  3. Kemampuan agen: Agen mencapai kinerja terdepan di industri dalam mode inferensi dan non-inferensi. Agen dapat memanggil alat eksternal secara akurat.

  4. Kemampuan multibahasa: Model mendukung lebih dari 100 bahasa dan dialek serta memiliki peningkatan signifikan dalam terjemahan multibahasa, pemahaman instruksi, dan penalaran akal sehat.

  5. Perbaikan format respons: Versi ini memperbaiki masalah format respons dari versi sebelumnya, seperti Markdown abnormal, pemotongan tengah kalimat, dan output boxed yang salah.

Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks.

Text extraction

2026-01-04

qwen-vl-ocr-2025-11-20

Versi snapshot model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks (Qwen-OCR)

Text extraction

2026-01-04

qwen-vl-ocr

qwen-vl-ocr adalah model yang dioptimalkan untuk OCR dan secara signifikan meningkatkan ekstraksi teks dari gambar, seperti tabel dan lembar ujian. Lihat Ekstraksi teks.

Reasoning model

2026-01-04

qwen-plus-2025-12-01, qwen-plus-2025-09-11

Model dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan ringkasan yang lebih ringkas dalam mode berpikir. Lihat Pemikiran mendalam. Dalam mode non-berpikir, model ini memiliki peningkatan kemampuan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen-plus-2025-07-28

Model dari seri Qwen3. Dibandingkan versi sebelumnya, model ini meningkatkan panjang konteks menjadi 1.000.000. Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen-plus

Menawarkan keseimbangan kemampuan. Kinerja inferensinya, biaya, dan kecepatannya berada di antara Qwen-Max dan Qwen-Flash, sehingga cocok untuk tugas dengan tingkat kompleksitas sedang.

Multilingual translation

2026-01-04

qwen-mt-lite

Model terjemahan teks dasar dari Qwen. Model ini mendukung terjemahan antara 31 bahasa. Model ini menawarkan respons lebih cepat dan biaya lebih rendah dibandingkan qwen-mt-flash, sehingga cocok untuk skenario yang sensitif terhadap latensi. Kemampuan terjemahan (Qwen-MT)

Multilingual translation

2026-01-04

qwen-mt-plus, qwen-mt-flash

Model Qwen-MT adalah model bahasa besar untuk terjemahan mesin yang dioptimalkan dari model Qwen. Model ini unggul dalam terjemahan antara Tiongkok dan Inggris, antara Tiongkok dan bahasa minoritas, serta antara Inggris dan bahasa minoritas. Model ini mendukung 26 bahasa minoritas, seperti Jepang, Korea, Prancis, Spanyol, Jerman, Portugis (Brasil), Thailand, Indonesia, Vietnam, dan Arab. Selain terjemahan multibahasa, model ini menyediakan fitur seperti intervensi terminologi, prompting domain, dan memori terjemahan untuk meningkatkan kualitas terjemahan dalam skenario kompleks. Lihat Kemampuan terjemahan (Qwen-MT).

Text-to-text

2026-01-04

qwen-flash, qwen-flash-2025-07-28

Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana.

Internasional

Saat cakupan penerapan layanan adalah Internasional, penyimpanan data berada di wilayah akses Singapura. Sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan.

Type

Waktu

Model

Deskripsi

Video editing

2026-04-03

wan2.7-videoedit

Model Wan 2.7-Video Editing mendukung tugas editing berbasis instruksi dan migrasi video. Model ini memodifikasi bagian video atau seluruh video, mendukung penggantian konten menggunakan beberapa gambar referensi, dan mereplikasi gerakan, efek, serta pergerakan kamera. Lihat Wan-Video Editing 2.7.

Image to video

2026-04-03

wan2.7-i2v

Model image-to-video Wan 2.7 mendukung input multimodal (teks, gambar, audio, dan video) untuk tiga tugas utama: pembuatan video frame pertama, pembuatan video frame awal-dan-akhir, dan kelanjutan video. Wan-Image-to-Video 2.7

Text-to-Video

2026-04-03

wan2.7-t2v

Model text-to-video Wan 2.7 menambahkan opsi resolusi baru dan pengaturan rasio aspek kustom agar dapat beradaptasi fleksibel terhadap berbagai skenario kreasi dan kebutuhan penerbitan platform. Wan text-to-video

reference-to-video

2026-04-03

wan2.7-r2v

Model reference-to-video Wan 2.7 mendukung referensi entitas dan kustomisasi suara. Model ini juga menghasilkan video berbasis naskah langsung dari storyboard multi-panel tunggal. Wan - Reference-to-video

Reasoning model

2026-04-02

qwen3.6-plus, qwen3.6-plus-2026-04-02

Qwen-3.6-Plus menawarkan peningkatan signifikan pada kemampuan pengembangan kode, seperti Agentic Coding dan pemrograman frontend, serta meningkatkan pengalaman Vibe Coding. Kemampuan inferensi model dalam skenario umum semakin ditingkatkan. Kemampuan multimodal juga ditingkatkan secara signifikan, termasuk pengenalan objek universal, Optical Character Recognition (OCR), dan lokalisasi objek. Versi ini juga memperbaiki masalah yang diketahui dari rilis Qwen-3.5-Plus. Penggunaannya sama dengan Qwen-3.5-Plus. Lihat Ikhtisar generasi teks.

Image generation and editing

2026-04-01

wan2.7-image-pro, wan2.7-image

Model generasi dan pengeditan gambar Wan 2.7 mendukung teks-ke-gambar, generasi grup teks-ke-gambar, generasi grup gambar-ke-gambar, pengeditan gambar, generasi referensi multi-gambar, dan pengeditan interaktif. Model ini unggul dalam rendering teks, konsistensi entitas, dan mengikuti instruksi kompleks. Seri Pro mendukung output 4K. Versi akselerasi menyeimbangkan kualitas dan kecepatan respons. Wan - image generation and editing 2.7

Omni-modal

2026-03-30

qwen3.5-omni-plus, qwen3.5-omni-plus-2026-03-15, qwen3.5-omni-flash, qwen3.5-omni-flash-2026-03-15

Model omni-modal terbaru mendukung analisis video panjang, notulen rapat, output takarir, moderasi konten, dan interaksi audio-video. Model ini mendukung pemahaman mendalam dan pembuatan deskripsi untuk konten audio dan video, mendeteksi 113 bahasa, dan menghasilkan audio dalam 36 bahasa. Model ini dapat memproses input audio hingga 3 jam dan video hingga 1 jam. Model ini juga mendukung pencarian web dan instruksi untuk mengontrol volume, kecepatan, dan emosi output audio. Non-real-time (Qwen-Omni)

Omni-modal

2026-03-30

qwen3.5-omni-plus-realtime, qwen3.5-omni-plus-realtime-2026-03-15, qwen3.5-omni-flash-realtime, qwen3.5-omni-flash-realtime-2026-03-15

Model multimodal real-time terbaru dari Qwen. Dibandingkan generasi sebelumnya Qwen3-Omni-Flash-Realtime, model ini menampilkan peningkatan kecerdasan yang signifikan dan setara dengan Qwen3.5-Plus. Model ini secara native mendukung pencarian web (WebSearch), interupsi suara, dan kontrol suara. Model ini mengenali 113 bahasa dan dialek, serta menghasilkan ucapan dalam 36 bahasa dan dialek. Real-time (Qwen-Omni-Realtime)

Reasoning model

2026-03-20

deepseek-v3.2

DeepSeek-V3.2 adalah model resmi yang memperkenalkan DeepSeek Sparse Attention, yaitu mekanisme perhatian jarang. Ini adalah model DeepSeek pertama yang mengintegrasikan berpikir dengan tool calling. Model ini mendukung tool calling dalam mode berpikir maupun non-berpikir.

DeepSeek di Alibaba Cloud

Image generation and editing

2026-03-03

qwen-image-2.0, qwen-image-2.0-2026-03-03, qwen-image-2.0-pro, qwen-image-2.0-pro-2026-03-03

Seri Qwen-Image2.0 mendukung generasi dan pengeditan gambar. Seri Pro menawarkan kemampuan yang lebih kuat dalam rendering teks, tekstur realistis, dan pemahaman semantik. Versi akselerasi menyeimbangkan kinerja dengan kecepatan respons. Qwen-text-to-image, Qwen-Image Edit

Speech recognition

2026-03-03

qwen3-asr-flash-2026-02-10

Model snapshot baru untuk pengenalan file audio Qwen memberikan kinerja yang lebih baik dibandingkanqwen3-asr-flash-2025-09-08.Pengenalan file audio - Qwen

Reasoning model

2026-02-24

qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b

Model-model terbaru dari Alibaba, Qwen-3.5-Flash dan model open source lainnya, mendukung input teks, gambar, dan video. Model-model ini memberikan respons cepat dan kinerja yang setara dengan Qwen-3.5-plus. Model-model ini juga mendukung tool calling bawaan. Lihat Ikhtisar model generasi teks.

Code model

2026-02-20

qwen3-coder-next

Model generasi kode open-source baru dalam seri Qwen3. Model ini mendukung interaksi alat multi-turn untuk meningkatkan pemahaman kode tingkat repositori dan meningkatkan kompatibilitasnya dengan alat pemrograman AI. Kemampuan kode (Qwen-Coder)

Reasoning model

2026-02-16

qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b

Model Qwen3.5-Plus dan model open-source terbaru dari Alibaba. Model-model ini menerima input teks, gambar, dan video serta memberikan kinerja luar biasa dalam berbagai tugas, seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks

Speech recognition

2026-02-13

qwen3-asr-flash-realtime-2026-02-10

Model snapshot baru untuk speech recognition real-time Qwen menunjukkan kinerja yang lebih baik dibandingkanqwen3-asr-flash-realtime-2025-10-27.Speech recognition real-time (Qwen)

Speech synthesis

2026-02-10

cosyvoice-v3-plus, cosyvoice-v3-flash

Sintesis ucapan CosyVoice menambahkan model v3 yang mendukung sintesis ucapan dengan suara sistem dan suara hasil kloning. Sintesis ucapan real-time - CosyVoice/Sambert

Speech synthesis

2026-02-10

qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26

Sintesis ucapan Qwen memperkenalkan model kendali instruksi yang mendukung pengendalian presisi output sintesis melalui instruksi bahasa alami.Sintesis ucapan - Qwen

Speech synthesis

2026-02-10

qwen3-tts-vd-2026-01-26

Sintesis ucapan Qwen memperkenalkan model desain suara yang mendukung pembuatan suara kustom melalui deskripsi teks.Sintesis ucapan - Qwen

Speech synthesis

2026-02-10

qwen3-tts-vc-2026-01-22

Sintesis ucapan Qwen memperkenalkan model kloning suara yang dengan cepat mengkloning suara dari sampel audio asli.Sintesis ucapan - Qwen

Speech synthesis

2026-02-04

qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22

Sintesis ucapan real-time Qwen menambahkan model Instruct, yang mendukung pengendalian presisi atas hasil sintesis menggunakan instruksi bahasa alami. Sintesis ucapan real-time Qwen

Reference-to-video

2026-02-02

wan2.6-r2v-flash

Hasilkan video multi-shot dengan dubbing otomatis, menggunakan penampilan karakter dari video referensi atau gambar. Wan - reference-to-video

Visual understanding

2026-01-28

qwen3-vl-flash-2026-01-22

Ini adalah snapshot baru dari model Qwen-VL. Model ini menggabungkan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan dibandingkan snapshot 15 Oktober 2025. Model ini mencapai akurasi inferensi yang lebih tinggi dalam skenario seperti pengenalan visual umum, keamanan, patroli toko, inspeksi, dan pemecahan masalah dari foto. Pemahaman gambar dan video

Speech recognition

2026-01-28

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17

Qwen3-ASR-Flash-Filetrans kini mendukung timestamp tingkat kata. Gunakan parameter baru enable_words untuk mendapatkan informasi alignment kata dan karakter tingkat milidetik serta mencapai segmentasi kalimat yang lebih akurat secara semantik dan detail halus. Pengenalan file audio - Qwen

Reasoning model

2026-01-27

qwen3-max-2026-01-23

Dibandingkan snapshot 23 September 2025, model ini menggabungkan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan secara signifikan. Dalam mode berpikir, model mengintegrasikan tiga alat: pencarian web, ekstraktor web, dan interpreter kode. Dengan menggunakan alat eksternal selama proses berpikirnya, model ini mencapai akurasi yang lebih tinggi pada masalah kompleks. OpenAI-compatible - Respons

Image-to-video

2026-01-18

wan2.6-i2v-flash

Menghasilkan video dengan atau tanpa audio. Kedua jenis video tersebut ditagih secara independen berdasarkan aturan penagihan masing-masing. Model ini juga memiliki kemampuan narasi multi-shot dan pemrosesan audio. Wan - Image-to-video - Berdasarkan frame pertama

Image editing

2026-01-18

qwen-image-edit-max, qwen-image-edit-max-2026-01-16

Seri Max Pengeditan Gambar Qwen menyediakan kemampuan pengeditan yang lebih stabil dan serbaguna, meningkatkan desain industri dan inferensi geometris, serta meningkatkan konsistensi karakter dan presisi pengeditan. Pengeditan gambar - Qwen

Speech synthesis

2026-01-16

qwen3-tts-vc-realtime-2026-01-15

Sintesis ucapan real-time Qwen telah merilis model snapshot baru yang lebih mengoptimalkan efek kloning suara Qwen. Suara yang disintesis lebih alami dan lebih dekat dengan suara asli dibandingkan qwen3-tts-vc-realtime-2025-11-27. Sintesis ucapan real-time - Qwen

Text-to-image

2026-01-12

qwen-image-plus-2026-01-09

Model snapshot baru untuk generasi teks-ke-gambar Qwen, yaitu versi distilasi dan akselerasi dari qwen-image-max yang menghasilkan gambar berkualitas tinggi secara cepat. Qwen-text-to-image

Image-to-video

2026-01-08

wan2.2-kf2v-flash

Model ini menghasilkan video dinamis yang mulus dan lancar dari gambar frame pertama dan terakhir berdasarkan prompt. Image-to-video: First and last frames

Speech recognition

2026-01-06

qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Qwen3-ASR-Flash mendukung mode kompatibel OpenAI. Mengenali file audio menggunakan Qwen

Text-to-image

2025-12-31

qwen-image-max, qwen-image-max-2025-12-30

Seri Max model teks-ke-gambar Qwen menawarkan realisme dan kealamian yang lebih tinggi dibandingkan seri Plus. Model ini secara efektif mengurangi artefak hasil generasi AI dan unggul dalam aspek seperti tekstur tokoh manusia, detail tekstur, dan rendering teks. Qwen - text-to-image

Image editing

2025-12-23

qwen-image-edit-plus-2025-12-15

Model snapshot terbaru untuk Pengeditan Gambar Qwen meningkatkan konsistensi karakter, kemampuan desain industri, dan inferensi geometris dibandingkan versi sebelumnya. Model ini juga mengoptimalkan kecocokan dalam tata letak spasial, tekstur, dan gaya antara gambar yang diedit dan gambar asli, menghasilkan pengeditan yang lebih presisi. Pengeditan gambar - Qwen

Text-to-image

2025-12-22

z-image-turbo

Model text-to-image ringan yang dengan cepat menghasilkan gambar berkualitas tinggi. Model ini mendukung rendering bilingual dalam bahasa Tiongkok dan Inggris, pemahaman semantik kompleks, berbagai gaya dan tema, serta beradaptasi fleksibel terhadap berbagai resolusi dan rasio aspek. Z-Image

Visual understanding

2025-12-19

qwen3-vl-plus-2025-12-19

Model snapshot baru Qwen-VL ini menampilkan peningkatan kemampuan mengikuti instruksi dan latensi lebih rendah. Pemahaman gambar dan video

Speech recognition

2025-12-19

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17, qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Menambahkan dukungan untuk pengenalan ucapan dalam 9 bahasa lagi, termasuk Ceko dan Denmark. Pengenalan file audio - Qwen

Speech recognition

2025-12-17

qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27

Pengenalan ucapan kini mendukung sembilan bahasa tambahan, termasuk Ceko dan Denmark. Speech recognition real-time (Qwen)

Speech recognition

2025-12-17

qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Mendukung audio dengan laju sampel dan saluran suara apa pun. Pengenalan file audio - Qwen

Speech recognition

2025-12-17

fun-asr-mtl, fun-asr-mtl-2025-08-25

Mendukung pengenalan ucapan dalam 31 bahasa, termasuk Tiongkok, Inggris, Jepang, dan Korea. Fitur ini ideal untuk skenario Asia Tenggara. Pengenalan file audio - Fun-ASR/Paraformer/SenseVoice

Voice design

2025-12-16

qwen-voice-design

Qwen telah merilis model desain suara untuk menghasilkan suara kustom dari deskripsi teks. Gunakan model ini bersama model qwen3-tts-vd-realtime-2025-12-16 untuk menghasilkan ucapan dalam 10 bahasa. Desain suara Qwen

Speech synthesis

2025-12-16

qwen3-tts-vd-realtime-2025-12-16 (snapshot)

Model snapshot baru untuk sintesis ucapan real-time Qwen menggunakan suara dari desain suara Qwen untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa, secara otomatis menyesuaikan nada berdasarkan teks, serta mengoptimalkan sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen

Text-to-image

2025-12-16

wan2.6-t2i

Antarmuka sinkron baru ditambahkan. Antarmuka ini mendukung pemilihan dimensi kustom dalam batasan luas piksel total dan rasio aspek. Wan - text-to-image V2

Image generation and editing

2025-12-16

wan2.6-image

Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - Image generation and editing 2.6

Image-to-video based on the first frame

2025-12-16

wan2.6-i2v

Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - image-to-video - first frame

reference-to-video

2025-12-16

wan2.6-r2v

Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Mendukung dubbing otomatis. Wan - reference-to-video

Text-to-video

2025-12-16

wan2.6-t2v

Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Text-to-video

Speech recognition

2025-12-12

fun-asr, fun-asr-2025-11-07

Pembaruan fitur untuk pengenalan file audio Fun-ASR:

  • Menambahkan dukungan untuk pengenalan bernyanyi guna mentranskripsi lagu lengkap. Lihat Pengenalan file audio - Fun-ASR/Paraformer/SenseVoice.

Omni-modal

2025-12-04

qwen3-omni-flash-2025-12-01

Model snapshot terbaru Qwen Omni meningkatkan jumlah timbre yang didukung menjadi 49 dan menampilkan peningkatan signifikan pada kemampuan mengikuti instruksi, memungkinkannya memahami teks, gambar, audio, dan video secara efisien. Non-real-time (Qwen-Omni)

Real-time multimodal

2025-12-04

qwen3-omni-flash-realtime-2025-12-01

Model snapshot terbaru untuk versi real-time Qwen-Omni menawarkan interaksi multimodal berlatensi rendah. Versi ini meningkatkan jumlah timbre yang didukung menjadi 49 dan secara signifikan meningkatkan kemampuan mengikuti instruksi serta pengalaman interaktif model. Real-time (Qwen-Omni-Realtime)

Speech translation

2025-12-04

qwen3-livetranslate-flash, qwen3-livetranslate-flash-2025-12-01

Qwen3-LiveTranslate-Flash adalah model terjemahan audio dan video yang menerjemahkan antara 18 bahasa, seperti Tiongkok, Inggris, Rusia, dan Prancis. Model ini memanfaatkan konteks visual untuk meningkatkan akurasi terjemahan dan menyediakan output teks maupun ucapan. Terjemahan file audio dan video (Qwen)

Multilingual translation

2025-12-02

qwen-mt-lite

Model terjemahan teks dasar dari Qwen. Model ini mendukung terjemahan antara 31 bahasa. Model ini menawarkan waktu respons lebih cepat dan biaya lebih rendah dibandingkan qwen-mt-flash, sehingga cocok untuk skenario yang sensitif terhadap latensi. Mesin terjemahan (Qwen-MT)

Voice cloning

2025-11-27

qwen-voice-enrollment

Qwen merilis model kloning suara. Model ini menghasilkan suara yang sangat mirip dari audio selama lebih dari 5 detik. Ketika digunakan bersama model qwen3-tts-vc-realtime-2025-11-27, model ini dapat membuat klon suara seseorang dengan fidelitas tinggi dan mengeluarkannya secara real time dalam 11 bahasa. Kloning suara Qwen

Speech synthesis

2025-11-27

qwen3-tts-vc-realtime-2025-11-27 (snapshot)

Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menggunakan suara yang dihasilkan oleh kloning suara Qwen untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa. Model ini dapat secara otomatis menyesuaikan nadanya berdasarkan teks dan mengoptimalkan kinerja sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen

Speech synthesis

2025-11-27

qwen3-tts-flash-realtime-2025-11-27 (snapshot)

Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menampilkan latensi rendah dan stabilitas tinggi. Model ini menawarkan pilihan suara yang lebih kaya, dan setiap suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya berdasarkan teks dan meningkatkan kinerja sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen

Speech synthesis

2025-11-27

qwen3-tts-flash-2025-11-27 (snapshot)

Sintesis ucapan Qwen merilis model snapshot baru. Model ini menawarkan pilihan suara yang lebih kaya. Setiap suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya berdasarkan teks dan mengoptimalkan sintesis untuk teks kompleks. Qwen text-to-speech (TTS)

Text extraction

2025-11-21

qwen-vl-ocr-2025-11-20 (snapshot)

Versi snapshot dari model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks

Speech recognition

2025-11-20

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 (snapshot)

Pengenalan file audio Qwen merilis model baru. Model ini dirancang untuk transkripsi asinkron file audio dan mendukung rekaman hingga 12 jam. Pengenalan file audio - Qwen

Speech recognition

2025-11-19

fun-asr-2025-11-07 (snapshot)

Model snapshot baru tersedia untuk pengenalan file audio Fun-ASR. Model ini mengoptimalkan deteksi aktivitas suara jarak jauh (VAD) untuk meningkatkan akurasi dan stabilitas pengenalan. Selain Tiongkok dan Inggris, model ini kini mendukung beberapa dialek Tiongkok dan bahasa Jepang. Pengenalan file audio - Fun-ASR/Paraformer/SenseVoice

Multilingual translation

2025-11-11

qwen-mt-flash

Dibandingkan qwen-mt-turbo, model ini mendukung output inkremental streaming dan menawarkan peningkatan kinerja keseluruhan. Kemampuan terjemahan (Qwen-MT)

Image-to-video

2025-11-10

wan2.2-animate-move

Memindahkan gerakan dan ekspresi karakter dari video template ke gambar statis tunggal untuk menghasilkan video karakter dalam gerak. Wan - Image-to-action

Image-to-video

2025-11-10

wan2.2-animate-mix

Model ini mengganti karakter utama dalam video referensi dengan karakter dari gambar. Model ini mempertahankan adegan, pencahayaan, dan nada video asli untuk mencapai penggantian karakter yang mulus. Wan - Video Character Swap

Reasoning model

2025-11-03

qwen3-max-preview

Mode berpikir dari model qwen3-max-preview menampilkan peningkatan signifikan pada kemampuan inferensi keseluruhan. Model ini unggul khususnya dalam pemrograman agen, penalaran akal sehat, dan tugas terkait matematika, sains, dan tujuan umum. Pemikiran mendalam

Image editing

2025-10-31

qwen-image-edit-plus, qwen-image-edit-plus-2025-10-30

Dibangun di atas qwen-image-edit, model ini memiliki kinerja inferensi dan stabilitas sistem yang dioptimalkan. Model ini secara signifikan mengurangi waktu respons untuk generasi dan pengeditan gambar serta mendukung pengembalian beberapa gambar dalam satu permintaan. Pengeditan gambar - Qwen

Real-time speech recognition

2025-10-27

qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27

Model speech recognition real-time Qwen memiliki fitur deteksi bahasa otomatis. Model ini dapat mendeteksi 11 jenis bahasa dan memberikan transkripsi akurat di lingkungan audio kompleks. Speech recognition real-time (Qwen)

Visual understanding

2025-10-21

qwen3-vl-32b-thinking, qwen3-vl-32b-instruct

Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial dan pengenalan objek, serta deteksi visual 2D dan penalaran spasial. Hal ini membuatnya cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video

Visual understanding

2025-10-16

qwen3-vl-flash, qwen3-vl-flash-2025-10-15

Model pemahaman visual skala kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open-source Qwen3-VL-30B-A3B, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video

Visual understanding

2025-10-14

qwen3-vl-8b-thinking, qwen3-vl-8b-instruct

Model dense 8B dari seri Qwen3-VL. Model ini menggunakan lebih sedikit memori GPU dan melakukan pemahaman dan inferensi multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, serta posisi visual 2D/3D. Model ini juga menampilkan kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video

Visual understanding

2025-10-03

qwen3-vl-30b-a3b-thinking, qwen3-vl-30b-a3b-instruct

Berdasarkan model open-source Qwen3-VL generasi baru, model ini merespons dengan cepat dan menampilkan pemahaman, inferensi, kemampuan agen visual, serta dukungan konteks ultra-panjang untuk video dan dokumen panjang yang lebih kuat. Model ini juga menyediakan peningkatan komprehensif pada kecerdasan spasial dan pengenalan objek untuk menangani tugas dunia nyata yang kompleks. Pemahaman gambar dan video

Visual understanding

2025-09-23

qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct

Model pemahaman visual Qwen3 secara efektif menggabungkan mode berpikir dan non-berpikir, dan kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini juga secara signifikan meningkatkan kemampuan persepsi dan deteksi visual. Pemahaman gambar dan video

Text-to-image

2025-09-23

qwen-image-plus

Model ini unggul dalam rendering teks kompleks, terutama untuk teks Tiongkok dan Inggris. Model ini dapat membuat tata letak kompleks yang menggabungkan gambar dan teks. Model ini juga lebih hemat biaya dibandingkan qwen-image. Qwen - text-to-image

Code model

2025-09-23

qwen3-coder-plus-2025-09-23

Dibandingkan versi sebelumnya (snapshot 22 Juli), model ini memiliki peningkatan kinerja pada tugas turunan dan ketahanan tool calling yang lebih besar. Model ini juga menampilkan peningkatan keamanan kode. Kemampuan kode (Qwen-Coder)

Reasoning model

2025-09-11

qwen-plus-2025-09-11

Model ini merupakan bagian dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini menawarkan peningkatan dalam mengikuti instruksi dan menghasilkan ringkasan yang lebih ringkas dalam mode berpikir. Lihat pemikiran mendalam. Dalam mode non-berpikir, model ini memiliki peningkatan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks.

Reasoning model

2025-09-11

qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct

Ini adalah model open source generasi baru berbasis Qwen3. Model berpikir merupakan peningkatan dari qwen3-235b-a22b-thinking-2507. Model ini menawarkan kemampuan mengikuti instruksi yang lebih baik dan respons ringkasan yang lebih ringkas. Lihat pemikiran mendalam. Model instruct merupakan peningkatan dari qwen3-235b-a22b-instruct-2507. Model ini menampilkan peningkatan kemampuan dalam pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks. Lihat Ikhtisar model generasi teks.

Text-to-text

2025-09-05

qwen3-max-preview

Qwen-Max adalah model pratinjau berbasis Qwen3. Model ini menawarkan peningkatan signifikan dalam kemampuan umum dibandingkan seri Qwen 2.5. Model ini menunjukkan peningkatan besar dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, dan menangani tugas subjektif terbuka. Kemampuan multibahasanya dan tool calling-nya juga lebih kuat. Model ini cenderung menghasilkan halusinasi pengetahuan yang lebih sedikit. Qwen-Max

Image editing

2025-08-19

qwen-image-edit

Model pengeditan gambar Qwen mendukung pengeditan teks presisi dalam bahasa Tiongkok dan Inggris, penyesuaian warna, peningkatan detail, transfer gaya, menambah atau menghapus objek, serta mengubah posisi dan tindakan. Model ini dapat melakukan pengeditan gambar dan teks yang kompleks. Pengeditan gambar - Qwen

Visual understanding

2025-08-18

qwen-vl-plus-2025-08-15

Model pemahaman visual. Model ini menawarkan peningkatan signifikan dalam deteksi objek, lokalisasi, dan pemrosesan multibahasa. Pemahaman gambar dan video

Text-to-image

2025-08-14

qwen-image

Model Qwen-Image unggul dalam rendering teks kompleks, terutama Tiongkok dan Inggris, untuk membuat tata letak rumit yang menggabungkan gambar dan teks.Text-to-image (Qwen-Image)

Visual understanding

2025-08-13

qwen-vl-max-2025-08-13

Model pemahaman visual. Model ini menunjukkan peningkatan metrik pemahaman visual secara komprehensif dan peningkatan signifikan dalam matematika, penalaran, pengenalan objek, dan pemrosesan multibahasa. Pemahaman gambar dan video

Code model

2025-08-05

qwen3-coder-flash, qwen3-coder-flash-2025-07-28

Model tercepat dan paling hemat biaya dalam seri Qwen-Coder. Kemampuan kode (Qwen-Coder).

Reasoning model

2025-08-05

qwen-flash, qwen-flash-2025-07-28

Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana.

Reasoning model

2025-07-30

qwen-plus-2025-07-28

Model dari seri Qwen3. Dibandingkan versi sebelumnya, model ini meningkatkan panjang konteks menjadi 1.000.000. Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks.

Reasoning model

2025-07-30

qwen3-30b-a3b-thinking-2507

qwen3-30b-a3b-instruct-2507

Versi peningkatan dari qwen3-30b-a3b. Model berpikir memiliki peningkatan dalam kemampuan logis, umum, peningkatan pengetahuan, dan kreatif. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks.

Image-to-video

2025-07-28

wan2.2-i2v-plus

Dibandingkan model 2.1, versi baru ini secara signifikan meningkatkan detail gambar dan stabilitas gerakan. Kecepatan generasi meningkat hingga 50%. First-frame video generation

Text-to-video

2025-07-28

wan2.2-t2v-plus

Dibandingkan model 2.1, versi baru ini secara signifikan meningkatkan detail gambar dan stabilitas gerakan. Kecepatan generasi 50% lebih cepat. Text-to-video

Text-to-image

2025-07-28

wan2.2-t2i-flash, wan2.2-t2i-plus

Versi baru ini merupakan peningkatan besar terhadap model 2.1. Model ini lebih kreatif, stabil, dan realistis. Gambar dihasilkan 50% lebih cepat. Text-to-image

Reasoning model

2025-07-24

qwen3-235b-a22b-thinking-2507, qwen3-235b-a22b-instruct-2507

Ini adalah peningkatan dari qwen3-235b-a22b. Model berpikir memiliki peningkatan besar dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas. Model ini ideal untuk skenario kompleks yang membutuhkan inferensi kuat. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks.

Code model

2025-07-23

qwen3-coder, qwen3-coder-plus-2025-07-22

Model generasi kode berbasis Qwen3. Model ini memiliki kemampuan Coding Agent yang kuat dan unggul dalam tool calling dan interaksi lingkungan. Model ini menggabungkan kemampuan kode yang luar biasa dengan kemampuan tujuan umum. Kemampuan kode (Qwen-Coder)

Visual understanding

2025-06-04

qwen-vl-plus-2025-05-07

Model pemahaman visual. Model ini memiliki peningkatan signifikan dalam matematika, penalaran, dan pemahaman konten dari video pengawasan. Pemahaman gambar dan video.

Text-to-image

2025-05-22

wan2.1-t2i-turbo, wan2.1-t2i-plus

Menghasilkan gambar dari satu kalimat. Model ini menghasilkan gambar dengan resolusi dan rasio aspek apa pun, hingga 2 juta piksel. Model ini tersedia dalam dua versi: turbo dan plus. Text-to-image

Visual understanding

2025-05-16

qwen-vl-max-2025-04-08

Model pemahaman visual. Model ini memiliki peningkatan kemampuan matematika dan penalaran. Gaya respons disesuaikan agar selaras dengan preferensi manusia, dan responsnya jauh lebih detail dan diformat dengan jelas. Pemahaman gambar dan video

Visual understanding

2025-05-16

qwen-vl-plus-2025-01-25

Model pemahaman visual. Model ini termasuk dalam seri Qwen2.5-VL. Dibandingkan versi sebelumnya, model ini memperluas konteks hingga 128k dan secara signifikan meningkatkan pemahaman gambar dan video.

Video editing

2025-05-19

wan2.1-vace-plus

Model pengeditan video tujuan umum. Model ini mendukung input multimodal, menggabungkan gambar, video, dan prompt teks. Model ini dapat melakukan berbagai tugas seperti image-to-video (menghasilkan video berdasarkan subjek atau latar belakang gambar referensi) dan video repainting (mengekstraksi fitur gerakan dari video input untuk menghasilkan video baru). Pengeditan video umum

Reasoning model

2025-04-28

Model komersial Qwen3

qwen-plus-2025-04-28, qwen-turbo-2025-04-28

Model open-source Qwen3

qwen3-235b-a22b, qwen3-30b-a3b, qwen3-32b, qwen3-14b, qwen3-8b, qwen3-4b, qwen3-1.7b, qwen3-0.6b

Model Qwen3 mendukung mode berpikir dan non-berpikir. Beralih antara kedua mode tersebut menggunakan parameter enable_thinking. Selain itu, kemampuan model-model Qwen3 telah sangat ditingkatkan:

  1. Kemampuan inferensi: Dalam evaluasi untuk matematika, kode, dan penalaran logis, model-model ini secara signifikan mengungguli QwQ dan model non-penalaran lainnya dengan ukuran serupa, mencapai tingkat kinerja industri teratas.

  2. Penyelarasan preferensi manusia: Kemampuan untuk penulisan kreatif, bermain peran, percakapan multi-turn, dan mengikuti instruksi sangat ditingkatkan. Kemampuan umumnya secara signifikan melebihi model dengan ukuran serupa.

  3. Kemampuan agen: Model mencapai kinerja terdepan di industri dalam mode penalaran dan non-penalaran. Model dapat memanggil alat eksternal secara akurat.

  4. Kemampuan multibahasa: Model mendukung lebih dari 100 bahasa dan dialek. Kemampuan untuk terjemahan multibahasa, pemahaman instruksi, dan penalaran akal sehat ditingkatkan secara signifikan.

  5. Perbaikan format respons: Versi ini memperbaiki masalah format respons dari versi sebelumnya, seperti Markdown abnormal, pemotongan tengah kalimat, dan output boxed yang salah.

Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks.

Text-to-video

2025-04-21

wan2.1-t2v-turbo, wan2.1-t2v-plus

  • Menghasilkan video dari satu kalimat.

  • Model ini secara akurat mengikuti instruksi, mendukung gerakan besar dan kompleks, serta mensimulasikan fisika dunia nyata. Video yang dihasilkan menampilkan gaya artistik yang kaya dan kualitas sinematik. Wan text-to-video.

Image-to-video

2025-04-21

wan2.1-kf2v-plus, wan2.1-i2v-turbo, wan2.1-i2v-plus,

Visual reasoning

2025-03-28

qvq-max, qvq-max-latest, qvq-max-2025-03-25

Model penalaran visual. Model ini mendukung input visual dan output rantai-pikiran, menunjukkan kemampuan yang lebih kuat dalam matematika, pemrograman, analisis visual, kreasi, dan tugas umum. Penalaran visual

Omni-modal

2025-03-26

qwen2.5-omni-7b

Model multimodal baru dari Qwen untuk pemahaman dan generasi. Model ini mendukung input teks, gambar, ucapan, dan video, serta menghasilkan teks dan audio. Model ini menyediakan dua suara percakapan alami. Non-real-time (Qwen-Omni).

Visual understanding

2025-03-24

qwen2.5-vl-32b-instruct

Model pemahaman visual. Kemampuan menyelesaikan soal matematika mendekati tingkat Qwen2.5VL-72B. Gaya respons telah disesuaikan secara signifikan agar selaras dengan preferensi manusia. Model ini kini memberikan jawaban yang jauh lebih detail dan diformat dengan jelas, terutama untuk pertanyaan objektif dalam matematika, penalaran logis, dan tanya jawab pengetahuan. Pemahaman gambar dan video

Reasoning model

2025-03-06

qwq-plus

Model penalaran QwQ, dilatih pada model Qwen2.5, sangat meningkatkan kemampuan penalaran melalui pembelajaran penguatan. Metrik inti model untuk matematika dan kode (AIME 24/25, LiveCodeBench) dan beberapa metrik umum (IFEval, LiveBench, dll.) mencapai tingkat DeepSeek-R1 berkinerja penuh. Pemikiran mendalam

Visual understanding

2025-01-27

qwen2.5-vl-3b-instruct

qwen2.5-vl-7b-instruct

qwen2.5-vl-72b-instruct

  • Dibandingkan model Qwen2-VL, model ini memiliki peningkatan berikut:

    • Memiliki peningkatan signifikan dalam mengikuti instruksi, perhitungan matematika, generasi kode, dan output terstruktur (output JSON).

    • Mendukung parsing terpadu konten visual dalam gambar, seperti teks, grafik, dan tata letak. Model ini juga dapat secara akurat melokalisasi elemen visual dan merepresentasikannya menggunakan kotak deteksi dan titik koordinat.

    • Mengerti file video panjang (hingga 10 menit), menyediakan lokalisasi peristiwa dengan presisi tingkat detik, dan mengenali urutan dan kecepatan peristiwa.

  • Lihat Pemahaman gambar dan video.

Text-to-text

2025-01-27

qwen-max-2025-01-25

qwen2.5-14b-instruct-1m

qwen2.5-7b-instruct-1m

  • Model qwen-max-2025-01-25 (juga dikenal sebagai Qwen2.5-Max): Model dengan kinerja terbaik dalam seri Qwen. Model ini memiliki peningkatan signifikan dalam penulisan dan pemahaman kode, penalaran logis, dan kemampuan multibahasa. Gaya respons disesuaikan secara signifikan agar selaras dengan preferensi manusia. Detail dan kejelasan format responsnya ditingkatkan secara signifikan, dengan peningkatan yang ditargetkan dalam pembuatan konten, kepatuhan format JSON, dan asumsi peran. Lihat Ikhtisar model generasi teks.

  • Model qwen2.5-14b-instruct-1m dan qwen2.5-7b-instruct-1m: Dibandingkan model qwen2.5-14b-instruct dan qwen2.5-7b-instruct, panjang konteksnya ditingkatkan menjadi 1.000.000. Lihat Ikhtisar model generasi teks.

Text-to-text

2025-01-17

qwen-plus-2025-01-12

  • Dibandingkan model qwen-plus-2024-12-20, model ini menawarkan peningkatan kemampuan keseluruhan dalam bahasa Tiongkok dan Inggris. Model ini menunjukkan peningkatan signifikan dalam akal sehat, pemahaman membaca, dan kemampuan mengikuti instruksi bahasa Tiongkok. Model ini juga beralih lebih alami antara berbagai bahasa, dialek, dan gaya. Lihat qwen-plus-2025-01-12.

Multilingual translation

2024-12-25

qwen-mt-plus

qwen-mt-turbo

  • Model Qwen-MT adalah model bahasa besar untuk terjemahan mesin yang dioptimalkan berdasarkan model Qwen. Model ini unggul dalam terjemahan antara Tiongkok dan Inggris, Tiongkok dan bahasa minoritas, serta Inggris dan bahasa minoritas. Bahasa minoritas mencakup 26 bahasa seperti Jepang, Korea, Prancis, Spanyol, Jerman, Portugis (Brasil), Thailand, Indonesia, Vietnam, dan Arab. Selain terjemahan multibahasa, model ini mendukung fitur seperti intervensi terminologi, prompting domain, dan memori terjemahan untuk meningkatkan kualitas terjemahan dalam skenario kompleks. Lihat Mesin terjemahan (Qwen-MT).

Visual understanding

2024-12-18

qwen2-vl-72b-instruct

  • Mencapai hasil mutakhir pada berbagai benchmark pemahaman visual, secara signifikan meningkatkan pemrosesan tugas multimodal. Lihat Pemahaman gambar dan video untuk instruksi.

Amerika Serikat

Saat cakupan penerapan layanan adalah Amerika Serikat, penyimpanan data berada di wilayah akses Amerika Serikat (Virginia). Sumber daya komputasi inferensi model dibatasi hanya untuk Amerika Serikat.

Type

Waktu

Model

Deskripsi

Role play

2026-08-30

qwen-flash-character

Seri Model Role-Playing Qwen dirancang khusus untuk skenario interaksi antropomorfis multi-bahasa. Model ini menunjukkan kemampuan lanjutan dalam pemeliharaan konsistensi karakter, perkembangan dialog berbasis konteks, dan keterlibatan empatik, memungkinkan perwujudan karakter personalisasi yang mendalam.

Visual understanding

2026-03-14

qwen3-vl-flash-2026-01-22-us

Versi snapshot baru Qwen-VL ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Dibandingkan snapshot 15 Oktober 2025, model ini secara signifikan meningkatkan kinerja keseluruhan. Model ini mencapai inferensi akurasi lebih tinggi dalam skenario seperti pengenalan visual umum, keamanan, inspeksi toko, dan pemecahan masalah berbasis foto. Lihat Pemahaman gambar dan video.

Image-to-video based on the first frame

2026-01-04

wan2.6-i2v-us

Model ini menambahkan fitur narasi multi-shot. Model ini mendukung audio melalui dubbing otomatis atau menggunakan file audio kustom. Lihat Wan - image-to-video - based on the first frame.

Text-to-video

2026-01-04

wan2.6-t2v-us

Model ini menambahkan fitur narasi multi-shot. Model ini mendukung audio melalui dubbing otomatis atau menggunakan file audio kustom. Lihat Wan - text-to-video.

Speech recognition

2026-01-04

qwen3-asr-flash-us, qwen3-asr-flash-2025-09-08-us

Mendukung audio dengan laju sampel dan saluran suara apa pun. Lihat Pengenalan file audio - Qwen.

Visual understanding

2026-01-04

qwen3-vl-flash-us, qwen3-vl-flash-2025-10-15-us

Ini adalah model pemahaman visual skala kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open source Qwen3-VL-30B-A3B, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Lihat Pemahaman gambar dan video.

Reasoning model

2026-01-04

qwen-plus-2025-12-01-us

Ini adalah model dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan respons ringkasan yang lebih ringkas dalam mode berpikir. Lihat Pemikiran mendalam. Dalam mode non-berpikir, kemampuan pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks.

Reasoning model

2026-01-04

qwen-plus-us

Menawarkan keseimbangan kemampuan. Kinerja inferensinya, biaya, dan kecepatannya berada di antara Qwen-Max dan Qwen-Flash, sehingga cocok untuk tugas dengan tingkat kompleksitas sedang.

Text-to-text

2026-01-04

qwen-flash-us, qwen-flash-2025-07-28-us

Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana.

Tiongkok daratan

Saat cakupan penerapan layanan adalah Tiongkok daratan, penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.

Type

Waktu

Model

Deskripsi

Video editing

2026-04-03

wan2.7-videoedit

Model video editing Wan 2.7 mendukung editing berbasis instruksi dan migrasi video. Model ini dapat memodifikasi bagian video atau seluruh frame, serta mendukung penggantian referensi multi-gambar dan replikasi gerakan, efek, serta pergerakan kamera. Wan2.7 - video editing

Image-to-video

2026-04-03

wan2.7-i2v

Model image-to-video Wan 2.7 mendukung input multimodal, termasuk teks, gambar, audio, dan video. Model ini menjalankan tiga tugas utama: menghasilkan video dari frame pertama, menghasilkan video dari frame pertama dan terakhir, dan kelanjutan video. Wan2.7 - image-to-video

Text-to-video

2026-04-03

wan2.7-t2v

Model text-to-video Wan 2.7 menambahkan tingkat resolusi baru dan pengaturan rasio aspek kustom. Ini memungkinkan adaptasi fleksibel untuk berbagai skenario kreatif dan kebutuhan penerbitan platform. Wan - text-to-video

Reference-to-video

2026-04-03

wan2.7-r2v

Model reference-to-video Wan 2.7 mendukung referensi subjek dan kustomisasi suara. Model ini dapat menghasilkan video berbasis naskah langsung dari satu gambar storyboard multi-panel. Wan - reference-to-video

Reasoning model

2026-04-02

qwen3.6-plus, qwen3.6-plus-2026-04-02

Qwen3.6-Plus dengan peningkatan signifikan dalam kemampuan coding (Agentic Coding, pemrograman frontend, dll.) dan pengalaman Vibe Coding yang sangat ditingkatkan. Penalaran tujuan umum semakin ditingkatkan. Kemampuan multimodal termasuk pengenalan universal, OCR, dan lokalisasi objek ditingkatkan secara signifikan. Masalah yang diketahui dari rilis Qwen3.5-Plus juga diperbaiki. Penggunaan identik dengan qwen3.5-plus. Ikhtisar generasi teks

Image generation and editing

2026-04-01

wan2.7-image-pro, wan2.7-image

Model generasi dan pengeditan gambar Wan 2.7 mendukung teks-ke-gambar, teks-ke-set-gambar, gambar-ke-set-gambar, pengeditan gambar, generasi dengan banyak referensi gambar, dan pengeditan interaktif, dengan peningkatan kinerja dalam rendering teks, konsistensi subjek, dan mengikuti instruksi kompleks. Seri Pro mendukung output 4K; versi akselerasi menyeimbangkan kualitas dan kecepatan respons. Wan - image generation and editing 2.7

Omni-modal

2026-03-30

qwen3.5-omni-plus, qwen3.5-omni-plus-2026-03-15, qwen3.5-omni-flash, qwen3.5-omni-flash-2026-03-15

Model omni-modal terbaru. Model ini mendukung analisis video panjang, notulen rapat, output subtitle, audit keamanan, dan interaksi audio-video. Model ini juga mendukung pemahaman mendalam dan pembuatan deskripsi untuk konten audio dan video, mengenali 113 bahasa, dan menghasilkan audio dalam 36 bahasa. Model ini dapat memproses input audio hingga 3 jam dan video hingga 1 jam, serta mendukung pencarian web dan instruksi untuk mengontrol volume, kecepatan, dan emosi output audio. Non-real-time (Qwen-Omni)

Omni-modal

2026-03-30

qwen3.5-omni-plus-realtime, qwen3.5-omni-plus-realtime-2026-03-15, qwen3.5-omni-flash-realtime, qwen3.5-omni-flash-realtime-2026-03-15

Model multimodal real-time terbaru dari Qwen. Dibandingkan generasi sebelumnya Qwen3-Omni-Flash-Realtime, model ini menampilkan peningkatan kecerdasan yang signifikan dan setara dengan Qwen3.5-Plus. Model ini secara native mendukung pencarian web (WebSearch), interupsi suara, dan kontrol suara. Model ini mengenali 113 bahasa dan dialek, serta menghasilkan ucapan dalam 36 bahasa dan dialek. Real-time (Qwen-Omni-Realtime)

Reasoning model

2026-03-11

MiniMax-M2.5

Model baru dari MiniMax, menampilkan kecepatan respons cepat dan unggul dalam tugas seperti pemrograman dan pekerjaan kantor. Penggunaan

Speech recognition

2026-03-05

fun-asr-realtime-2026-02-28

Fun-ASR real-time speech recognition menambahkan model snapshot baru, yang menunjukkan kinerja lebih baik dibandingkanfun-asr-realtime-2025-11-07. Real-time speech recognition - Fun-ASR/Gummy/Paraformer

Image generation and editing

2026-03-03

qwen-image-2.0, qwen-image-2.0-2026-03-03, qwen-image-2.0-pro, qwen-image-2.0-pro-2026-03-03

Seri Qwen-Image2.0 mendukung generasi dan pengeditan gambar. Seri Pro menawarkan kemampuan yang lebih kuat dalam rendering teks, tekstur realistis, dan pemahaman semantik. Versi akselerasi menyeimbangkan performa dengan kecepatan respons. Qwen - text-to-image, Qwen - image editing

Speech recognition

2026-03-03

qwen3-asr-flash-2026-02-10

Pengenalan file audio Qwen menambahkan model snapshot baru, yang menunjukkan kinerja lebih baik dibandingkanqwen3-asr-flash-2025-09-08. Audio file recognition - Qwen

Speech synthesis

2026-03-02

cosyvoice-v3.5-plus, cosyvoice-v3.5-flash

Model CosyVoice3.5 dirilis. Model ini berfokus pada kloning suara dan desain, serta mendukung kendali instruksi untuk sintesis ucapan. Real-time speech synthesis - CosyVoice

Reasoning model

2026-02-24

qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b

Model terbaru Qwen3.5-Flash dan model open source dari Alibaba. Model-model ini mendukung input teks, gambar, dan video, memberikan respons cepat, serta mencapai kinerja keseluruhan yang mendekati qwen3.5-plus. Model-model ini juga mendukung tool calling bawaan. Text generation overview

Code model

2026-02-20

qwen3-coder-next

Model generasi kode open-source generasi berikutnya dalam seri Qwen3. Model ini mendukung interaksi alat multi-turn, memiliki peningkatan pemahaman kode tingkat repositori, dan kompatibilitas yang lebih baik dengan alat pemrograman AI. Kemampuan kode (Qwen-Coder)

Reasoning model

2026-02-18

glm-5

Model terbaru Zhipu, dirancang untuk skenario pemrograman dan agen, unggul dalam rekayasa sistem kompleks dan tugas agen jangka panjang. GLM

Reasoning model

2026-02-16

qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b

Model Qwen3.5-Plus dan model open source terbaru dari Alibaba. Model-model ini mendukung input teks, gambar, dan video serta memberikan kinerja luar biasa di berbagai tugas seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan interaksi antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks

Speech recognition

2026-02-13

qwen3-asr-flash-realtime-2026-02-10

Model snapshot baru ditambahkan untuk speech recognition real-time Qwen, yang menunjukkan kinerja lebih baik dibandingkanqwen3-asr-flash-realtime-2025-10-27. Real-time speech recognition - Qwen

Speech recognition

2026-02-12

fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28

Model ASR ringan baru berbasis arsitektur Fun-ASR, dioptimalkan untuk skenario 8 kHz dan cocok untuk pelanggan yang sensitif terhadap biaya. Real-time speech recognition - Fun-ASR/Gummy/Paraformer

Speech synthesis

2026-02-10

qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26

Sintesis ucapan Qwen memperkenalkan model Instruct, yang memungkinkan Anda mengontrol efek sintesis secara presisi menggunakan instruksi bahasa alami. Speech synthesis - Qwen

Speech synthesis

2026-02-10

qwen3-tts-vd-2026-01-26

Sintesis ucapan Qwen memperkenalkan model desain suara, yang memungkinkan Andamembuat suara kustom menggunakan deskripsi teks. Speech synthesis - Qwen

Speech synthesis

2026-02-10

qwen3-tts-vc-2026-01-22

Sintesis ucapan Qwen memperkenalkan model kloning suara, yang memungkinkan Andasecara cepat mengkloning suara dari sampel audio asli. Speech synthesis - Qwen

Speech synthesis

2026-02-04

qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22

Sintesis ucapan real-time Qwen menambahkan model Instruct, yang memungkinkan Anda mengontrol efek sintesis secara presisi menggunakan instruksi bahasa alami. Real-time speech synthesis - Qwen

Reference-to-video

2026-02-02

wan2.6-r2v-flash

Menghasilkan video multi-shot dengan dubbing otomatis, menggunakan penampilan karakter dari video referensi atau gambar. Wan - Reference-to-Video

Text generation and visual understanding

2026-01-30

kimi-k2.5

Model pemahaman visual dari Moonshot AI yang unggul dalam tugas kecerdasan umum seperti generasi kode dan pemahaman visual. Model ini mendukung input gambar, video, dan teks, serta dapat melakukan tugas dialog dan agen. Kimi - Alibaba Cloud

Speech recognition

2026-01-28

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17

Seri Qwen3-ASR-Flash-Filetrans kini mendukung timestamp tingkat kata. Atur parameter baru enable_words untuk mendapatkan informasi alignment kata dan karakter tingkat milidetik serta mengalami segmentasi kalimat yang lebih tepat secara semantik dan detail halus. Audio file recognition - Qwen

Reasoning model

2026-01-27

qwen3-max-2026-01-23

Dibandingkan versi snapshot 23 September 2025, model ini secara efektif menggabungkan mode berpikir dan non-berpikir, meningkatkan kinerja keseluruhan secara signifikan. Dalam mode berpikir, model terintegrasi dengan tiga alat: pencarian web, ekstraksi informasi web, dan interpreter kode. Dengan menggunakan alat eksternal selama proses berpikirnya, model ini mencapai akurasi lebih tinggi pada masalah kompleks. OpenAI compatible - Respons

Visual understanding

2026-01-23

qwen3-vl-flash-2026-01-22

Snapshot baru Qwen-VL. Dibandingkan snapshot 15 Oktober 2025, model ini secara efektif menggabungkan mode berpikir dan non-berpikir, meningkatkan kinerja keseluruhan model secara signifikan. Model ini mencapai akurasi inferensi yang lebih tinggi dalam skenario bisnis seperti pengenalan visual umum, pemantauan keamanan, inspeksi toko dan patroli, serta pemecahan masalah berbasis foto. Pemahaman gambar dan video

Image-to-video

2026-01-17

wan2.6-i2v-flash

Mendukung pembuatan video dengan dan tanpa suara. Kedua jenis video tersebut ditagih secara independen sesuai aturan penagihan masing-masing. Model ini juga menyediakan kemampuan narasi multi-shot dan pemrosesan audio. Wan - Image-to-video - based on first frame

Image editing

2026-01-17

qwen-image-edit-max, qwen-image-edit-max-2026-01-16

Seri Qwen-Image-Edit-Max menawarkan kemampuan pengeditan yang lebih stabil dan kaya, peningkatan kemampuan desain industri dan inferensi geometris, serta peningkatan konsistensi karakter dan presisi pengeditan. Pengeditan gambar - Qwen

Speech synthesis

2026-01-16

qwen3-tts-vc-realtime-2026-01-15

Model snapshot baru ditambahkan untuk sintesis ucapan real-time Qwen. Kinerja voice cloning (Qwen) lebih dioptimalkan. Model baru ini terdengar lebih alami dan lebih dekat dengan suara asli dibandingkan qwen3-tts-vc-realtime-2025-11-27. Real-time speech synthesis - Qwen

Text-to-image

2026-01-12

qwen-image-plus-2026-01-09

Model snapshot baru ini untuk generasi teks-ke-gambar Qwen merupakan versi distilasi dan akselerasi dari qwen-image-max yang menghasilkan gambar berkualitas tinggi secara cepat. Qwen - text-to-image

Reasoning model

2026-01-12

deepseek-v3.2

Model deepseek-v3.2 mendukung caching implisit dan eksplisit untuk meningkatkan kecepatan respons dan mengurangi biaya penggunaan tanpa memengaruhi kualitas respons. Context cache

Image-to-video

2026-01-08

wan2.2-kf2v-flash

Berdasarkan prompt dan frame awal serta akhir input, model ini dapat menghasilkan video dinamis yang mulus. First-and-last-frame-to-video

Speech recognition

2026-01-06

qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Qwen3-ASR-Flash mendukung mode kompatibel OpenAI. Audio file recognition - Qwen

Speech synthesis

2026-01-05

cosyvoice-v3-flash

Sintesis ucapan CosyVoice menambahkan 24 suara baru (lihat Daftar suara):

  • Dialek: Long Jiayi, Long Laotie

  • Pemasaran luar negeri: loongkyong, loongtomoka

  • Pembacaan puisi: Long Fei

  • Asisten suara: Long Xiaochun, Long Xiaoxia, YUMI

  • Teman sosial: Long Cheng, Long Ze, Long Zhe, Long Yan, Long Xing, Long Tian, Long Wan, Long Qiang, Long Feifei, Long Hao

  • Audiobook: Long Sanshu, Long Yuan, Long Yue, Long Xiu, Long Nan

  • Laporan berita: Long Shu

Text-to-image

2025-12-31

qwen-image-max, qwen-image-max-2025-12-30

Seri Max model generasi gambar Qwen meningkatkan realisme dan kealamian gambar dibandingkan seri Plus, secara efektif mengurangi artefak hasil generasi AI, serta unggul dalam aspek seperti tekstur karakter, detail tekstur, dan rendering teks. Qwen - text-to-image

Image editing

2025-12-23

qwen-image-edit-plus-2025-12-15

Model snapshot terbaru untuk pengeditan gambar Qwen meningkatkan konsistensi karakter, kemampuan desain industri, dan inferensi geometris dibandingkan versi sebelumnya. Model ini juga mengoptimalkan keselarasan tata letak spasial, tekstur, dan gaya antara gambar yang diedit dan gambar asli, menghasilkan pengeditan yang lebih presisi. Pengeditan gambar - Qwen

Text-to-image

2025-12-19

z-image-turbo

Model text-to-image ringan yang dengan cepat menghasilkan gambar berkualitas tinggi. Model ini mendukung rendering bilingual dalam bahasa Tiongkok dan Inggris, pemahaman semantik kompleks, berbagai gaya dan tema, serta adaptasi fleksibel terhadap berbagai resolusi dan rasio aspek. Text-to-image Z-Image

Visual understanding

2025-12-19

qwen3-vl-plus-2025-12-19

Model snapshot baru Qwen-VL ini menampilkan peningkatan kemampuan mengikuti instruksi dan latensi lebih rendah. Pemahaman gambar dan video

Speech recognition

2025-12-19

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17, qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Pengenalan ucapan kini mendukung 9 bahasa tambahan, termasuk Ceko dan Denmark. Audio file recognition - Qwen

Speech recognition

2025-12-17

qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27

Pengenalan ucapan kini didukung dalam sembilan bahasa tambahan, termasuk Ceko dan Denmark. Real-time speech recognition - Qwen

Speech recognition

2025-12-17

qwen3-asr-flash, qwen3-asr-flash-2025-09-08

Mendukung audio dengan laju sampel dan saluran suara apa pun. Audio file recognition - Qwen

Speech recognition

2025-12-17

fun-asr-mtl, fun-asr-mtl-2025-08-25

Mendukung pengenalan ucapan untuk 31 bahasa, termasuk Tiongkok, Inggris, Jepang, dan Korea. Ideal untuk skenario di Asia Tenggara. Audio file recognition - Fun-ASR/Paraformer/SenseVoice

Speech synthesis

2025-12-16

qwen3-tts-vd-realtime-2025-12-16 (snapshot)

Model snapshot baru untuk sintesis ucapan real-time Qwen menggunakan suara yang dihasilkan oleh voice design (Qwen) untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa, secara otomatis menyesuaikan nada berdasarkan teks, dan mengoptimalkan kinerja sintesis untuk teks kompleks. Real-time speech synthesis - Qwen

Text-to-image

2025-12-16

wan2.6-t2i

Antarmuka sinkron baru ditambahkan. Antarmuka ini mendukung pemilihan dimensi kustom dalam batasan luas piksel total dan rasio aspek. Wan - Text-to-image V2

Image generation and editing

2025-12-16

wan2.6-image

Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - Image Generation and Editing 2.6

Image-to-video - based on first frame

2025-12-16

wan2.6-i2v

Menambahkan fitur narasi multi-shot dan dukungan audio, sehingga Anda dapat menggunakan dubbing otomatis atau mengunggah file audio kustom. Wan - Image-to-video - based on first frame

Reference-to-video

2025-12-16

wan2.6-r2v

Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Model ini juga mendukung dubbing otomatis. Wan - Reference-to-Video

Text-to-video

2025-12-16

wan2.6-t2v

Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Text-to-Video

Speech recognition

2025-12-12

fun-asr, fun-asr-2025-11-07

Pembaruan fitur untuk pengenalan file audio Fun-ASR:

  • Menambahkan dukungan untuk pengenalan bernyanyi guna mentranskripsi lagu lengkap. Lihat Audio file recognition - Fun-ASR/Paraformer/SenseVoice.

Speech synthesis

2025-12-11

cosyvoice-v3-flash, cosyvoice-v3-plus

  • Kini model cosyvoice-v3-flash mencakup lima suara sistem baru: longanrou_v3, longyingjing_v3, longyingling_v3, longanling_v3, dan longhan_v3. Semua suara ini mendukung fitur timestamp dan SSML. Lihat Daftar suara.

  • Fitur kloning suara untuk model cosyvoice-v3-flash dan cosyvoice-v3-plus telah ditingkatkan. Fitur ini kini mendukung timestamp dan SSML, serta menyediakan prosodi yang lebih baik. Untuk mencoba peningkatan ini, buat suara baru. Lihat CosyVoice voice cloning/design API.

Omni-modal

2025-12-04

qwen3-omni-flash-2025-12-01

Model snapshot terbaru Qwen Omni meningkatkan jumlah timbre yang didukung menjadi 49 dan menampilkan peningkatan signifikan pada kemampuan mengikuti instruksi, memungkinkannya memahami teks, gambar, audio, dan video secara efisien. Non-real-time (Qwen-Omni)

Real-time multimodal

2025-12-04

qwen3-omni-flash-realtime-2025-12-01

Model snapshot terbaru untuk versi real-time Qwen Omni menawarkan interaksi multimodal berlatensi rendah. Jumlah timbre yang didukung meningkat menjadi 49, dan kemampuan mengikuti instruksi serta pengalaman interaktif model ditingkatkan secara signifikan. Real-time (Qwen-Omni-Realtime)

Speech translation

2025-12-04

qwen3-livetranslate-flash, qwen3-livetranslate-flash-2025-12-01

Qwen3-LiveTranslate-Flash adalah model terjemahan audio dan video yang menerjemahkan antara 18 bahasa, seperti Tiongkok, Inggris, Rusia, dan Prancis. Model ini menggunakan konteks visual untuk meningkatkan akurasi terjemahan dan menyediakan output teks maupun ucapan. Audio and video file translation - Qwen

Reasoning model

2025-12-04

deepseek-v3.2

DeepSeek-V3.2 adalah model resmi yang memperkenalkan DeepSeek Sparse Attention, yaitu mekanisme perhatian jarang. Ini juga merupakan model DeepSeek pertama yang mengintegrasikan berpikir dengan penggunaan alat, dan mendukung tool calling dalam mode berpikir maupun non-berpikir.

DeepSeek - Alibaba Cloud

Multilingual translation

2025-12-02

qwen-mt-lite

Model dasar terjemahan teks Qwen mendukung terjemahan antara 31 bahasa. Dibandingkan qwen-mt-flash, model ini memberikan respons lebih cepat dengan biaya lebih rendah, sehingga cocok untuk skenario yang sensitif terhadap latensi. Kemampuan terjemahan (Qwen-MT)

Voice cloning

2025-11-27

qwen-voice-enrollment

Qwen merilis model kloning suara. Model ini dapat dengan cepat menghasilkan suara yang sangat mirip dari klip audio selama 5 detik atau lebih. Ketika dikombinasikan dengan model qwen3-tts-vc-realtime-2025-11-27, model ini dapat mengkloning suara seseorang dengan fidelitas tinggi dan mengeluarkannya secara real time dalam 11 bahasa. Voice cloning (Qwen)

Speech synthesis

2025-11-27

qwen3-tts-vc-realtime-2025-11-27 (snapshot)

Sintesis ucapan real-time Qwen telah merilis model snapshot baru yang menyediakan sintesis real-time berlatensi rendah dan stabilitas tinggi menggunakan suara yang dihasilkan oleh voice cloning (Qwen). Model ini juga mendukung output multibahasa, secara otomatis menyesuaikan intonasi berdasarkan teks, dan mengoptimalkan sintesis untuk teks kompleks. Real-time speech synthesis - Qwen

Speech synthesis

2025-11-27

qwen3-tts-flash-realtime-2025-11-27 (snapshot)

Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menawarkan latensi rendah dan stabilitas tinggi. Model ini menyediakan lebih banyak pilihan suara, dan satu suara dapat mendukung output multibahasa. Model ini secara otomatis menyesuaikan intonasinya berdasarkan teks dan meningkatkan sintesis untuk teks kompleks. Real-time speech synthesis - Qwen

Speech synthesis

2025-11-27

qwen3-tts-flash-2025-11-27 (snapshot)

Sintesis ucapan Qwen merilis model snapshot baru. Model ini menawarkan lebih banyak pilihan suara, dan satu suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya dengan teks dan menyediakan sintesis yang dioptimalkan untuk teks kompleks. Speech synthesis - Qwen

Text extraction

2025-11-21

qwen-vl-ocr-2025-11-20 (snapshot)

Versi snapshot dari model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks

Speech recognition

2025-11-20

qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 (snapshot)

Pengenalan File Audio Qwen merilis model baru. Model ini dirancang untuk transkripsi asinkron file audio dan mendukung rekaman hingga 12 jam. Audio file recognition - Qwen

Speech synthesis

2025-11-19

cosyvoice-v3-flash

Versi ini meningkatkan akurasi pengucapan dan kemiripan suara dibandingkan versi sebelumnya. Model ini juga mendukung lebih banyak bahasa, termasuk Jerman, Spanyol, Prancis, Italia, dan Rusia. Real-time speech synthesis - CosyVoice/Sambert

Reasoning model

2025-11-11

kimi-k2-thinking

Ini adalah model berpikir dari Moonshot AI. Model ini memiliki kemampuan agen dan penalaran umum, unggul dalam penalaran mendalam, serta dapat menyelesaikan masalah kompleks melalui tool calling multi-langkah. Kimi - Alibaba Cloud

Multilingual translation

2025-11-10

qwen-mt-flash

Dibandingkan qwen-mt-turbo, model ini mendukung output inkremental streaming dan memiliki peningkatan kinerja keseluruhan. Kemampuan terjemahan (Qwen-MT)

Image-to-video

2025-11-04

wan2.2-animate-mix

Mengganti karakter utama dalam video referensi dengan karakter dari gambar input, sekaligus mempertahankan adegan, pencahayaan, dan nada video asli untuk mencapai penggantian karakter yang mulus. Wan - Video character replacement

Reasoning model

2025-11-03

qwen3-max-preview

Mode berpikir dari model qwen3-max-preview memberikan peningkatan signifikan dalam kemampuan penalaran keseluruhan, terutama menunjukkan kinerja superior dalam pemrograman agen, penalaran akal sehat, matematika, sains, dan tugas umum. Pemikiran mendalam

Image-to-video

2025-11-03

wan2.2-animate-move

Memindahkan gerakan dan ekspresi karakter dari video template ke gambar karakter statis tunggal untuk menghasilkan video karakter dalam gerak. Wan - Image-to-action

Image editing

2025-10-31

qwen-image-edit-plus, qwen-image-edit-plus-2025-10-30

Berdasarkan qwen-image-edit, model ini menawarkan kinerja inferensi dan stabilitas sistem yang dioptimalkan. Model ini secara besar-besaran mengurangi waktu respons untuk generasi dan pengeditan gambar, serta mendukung pengembalian beberapa gambar dalam satu permintaan. Pengeditan gambar - Qwen

Real-time speech recognition

2025-10-27

qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27

Model speech recognition real-time Qwen memiliki fitur deteksi bahasa otomatis. Model ini dapat mengenali 11 jenis bahasa dan mentranskripsi audio secara akurat di lingkungan kompleks. Real-time speech recognition - Qwen

Visual understanding

2025-10-21

qwen3-vl-32b-thinking, qwen3-vl-32b-instruct

Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial, pengenalan objek, deteksi visual 2D, dan penalaran spasial. Model ini cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video

Visual understanding

2025-10-16

qwen3-vl-flash, qwen3-vl-flash-2025-10-15

Model pemahaman visual berukuran kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open source Qwen3-VL-30B-A3B, model ini menunjukkan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video

Visual understanding

2025-10-14

qwen3-vl-8b-thinking, qwen3-vl-8b-instruct

Model dense 8B dari seri Qwen3-VL, tersedia dalam versi berpikir dan non-berpikir. Model ini menggunakan lebih sedikit memori GPU dan dapat melakukan pemahaman dan penalaran multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, posisi visual 2D/3D, serta kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video

Visual understanding

2025-10-03

qwen3-vl-30b-a3b-thinking, qwen3-vl-30b-a3b-instruct

Berdasarkan model open source Qwen3-VL generasi baru, model ini tersedia dalam versi berpikir dan non-berpikir. Model ini memiliki waktu respons cepat dan kemampuan yang lebih kuat untuk pemahaman multimodal, penalaran, dan tugas agen visual. Model ini juga mendukung konteks ultra-panjang seperti video dan dokumen. Kemampuan kecerdasan spasial dan pengenalan objeknya sepenuhnya ditingkatkan untuk menangani tugas dunia nyata yang kompleks. Pemahaman gambar dan video

Reasoning model

2025-09-30

deepseek-v3.2-exp

Model arsitektur inferensi hibrida yang mendukung mode berpikir dan non-berpikir. Model ini memperkenalkan mekanisme perhatian jarang untuk meningkatkan efisiensi pelatihan dan inferensi untuk teks panjang. Model ini memiliki harga lebih rendah dibandingkan deepseek-v3.1. Lihat DeepSeek - Alibaba Cloud.

Text-to-image

2025-09-23

qwen-image-plus

Model ini unggul dalam rendering teks kompleks, terutama Tiongkok dan Inggris. Model ini dapat membuat tata letak multimedia kompleks dari gambar dan teks. Model ini lebih hemat biaya dibandingkan qwen-image. Text-to-image (Qwen-Image)

Visual understanding

2025-09-23

qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct

Seri model pemahaman visual Qwen3 secara efektif menggabungkan mode berpikir dan non-berpikir, dan kemampuan agen visualnya bersifat kelas dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Persepsi dan pengenalan visualnya secara signifikan ditingkatkan. Pemahaman gambar dan video

Code model

2025-09-23

qwen3-coder-plus-2025-09-23

Dibandingkan versi sebelumnya (snapshot 22 Juli), versi ini memiliki ketahanan yang lebih baik untuk tugas turunan dan tool calling, serta keamanan kode yang ditingkatkan. Kemampuan kode (Qwen-Coder)

Reasoning model

2025-09-11

qwen-plus-2025-09-11

Model ini merupakan bagian dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini mengikuti instruksi lebih baik dan memberikan ringkasan yang lebih ringkas dalam mode berpikir. Lihat Deep thinking. Dalam mode non-thinking, model ini memiliki peningkatan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks.

Reasoning model

2025-09-11

qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct

Generasi baru model open source berbasis Qwen3. Model berpikir memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan ringkasan yang lebih ringkas dibandingkan qwen3-235b-a22b-thinking-2507. Lihat Deep thinking. Model instruct memiliki peningkatan kemampuan pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks dibandingkan qwen3-235b-a22b-instruct-2507. Lihat Ikhtisar generasi teks.

Text generation

2025-09-05

qwen3-max-preview

Model pratinjau Qwen-Max, dibangun di atas Qwen3, menawarkan peningkatan signifikan dalam kemampuan umum dibandingkan seri Qwen 2.5. Model ini menunjukkan peningkatan besar dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, tugas subjektif terbuka, tugas multibahasa, dan tool calling. Model ini juga cenderung menghasilkan halusinasi pengetahuan yang lebih sedikit.

Text, image, video, voice, etc.

2025-08-05

Models

Ini adalah rilis pertama di wilayah Beijing.

Tiongkok (Hong Kong)

Saat cakupan penerapan layanan adalah Tiongkok (Hong Kong), penyimpanan data berada di wilayah akses Tiongkok (Hong Kong). Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok (Hong Kong).

Type

Waktu

Model

Deskripsi

Reasoning model

2026-03-17

qwen3-max, qwen3-max-2026-01-23

Dibandingkan snapshot 23 September 2025, model ini lebih mengintegrasikan mode berpikir dan non-berpikir untuk peningkatan kinerja keseluruhan yang signifikan.

Reasoning model

2026-03-17

qwen-plus, qwen-plus-2025-12-01

Model ini merupakan bagian dari seri Qwen3 dan merupakan peningkatan dari qwen-plus-2025-07-28. Dalam mode berpikir, model ini mengikuti instruksi lebih baik dan memberikan ringkasan yang lebih ringkas. Lihat Deep thinking. Dalam mode non-berpikir, pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks.

Reasoning model

2026-03-17

qwen3.5-flash, qwen3.5-flash-2026-02-23

Ini adalah model open source terbaru dari Alibaba, Qwen3.5-Flash. Model ini mendukung input teks, gambar, dan video, memberikan respons cepat. Lihat Ikhtisar generasi teks.

Visual understanding

2026-03-17

qwen3-vl-plus, qwen3-vl-plus-2025-12-19

Model pemahaman visual seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini mencakup peningkatan komprehensif terhadap pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini menampilkan peningkatan signifikan dalam persepsi dan pengenalan visual, pengikutan instruksi yang lebih baik, dan latensi lebih rendah. Lihat Pemahaman gambar dan video.

Uni Eropa

Saat cakupan penerapan layanan adalah Uni Eropa, penyimpanan data berada di wilayah akses Jerman (Frankfurt). Sumber daya komputasi inferensi model dibatasi hanya untuk Uni Eropa.

Type

Waktu

Model

Deskripsi fitur

Reasoning model

2026-03-20

qwen3-max, qwen3-max-2026-01-23

Dibandingkan snapshot 23 September 2025, model ini mengintegrasikan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan secara signifikan.

Reasoning model

2026-03-20

qwen-plus, qwen-plus-2025-12-01

Ini adalah model seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini menawarkan pengikutan instruksi yang lebih baik dalam mode berpikir dan memberikan respons ringkasan yang lebih ringkas. Lihat Deep thinking. Dalam mode non-berpikir, pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks.

Reasoning model

2026-03-20

qwen3.5-flash, qwen3.5-flash-2026-02-23

Qwen3.5-Flash adalah model open source terbaru dari Alibaba. Model ini mendukung input teks, gambar, dan video serta memberikan respons cepat. Lihat Ikhtisar generasi teks.

Visual understanding

2026-03-20

qwen3-vl-plus, qwen3-vl-flash, qwen3-vl-flash-2025-10-15

Model pemahaman visual seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Kemampuan agen visualnya bersifat kelas dunia. Versi ini mencakup peningkatan utama dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini menampilkan peningkatan besar dalam persepsi dan pengenalan visual, pengikutan instruksi yang lebih baik, dan latensi lebih rendah. Lihat Pemahaman gambar dan video.

Code capability

2026-03-20

qwen3-coder-next

Ini adalah model generasi kode open source generasi baru dari seri Qwen3. Model ini mendukung interaksi alat multi-turn. Model ini juga memiliki peningkatan pemahaman kode tingkat repositori dan kompatibilitas yang lebih baik dengan alat pemrograman AI. Lihat Code capability (Qwen-Coder).