Tabel berikut mencantumkan rilis model . Untuk aturan dan daftar depresiasi model , lihat Kebijakan depresiasi .
Global
Saat cakupan penerapan layanan adalah Global, penyimpanan data berada di wilayah akses Amerika Serikat (Virginia)atau Jerman (Frankfurt). Sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia.
Type | Waktu | Model | Deskripsi |
|---|---|---|---|
Reasoning model | 2026-04-02 | qwen3.6-plus, qwen3.6-plus-2026-04-02 | Qwen3.6-Plus menampilkan peningkatan signifikan pada kemampuan pengembangan kode, seperti Agentic Coding dan pemrograman frontend, serta menyediakan pengalaman Vibe Coding yang jauh lebih baik. Kemampuan inferensinya dalam skenario generalisasi semakin ditingkatkan. Untuk kemampuan multimodal, kinerjanya dalam pengenalan objek universal, OCR, dan lokalisasi objek ditingkatkan secara signifikan. Versi ini juga memperbaiki masalah yang diketahui setelah rilis Qwen3.5-Plus. Metode penggunaannya sama dengan qwen3.5-plus. Ikhtisar generasi teks |
Reasoning model | 2026-03-04 | qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b | Model-model terbaru dari Alibaba, Qwen3.5-Flash dan model open-source lainnya, mendukung input teks, gambar, dan video. Model-model ini memberikan respons cepat, kinerja keseluruhan yang mendekati Qwen3.5-plus, dan mendukung tool calling bawaan. Ikhtisar generasi teks |
Reasoning model | 2026-03-04 | qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b | Model terbaru Alibaba, Qwen3.5-Plus, dan model open-source lainnya mendukung input teks, gambar, dan video. Model-model ini unggul dalam berbagai tugas, seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan tugas antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks |
Image generation and editing | 2026-01-04 | wan2.6-image | Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - image generation and editing 2.6 |
Image-to-video - first frame | 2026-01-04 | wan2.6-i2v | Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - image-to-video - first frame-based |
Reference video | 2026-01-04 | wan2.6-r2v | Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Fitur ini juga mendukung dubbing otomatis. Wan - reference-to-video |
Text-to-video | 2026-01-04 | wan2.6-t2v | Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - text-to-video |
Visual understanding | 2026-01-04 | qwen3-vl-flash, qwen3-vl-flash-2025-10-15 | Model pemahaman visual berukuran kecil dari seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Dibandingkan Qwen3-VL-30B-A3B open-source, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video |
Visual understanding | 2026-01-04 | qwen3-vl-8b-thinking, qwen3-vl-8b-instruct | Model dense open-source 8B dari seri Qwen3-VL, tersedia dalam versi berpikir dan non-berpikir. Model ini menggunakan lebih sedikit memori GPU dan melakukan pemahaman dan inferensi multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, posisi visual 2D/3D, serta kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video |
Visual understanding | 2026-01-04 | qwen3-vl-32b-thinking, qwen3-vl-32b-instruct | Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial, pengenalan objek, deteksi visual 2D, dan penalaran spasial. Hal ini membuatnya cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video |
Visual understanding | 2026-01-04 | qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct | Model pemahaman visual dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir, serta kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini juga secara signifikan meningkatkan kemampuan persepsi dan pengenalan visual. Pemahaman gambar dan video |
Reasoning model | 2026-01-04 | qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct | Generasi baru model open-source berbasis Qwen3. Model `thinking` memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan respons ringkasan yang lebih ringkas dibandingkan `qwen3-235b-a22b-thinking-2507`. Lihat Pemikiran mendalam. Model `instruct` memiliki peningkatan kemampuan pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks dibandingkan `qwen3-235b-a22b-instruct-2507`. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen3-max, qwen3-max-2025-09-23 | Dibandingkan versi qwen3-max-preview, model ini telah secara khusus ditingkatkan untuk pemrograman agen dan tool calling. Rilis resmi ini mencapai kinerja mutakhir (SOTA) di bidangnya dan mendukung persyaratan agen yang lebih kompleks. |
Reasoning model | 2026-01-04 | qwen3-max-preview | Model Qwen-Max adalah versi pratinjau berbasis Qwen3. Dibandingkan seri Qwen 2.5, kemampuan tujuan umumnya sangat meningkat, memberikan peningkatan signifikan dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, tugas subjektif terbuka, pemrosesan multibahasa, dan tool calling. Model ini juga menghasilkan halusinasi pengetahuan yang lebih sedikit. Qwen-Max |
Code model | 2026-01-04 | qwen3-coder-flash, qwen3-coder-flash-2025-07-28 | Model tercepat dan paling hemat biaya dalam seri Qwen-Coder. Kemampuan kode (Qwen-Coder). |
Code model | 2026-01-04 | qwen3-coder-plus, qwen3-coder-plus-2025-07-22, qwen3-coder-30b-a3b-instruct, qwen3-coder-480b-a35b-instruct | Model generasi kode berbasis Qwen3. Model ini memiliki kemampuan Coding Agent yang kuat dan unggul dalam tool calling dan interaksi lingkungan. Model ini menggabungkan keterampilan kode yang luar biasa dengan kemampuan tujuan umum. Kemampuan kode (Qwen-Coder) |
Reasoning model | 2026-01-04 | qwen3-30b-a3b-thinking-2507, qwen3-30b-a3b-instruct-2507 | Versi peningkatan dari qwen3-30b-a3b. Model berpikir memiliki peningkatan dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen3-235b-a22b-thinking-2507, qwen3-235b-a22b-instruct-2507 | Versi peningkatan dari qwen3-235b-a22b. Model berpikir memiliki peningkatan besar dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas, sehingga cocok untuk skenario inferensi intensif tingkat tinggi. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen3-30b-a3b, qwen3-32b, qwen3-14b, qwen3-8b | Model Qwen3 mendukung mode berpikir dan non-berpikir. Anda dapat beralih antara dua mode tersebut menggunakan parameter
Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks. |
Text extraction | 2026-01-04 | qwen-vl-ocr-2025-11-20 | Versi snapshot model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks (Qwen-OCR) |
Text extraction | 2026-01-04 | qwen-vl-ocr | qwen-vl-ocr adalah model yang dioptimalkan untuk OCR dan secara signifikan meningkatkan ekstraksi teks dari gambar, seperti tabel dan lembar ujian. Lihat Ekstraksi teks. |
Reasoning model | 2026-01-04 | qwen-plus-2025-12-01, qwen-plus-2025-09-11 | Model dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan ringkasan yang lebih ringkas dalam mode berpikir. Lihat Pemikiran mendalam. Dalam mode non-berpikir, model ini memiliki peningkatan kemampuan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen-plus-2025-07-28 | Model dari seri Qwen3. Dibandingkan versi sebelumnya, model ini meningkatkan panjang konteks menjadi 1.000.000. Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen-plus | Menawarkan keseimbangan kemampuan. Kinerja inferensinya, biaya, dan kecepatannya berada di antara Qwen-Max dan Qwen-Flash, sehingga cocok untuk tugas dengan tingkat kompleksitas sedang. |
Multilingual translation | 2026-01-04 | qwen-mt-lite | Model terjemahan teks dasar dari Qwen. Model ini mendukung terjemahan antara 31 bahasa. Model ini menawarkan respons lebih cepat dan biaya lebih rendah dibandingkan qwen-mt-flash, sehingga cocok untuk skenario yang sensitif terhadap latensi. Kemampuan terjemahan (Qwen-MT) |
Multilingual translation | 2026-01-04 | qwen-mt-plus, qwen-mt-flash | Model Qwen-MT adalah model bahasa besar untuk terjemahan mesin yang dioptimalkan dari model Qwen. Model ini unggul dalam terjemahan antara Tiongkok dan Inggris, antara Tiongkok dan bahasa minoritas, serta antara Inggris dan bahasa minoritas. Model ini mendukung 26 bahasa minoritas, seperti Jepang, Korea, Prancis, Spanyol, Jerman, Portugis (Brasil), Thailand, Indonesia, Vietnam, dan Arab. Selain terjemahan multibahasa, model ini menyediakan fitur seperti intervensi terminologi, prompting domain, dan memori terjemahan untuk meningkatkan kualitas terjemahan dalam skenario kompleks. Lihat Kemampuan terjemahan (Qwen-MT). |
Text-to-text | 2026-01-04 | qwen-flash, qwen-flash-2025-07-28 | Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana. |
Internasional
Saat cakupan penerapan layanan adalah Internasional, penyimpanan data berada di wilayah akses Singapura. Sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan.
Type | Waktu | Model | Deskripsi |
|---|---|---|---|
Video editing | 2026-04-03 | wan2.7-videoedit | Model Wan 2.7-Video Editing mendukung tugas editing berbasis instruksi dan migrasi video. Model ini memodifikasi bagian video atau seluruh video, mendukung penggantian konten menggunakan beberapa gambar referensi, dan mereplikasi gerakan, efek, serta pergerakan kamera. Lihat Wan-Video Editing 2.7. |
Image to video | 2026-04-03 | wan2.7-i2v | Model image-to-video Wan 2.7 mendukung input multimodal (teks, gambar, audio, dan video) untuk tiga tugas utama: pembuatan video frame pertama, pembuatan video frame awal-dan-akhir, dan kelanjutan video. Wan-Image-to-Video 2.7 |
Text-to-Video | 2026-04-03 | wan2.7-t2v | Model text-to-video Wan 2.7 menambahkan opsi resolusi baru dan pengaturan rasio aspek kustom agar dapat beradaptasi fleksibel terhadap berbagai skenario kreasi dan kebutuhan penerbitan platform. Wan text-to-video |
reference-to-video | 2026-04-03 | wan2.7-r2v | Model reference-to-video Wan 2.7 mendukung referensi entitas dan kustomisasi suara. Model ini juga menghasilkan video berbasis naskah langsung dari storyboard multi-panel tunggal. Wan - Reference-to-video |
Reasoning model | 2026-04-02 | qwen3.6-plus, qwen3.6-plus-2026-04-02 | Qwen-3.6-Plus menawarkan peningkatan signifikan pada kemampuan pengembangan kode, seperti Agentic Coding dan pemrograman frontend, serta meningkatkan pengalaman Vibe Coding. Kemampuan inferensi model dalam skenario umum semakin ditingkatkan. Kemampuan multimodal juga ditingkatkan secara signifikan, termasuk pengenalan objek universal, Optical Character Recognition (OCR), dan lokalisasi objek. Versi ini juga memperbaiki masalah yang diketahui dari rilis Qwen-3.5-Plus. Penggunaannya sama dengan Qwen-3.5-Plus. Lihat Ikhtisar generasi teks. |
Image generation and editing | 2026-04-01 | wan2.7-image-pro, wan2.7-image | Model generasi dan pengeditan gambar Wan 2.7 mendukung teks-ke-gambar, generasi grup teks-ke-gambar, generasi grup gambar-ke-gambar, pengeditan gambar, generasi referensi multi-gambar, dan pengeditan interaktif. Model ini unggul dalam rendering teks, konsistensi entitas, dan mengikuti instruksi kompleks. Seri Pro mendukung output 4K. Versi akselerasi menyeimbangkan kualitas dan kecepatan respons. Wan - image generation and editing 2.7 |
Omni-modal | 2026-03-30 | qwen3.5-omni-plus, qwen3.5-omni-plus-2026-03-15, qwen3.5-omni-flash, qwen3.5-omni-flash-2026-03-15 | Model omni-modal terbaru mendukung analisis video panjang, notulen rapat, output takarir, moderasi konten, dan interaksi audio-video. Model ini mendukung pemahaman mendalam dan pembuatan deskripsi untuk konten audio dan video, mendeteksi 113 bahasa, dan menghasilkan audio dalam 36 bahasa. Model ini dapat memproses input audio hingga 3 jam dan video hingga 1 jam. Model ini juga mendukung pencarian web dan instruksi untuk mengontrol volume, kecepatan, dan emosi output audio. Non-real-time (Qwen-Omni) |
Omni-modal | 2026-03-30 | qwen3.5-omni-plus-realtime, qwen3.5-omni-plus-realtime-2026-03-15, qwen3.5-omni-flash-realtime, qwen3.5-omni-flash-realtime-2026-03-15 | Model multimodal real-time terbaru dari Qwen. Dibandingkan generasi sebelumnya Qwen3-Omni-Flash-Realtime, model ini menampilkan peningkatan kecerdasan yang signifikan dan setara dengan Qwen3.5-Plus. Model ini secara native mendukung pencarian web (WebSearch), interupsi suara, dan kontrol suara. Model ini mengenali 113 bahasa dan dialek, serta menghasilkan ucapan dalam 36 bahasa dan dialek. Real-time (Qwen-Omni-Realtime) |
Reasoning model | 2026-03-20 | deepseek-v3.2 | DeepSeek-V3.2 adalah model resmi yang memperkenalkan DeepSeek Sparse Attention, yaitu mekanisme perhatian jarang. Ini adalah model DeepSeek pertama yang mengintegrasikan berpikir dengan tool calling. Model ini mendukung tool calling dalam mode berpikir maupun non-berpikir. |
Image generation and editing | 2026-03-03 | qwen-image-2.0, qwen-image-2.0-2026-03-03, qwen-image-2.0-pro, qwen-image-2.0-pro-2026-03-03 | Seri Qwen-Image2.0 mendukung generasi dan pengeditan gambar. Seri Pro menawarkan kemampuan yang lebih kuat dalam rendering teks, tekstur realistis, dan pemahaman semantik. Versi akselerasi menyeimbangkan kinerja dengan kecepatan respons. Qwen-text-to-image, Qwen-Image Edit |
Speech recognition | 2026-03-03 | qwen3-asr-flash-2026-02-10 | Model snapshot baru untuk pengenalan file audio Qwen memberikan kinerja yang lebih baik dibandingkanqwen3-asr-flash-2025-09-08.Pengenalan file audio - Qwen |
Reasoning model | 2026-02-24 | qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b | Model-model terbaru dari Alibaba, Qwen-3.5-Flash dan model open source lainnya, mendukung input teks, gambar, dan video. Model-model ini memberikan respons cepat dan kinerja yang setara dengan Qwen-3.5-plus. Model-model ini juga mendukung tool calling bawaan. Lihat Ikhtisar model generasi teks. |
Code model | 2026-02-20 | qwen3-coder-next | Model generasi kode open-source baru dalam seri Qwen3. Model ini mendukung interaksi alat multi-turn untuk meningkatkan pemahaman kode tingkat repositori dan meningkatkan kompatibilitasnya dengan alat pemrograman AI. Kemampuan kode (Qwen-Coder) |
Reasoning model | 2026-02-16 | qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b | Model Qwen3.5-Plus dan model open-source terbaru dari Alibaba. Model-model ini menerima input teks, gambar, dan video serta memberikan kinerja luar biasa dalam berbagai tugas, seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks |
Speech recognition | 2026-02-13 | qwen3-asr-flash-realtime-2026-02-10 | Model snapshot baru untuk speech recognition real-time Qwen menunjukkan kinerja yang lebih baik dibandingkanqwen3-asr-flash-realtime-2025-10-27.Speech recognition real-time (Qwen) |
Speech synthesis | 2026-02-10 | cosyvoice-v3-plus, cosyvoice-v3-flash | Sintesis ucapan CosyVoice menambahkan model v3 yang mendukung sintesis ucapan dengan suara sistem dan suara hasil kloning. Sintesis ucapan real-time - CosyVoice/Sambert |
Speech synthesis | 2026-02-10 | qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26 | Sintesis ucapan Qwen memperkenalkan model kendali instruksi yang mendukung pengendalian presisi output sintesis melalui instruksi bahasa alami.Sintesis ucapan - Qwen |
Speech synthesis | 2026-02-10 | qwen3-tts-vd-2026-01-26 | Sintesis ucapan Qwen memperkenalkan model desain suara yang mendukung pembuatan suara kustom melalui deskripsi teks.Sintesis ucapan - Qwen |
Speech synthesis | 2026-02-10 | qwen3-tts-vc-2026-01-22 | Sintesis ucapan Qwen memperkenalkan model kloning suara yang dengan cepat mengkloning suara dari sampel audio asli.Sintesis ucapan - Qwen |
Speech synthesis | 2026-02-04 | qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22 | Sintesis ucapan real-time Qwen menambahkan model Instruct, yang mendukung pengendalian presisi atas hasil sintesis menggunakan instruksi bahasa alami. Sintesis ucapan real-time Qwen |
Reference-to-video | 2026-02-02 | wan2.6-r2v-flash | Hasilkan video multi-shot dengan dubbing otomatis, menggunakan penampilan karakter dari video referensi atau gambar. Wan - reference-to-video |
Visual understanding | 2026-01-28 | qwen3-vl-flash-2026-01-22 | Ini adalah snapshot baru dari model Qwen-VL. Model ini menggabungkan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan dibandingkan snapshot 15 Oktober 2025. Model ini mencapai akurasi inferensi yang lebih tinggi dalam skenario seperti pengenalan visual umum, keamanan, patroli toko, inspeksi, dan pemecahan masalah dari foto. Pemahaman gambar dan video |
Speech recognition | 2026-01-28 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 | Qwen3-ASR-Flash-Filetrans kini mendukung timestamp tingkat kata. Gunakan parameter baru |
Reasoning model | 2026-01-27 | qwen3-max-2026-01-23 | Dibandingkan snapshot 23 September 2025, model ini menggabungkan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan secara signifikan. Dalam mode berpikir, model mengintegrasikan tiga alat: pencarian web, ekstraktor web, dan interpreter kode. Dengan menggunakan alat eksternal selama proses berpikirnya, model ini mencapai akurasi yang lebih tinggi pada masalah kompleks. OpenAI-compatible - Respons |
Image-to-video | 2026-01-18 | wan2.6-i2v-flash | Menghasilkan video dengan atau tanpa audio. Kedua jenis video tersebut ditagih secara independen berdasarkan aturan penagihan masing-masing. Model ini juga memiliki kemampuan narasi multi-shot dan pemrosesan audio. Wan - Image-to-video - Berdasarkan frame pertama |
Image editing | 2026-01-18 | qwen-image-edit-max, qwen-image-edit-max-2026-01-16 | Seri Max Pengeditan Gambar Qwen menyediakan kemampuan pengeditan yang lebih stabil dan serbaguna, meningkatkan desain industri dan inferensi geometris, serta meningkatkan konsistensi karakter dan presisi pengeditan. Pengeditan gambar - Qwen |
Speech synthesis | 2026-01-16 | qwen3-tts-vc-realtime-2026-01-15 | Sintesis ucapan real-time Qwen telah merilis model snapshot baru yang lebih mengoptimalkan efek kloning suara Qwen. Suara yang disintesis lebih alami dan lebih dekat dengan suara asli dibandingkan qwen3-tts-vc-realtime-2025-11-27. Sintesis ucapan real-time - Qwen |
Text-to-image | 2026-01-12 | qwen-image-plus-2026-01-09 | Model snapshot baru untuk generasi teks-ke-gambar Qwen, yaitu versi distilasi dan akselerasi dari qwen-image-max yang menghasilkan gambar berkualitas tinggi secara cepat. Qwen-text-to-image |
Image-to-video | 2026-01-08 | wan2.2-kf2v-flash | Model ini menghasilkan video dinamis yang mulus dan lancar dari gambar frame pertama dan terakhir berdasarkan prompt. Image-to-video: First and last frames |
Speech recognition | 2026-01-06 | qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Qwen3-ASR-Flash mendukung mode kompatibel OpenAI. Mengenali file audio menggunakan Qwen |
Text-to-image | 2025-12-31 | qwen-image-max, qwen-image-max-2025-12-30 | Seri Max model teks-ke-gambar Qwen menawarkan realisme dan kealamian yang lebih tinggi dibandingkan seri Plus. Model ini secara efektif mengurangi artefak hasil generasi AI dan unggul dalam aspek seperti tekstur tokoh manusia, detail tekstur, dan rendering teks. Qwen - text-to-image |
Image editing | 2025-12-23 | qwen-image-edit-plus-2025-12-15 | Model snapshot terbaru untuk Pengeditan Gambar Qwen meningkatkan konsistensi karakter, kemampuan desain industri, dan inferensi geometris dibandingkan versi sebelumnya. Model ini juga mengoptimalkan kecocokan dalam tata letak spasial, tekstur, dan gaya antara gambar yang diedit dan gambar asli, menghasilkan pengeditan yang lebih presisi. Pengeditan gambar - Qwen |
Text-to-image | 2025-12-22 | z-image-turbo | Model text-to-image ringan yang dengan cepat menghasilkan gambar berkualitas tinggi. Model ini mendukung rendering bilingual dalam bahasa Tiongkok dan Inggris, pemahaman semantik kompleks, berbagai gaya dan tema, serta beradaptasi fleksibel terhadap berbagai resolusi dan rasio aspek. Z-Image |
Visual understanding | 2025-12-19 | qwen3-vl-plus-2025-12-19 | Model snapshot baru Qwen-VL ini menampilkan peningkatan kemampuan mengikuti instruksi dan latensi lebih rendah. Pemahaman gambar dan video |
Speech recognition | 2025-12-19 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17, qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Menambahkan dukungan untuk pengenalan ucapan dalam 9 bahasa lagi, termasuk Ceko dan Denmark. Pengenalan file audio - Qwen |
Speech recognition | 2025-12-17 | qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27 | Pengenalan ucapan kini mendukung sembilan bahasa tambahan, termasuk Ceko dan Denmark. Speech recognition real-time (Qwen) |
Speech recognition | 2025-12-17 | qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Mendukung audio dengan laju sampel dan saluran suara apa pun. Pengenalan file audio - Qwen |
Speech recognition | 2025-12-17 | fun-asr-mtl, fun-asr-mtl-2025-08-25 | Mendukung pengenalan ucapan dalam 31 bahasa, termasuk Tiongkok, Inggris, Jepang, dan Korea. Fitur ini ideal untuk skenario Asia Tenggara. Pengenalan file audio - Fun-ASR/Paraformer/SenseVoice |
Voice design | 2025-12-16 | qwen-voice-design | Qwen telah merilis model desain suara untuk menghasilkan suara kustom dari deskripsi teks. Gunakan model ini bersama model qwen3-tts-vd-realtime-2025-12-16 untuk menghasilkan ucapan dalam 10 bahasa. Desain suara Qwen |
Speech synthesis | 2025-12-16 | qwen3-tts-vd-realtime-2025-12-16 (snapshot) | Model snapshot baru untuk sintesis ucapan real-time Qwen menggunakan suara dari desain suara Qwen untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa, secara otomatis menyesuaikan nada berdasarkan teks, serta mengoptimalkan sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen |
Text-to-image | 2025-12-16 | wan2.6-t2i | Antarmuka sinkron baru ditambahkan. Antarmuka ini mendukung pemilihan dimensi kustom dalam batasan luas piksel total dan rasio aspek. Wan - text-to-image V2 |
Image generation and editing | 2025-12-16 | wan2.6-image | Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - Image generation and editing 2.6 |
Image-to-video based on the first frame | 2025-12-16 | wan2.6-i2v | Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Wan - image-to-video - first frame |
reference-to-video | 2025-12-16 | wan2.6-r2v | Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Mendukung dubbing otomatis. Wan - reference-to-video |
Text-to-video | 2025-12-16 | wan2.6-t2v | Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Text-to-video |
Speech recognition | 2025-12-12 | fun-asr, fun-asr-2025-11-07 | Pembaruan fitur untuk pengenalan file audio Fun-ASR:
|
Omni-modal | 2025-12-04 | qwen3-omni-flash-2025-12-01 | Model snapshot terbaru Qwen Omni meningkatkan jumlah timbre yang didukung menjadi 49 dan menampilkan peningkatan signifikan pada kemampuan mengikuti instruksi, memungkinkannya memahami teks, gambar, audio, dan video secara efisien. Non-real-time (Qwen-Omni) |
Real-time multimodal | 2025-12-04 | qwen3-omni-flash-realtime-2025-12-01 | Model snapshot terbaru untuk versi real-time Qwen-Omni menawarkan interaksi multimodal berlatensi rendah. Versi ini meningkatkan jumlah timbre yang didukung menjadi 49 dan secara signifikan meningkatkan kemampuan mengikuti instruksi serta pengalaman interaktif model. Real-time (Qwen-Omni-Realtime) |
Speech translation | 2025-12-04 | qwen3-livetranslate-flash, qwen3-livetranslate-flash-2025-12-01 | Qwen3-LiveTranslate-Flash adalah model terjemahan audio dan video yang menerjemahkan antara 18 bahasa, seperti Tiongkok, Inggris, Rusia, dan Prancis. Model ini memanfaatkan konteks visual untuk meningkatkan akurasi terjemahan dan menyediakan output teks maupun ucapan. Terjemahan file audio dan video (Qwen) |
Multilingual translation | 2025-12-02 | qwen-mt-lite | Model terjemahan teks dasar dari Qwen. Model ini mendukung terjemahan antara 31 bahasa. Model ini menawarkan waktu respons lebih cepat dan biaya lebih rendah dibandingkan qwen-mt-flash, sehingga cocok untuk skenario yang sensitif terhadap latensi. Mesin terjemahan (Qwen-MT) |
Voice cloning | 2025-11-27 | qwen-voice-enrollment | Qwen merilis model kloning suara. Model ini menghasilkan suara yang sangat mirip dari audio selama lebih dari 5 detik. Ketika digunakan bersama model qwen3-tts-vc-realtime-2025-11-27, model ini dapat membuat klon suara seseorang dengan fidelitas tinggi dan mengeluarkannya secara real time dalam 11 bahasa. Kloning suara Qwen |
Speech synthesis | 2025-11-27 | qwen3-tts-vc-realtime-2025-11-27 (snapshot) | Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menggunakan suara yang dihasilkan oleh kloning suara Qwen untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa. Model ini dapat secara otomatis menyesuaikan nadanya berdasarkan teks dan mengoptimalkan kinerja sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen |
Speech synthesis | 2025-11-27 | qwen3-tts-flash-realtime-2025-11-27 (snapshot) | Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menampilkan latensi rendah dan stabilitas tinggi. Model ini menawarkan pilihan suara yang lebih kaya, dan setiap suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya berdasarkan teks dan meningkatkan kinerja sintesis untuk teks kompleks. Sintesis ucapan real-time - Qwen |
Speech synthesis | 2025-11-27 | qwen3-tts-flash-2025-11-27 (snapshot) | Sintesis ucapan Qwen merilis model snapshot baru. Model ini menawarkan pilihan suara yang lebih kaya. Setiap suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya berdasarkan teks dan mengoptimalkan sintesis untuk teks kompleks. Qwen text-to-speech (TTS) |
Text extraction | 2025-11-21 | qwen-vl-ocr-2025-11-20 (snapshot) | Versi snapshot dari model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks |
Speech recognition | 2025-11-20 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 (snapshot) | Pengenalan file audio Qwen merilis model baru. Model ini dirancang untuk transkripsi asinkron file audio dan mendukung rekaman hingga 12 jam. Pengenalan file audio - Qwen |
Speech recognition | 2025-11-19 | fun-asr-2025-11-07 (snapshot) | Model snapshot baru tersedia untuk pengenalan file audio Fun-ASR. Model ini mengoptimalkan deteksi aktivitas suara jarak jauh (VAD) untuk meningkatkan akurasi dan stabilitas pengenalan. Selain Tiongkok dan Inggris, model ini kini mendukung beberapa dialek Tiongkok dan bahasa Jepang. Pengenalan file audio - Fun-ASR/Paraformer/SenseVoice |
Multilingual translation | 2025-11-11 | qwen-mt-flash | Dibandingkan qwen-mt-turbo, model ini mendukung output inkremental streaming dan menawarkan peningkatan kinerja keseluruhan. Kemampuan terjemahan (Qwen-MT) |
Image-to-video | 2025-11-10 | wan2.2-animate-move | Memindahkan gerakan dan ekspresi karakter dari video template ke gambar statis tunggal untuk menghasilkan video karakter dalam gerak. Wan - Image-to-action |
Image-to-video | 2025-11-10 | wan2.2-animate-mix | Model ini mengganti karakter utama dalam video referensi dengan karakter dari gambar. Model ini mempertahankan adegan, pencahayaan, dan nada video asli untuk mencapai penggantian karakter yang mulus. Wan - Video Character Swap |
Reasoning model | 2025-11-03 | qwen3-max-preview | Mode berpikir dari model qwen3-max-preview menampilkan peningkatan signifikan pada kemampuan inferensi keseluruhan. Model ini unggul khususnya dalam pemrograman agen, penalaran akal sehat, dan tugas terkait matematika, sains, dan tujuan umum. Pemikiran mendalam |
Image editing | 2025-10-31 | qwen-image-edit-plus, qwen-image-edit-plus-2025-10-30 | Dibangun di atas qwen-image-edit, model ini memiliki kinerja inferensi dan stabilitas sistem yang dioptimalkan. Model ini secara signifikan mengurangi waktu respons untuk generasi dan pengeditan gambar serta mendukung pengembalian beberapa gambar dalam satu permintaan. Pengeditan gambar - Qwen |
Real-time speech recognition | 2025-10-27 | qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27 | Model speech recognition real-time Qwen memiliki fitur deteksi bahasa otomatis. Model ini dapat mendeteksi 11 jenis bahasa dan memberikan transkripsi akurat di lingkungan audio kompleks. Speech recognition real-time (Qwen) |
Visual understanding | 2025-10-21 | qwen3-vl-32b-thinking, qwen3-vl-32b-instruct | Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial dan pengenalan objek, serta deteksi visual 2D dan penalaran spasial. Hal ini membuatnya cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video |
Visual understanding | 2025-10-16 | qwen3-vl-flash, qwen3-vl-flash-2025-10-15 | Model pemahaman visual skala kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open-source Qwen3-VL-30B-A3B, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video |
Visual understanding | 2025-10-14 | qwen3-vl-8b-thinking, qwen3-vl-8b-instruct | Model dense 8B dari seri Qwen3-VL. Model ini menggunakan lebih sedikit memori GPU dan melakukan pemahaman dan inferensi multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, serta posisi visual 2D/3D. Model ini juga menampilkan kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video |
Visual understanding | 2025-10-03 | qwen3-vl-30b-a3b-thinking, qwen3-vl-30b-a3b-instruct | Berdasarkan model open-source Qwen3-VL generasi baru, model ini merespons dengan cepat dan menampilkan pemahaman, inferensi, kemampuan agen visual, serta dukungan konteks ultra-panjang untuk video dan dokumen panjang yang lebih kuat. Model ini juga menyediakan peningkatan komprehensif pada kecerdasan spasial dan pengenalan objek untuk menangani tugas dunia nyata yang kompleks. Pemahaman gambar dan video |
Visual understanding | 2025-09-23 | qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct | Model pemahaman visual Qwen3 secara efektif menggabungkan mode berpikir dan non-berpikir, dan kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini juga secara signifikan meningkatkan kemampuan persepsi dan deteksi visual. Pemahaman gambar dan video |
Text-to-image | 2025-09-23 | qwen-image-plus | Model ini unggul dalam rendering teks kompleks, terutama untuk teks Tiongkok dan Inggris. Model ini dapat membuat tata letak kompleks yang menggabungkan gambar dan teks. Model ini juga lebih hemat biaya dibandingkan qwen-image. Qwen - text-to-image |
Code model | 2025-09-23 | qwen3-coder-plus-2025-09-23 | Dibandingkan versi sebelumnya (snapshot 22 Juli), model ini memiliki peningkatan kinerja pada tugas turunan dan ketahanan tool calling yang lebih besar. Model ini juga menampilkan peningkatan keamanan kode. Kemampuan kode (Qwen-Coder) |
Reasoning model | 2025-09-11 | qwen-plus-2025-09-11 | Model ini merupakan bagian dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini menawarkan peningkatan dalam mengikuti instruksi dan menghasilkan ringkasan yang lebih ringkas dalam mode berpikir. Lihat pemikiran mendalam. Dalam mode non-berpikir, model ini memiliki peningkatan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks. |
Reasoning model | 2025-09-11 | qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct | Ini adalah model open source generasi baru berbasis Qwen3. Model berpikir merupakan peningkatan dari qwen3-235b-a22b-thinking-2507. Model ini menawarkan kemampuan mengikuti instruksi yang lebih baik dan respons ringkasan yang lebih ringkas. Lihat pemikiran mendalam. Model instruct merupakan peningkatan dari qwen3-235b-a22b-instruct-2507. Model ini menampilkan peningkatan kemampuan dalam pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks. Lihat Ikhtisar model generasi teks. |
Text-to-text | 2025-09-05 | qwen3-max-preview | Qwen-Max adalah model pratinjau berbasis Qwen3. Model ini menawarkan peningkatan signifikan dalam kemampuan umum dibandingkan seri Qwen 2.5. Model ini menunjukkan peningkatan besar dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, dan menangani tugas subjektif terbuka. Kemampuan multibahasanya dan tool calling-nya juga lebih kuat. Model ini cenderung menghasilkan halusinasi pengetahuan yang lebih sedikit. Qwen-Max |
Image editing | 2025-08-19 | qwen-image-edit | Model pengeditan gambar Qwen mendukung pengeditan teks presisi dalam bahasa Tiongkok dan Inggris, penyesuaian warna, peningkatan detail, transfer gaya, menambah atau menghapus objek, serta mengubah posisi dan tindakan. Model ini dapat melakukan pengeditan gambar dan teks yang kompleks. Pengeditan gambar - Qwen |
Visual understanding | 2025-08-18 | qwen-vl-plus-2025-08-15 | Model pemahaman visual. Model ini menawarkan peningkatan signifikan dalam deteksi objek, lokalisasi, dan pemrosesan multibahasa. Pemahaman gambar dan video |
Text-to-image | 2025-08-14 | qwen-image | Model Qwen-Image unggul dalam rendering teks kompleks, terutama Tiongkok dan Inggris, untuk membuat tata letak rumit yang menggabungkan gambar dan teks.Text-to-image (Qwen-Image) |
Visual understanding | 2025-08-13 | qwen-vl-max-2025-08-13 | Model pemahaman visual. Model ini menunjukkan peningkatan metrik pemahaman visual secara komprehensif dan peningkatan signifikan dalam matematika, penalaran, pengenalan objek, dan pemrosesan multibahasa. Pemahaman gambar dan video |
Code model | 2025-08-05 | qwen3-coder-flash, qwen3-coder-flash-2025-07-28 | Model tercepat dan paling hemat biaya dalam seri Qwen-Coder. Kemampuan kode (Qwen-Coder). |
Reasoning model | 2025-08-05 | qwen-flash, qwen-flash-2025-07-28 | Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana. |
Reasoning model | 2025-07-30 | qwen-plus-2025-07-28 | Model dari seri Qwen3. Dibandingkan versi sebelumnya, model ini meningkatkan panjang konteks menjadi 1.000.000. Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks. |
Reasoning model | 2025-07-30 | qwen3-30b-a3b-thinking-2507 qwen3-30b-a3b-instruct-2507 | Versi peningkatan dari qwen3-30b-a3b. Model berpikir memiliki peningkatan dalam kemampuan logis, umum, peningkatan pengetahuan, dan kreatif. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks. |
Image-to-video | 2025-07-28 | wan2.2-i2v-plus | Dibandingkan model 2.1, versi baru ini secara signifikan meningkatkan detail gambar dan stabilitas gerakan. Kecepatan generasi meningkat hingga 50%. First-frame video generation |
Text-to-video | 2025-07-28 | wan2.2-t2v-plus | Dibandingkan model 2.1, versi baru ini secara signifikan meningkatkan detail gambar dan stabilitas gerakan. Kecepatan generasi 50% lebih cepat. Text-to-video |
Text-to-image | 2025-07-28 | wan2.2-t2i-flash, wan2.2-t2i-plus | Versi baru ini merupakan peningkatan besar terhadap model 2.1. Model ini lebih kreatif, stabil, dan realistis. Gambar dihasilkan 50% lebih cepat. Text-to-image |
Reasoning model | 2025-07-24 | qwen3-235b-a22b-thinking-2507, qwen3-235b-a22b-instruct-2507 | Ini adalah peningkatan dari qwen3-235b-a22b. Model berpikir memiliki peningkatan besar dalam penalaran logis, kemampuan umum, peningkatan pengetahuan, dan kreativitas. Model ini ideal untuk skenario kompleks yang membutuhkan inferensi kuat. Lihat Pemikiran mendalam. Model instruct memiliki peningkatan kemampuan kreatif dan keamanan model. Lihat Ikhtisar generasi teks. |
Code model | 2025-07-23 | qwen3-coder, qwen3-coder-plus-2025-07-22 | Model generasi kode berbasis Qwen3. Model ini memiliki kemampuan Coding Agent yang kuat dan unggul dalam tool calling dan interaksi lingkungan. Model ini menggabungkan kemampuan kode yang luar biasa dengan kemampuan tujuan umum. Kemampuan kode (Qwen-Coder) |
Visual understanding | 2025-06-04 | qwen-vl-plus-2025-05-07 | Model pemahaman visual. Model ini memiliki peningkatan signifikan dalam matematika, penalaran, dan pemahaman konten dari video pengawasan. Pemahaman gambar dan video. |
Text-to-image | 2025-05-22 | wan2.1-t2i-turbo, wan2.1-t2i-plus | Menghasilkan gambar dari satu kalimat. Model ini menghasilkan gambar dengan resolusi dan rasio aspek apa pun, hingga 2 juta piksel. Model ini tersedia dalam dua versi: turbo dan plus. Text-to-image |
Visual understanding | 2025-05-16 | qwen-vl-max-2025-04-08 | Model pemahaman visual. Model ini memiliki peningkatan kemampuan matematika dan penalaran. Gaya respons disesuaikan agar selaras dengan preferensi manusia, dan responsnya jauh lebih detail dan diformat dengan jelas. Pemahaman gambar dan video |
Visual understanding | 2025-05-16 | qwen-vl-plus-2025-01-25 | Model pemahaman visual. Model ini termasuk dalam seri Qwen2.5-VL. Dibandingkan versi sebelumnya, model ini memperluas konteks hingga 128k dan secara signifikan meningkatkan pemahaman gambar dan video. |
Video editing | 2025-05-19 | wan2.1-vace-plus | Model pengeditan video tujuan umum. Model ini mendukung input multimodal, menggabungkan gambar, video, dan prompt teks. Model ini dapat melakukan berbagai tugas seperti image-to-video (menghasilkan video berdasarkan subjek atau latar belakang gambar referensi) dan video repainting (mengekstraksi fitur gerakan dari video input untuk menghasilkan video baru). Pengeditan video umum |
Reasoning model | 2025-04-28 | Model komersial Qwen3 qwen-plus-2025-04-28, qwen-turbo-2025-04-28 Model open-source Qwen3 qwen3-235b-a22b, qwen3-30b-a3b, qwen3-32b, qwen3-14b, qwen3-8b, qwen3-4b, qwen3-1.7b, qwen3-0.6b | Model Qwen3 mendukung mode berpikir dan non-berpikir. Beralih antara kedua mode tersebut menggunakan parameter
Untuk informasi lebih lanjut tentang mode berpikir, lihat Pemikiran mendalam. Untuk informasi lebih lanjut tentang mode non-berpikir, lihat Ikhtisar generasi teks. |
Text-to-video | 2025-04-21 | wan2.1-t2v-turbo, wan2.1-t2v-plus |
|
Image-to-video | 2025-04-21 | wan2.1-kf2v-plus, wan2.1-i2v-turbo, wan2.1-i2v-plus, |
|
Visual reasoning | 2025-03-28 | qvq-max, qvq-max-latest, qvq-max-2025-03-25 | Model penalaran visual. Model ini mendukung input visual dan output rantai-pikiran, menunjukkan kemampuan yang lebih kuat dalam matematika, pemrograman, analisis visual, kreasi, dan tugas umum. Penalaran visual |
Omni-modal | 2025-03-26 | qwen2.5-omni-7b | Model multimodal baru dari Qwen untuk pemahaman dan generasi. Model ini mendukung input teks, gambar, ucapan, dan video, serta menghasilkan teks dan audio. Model ini menyediakan dua suara percakapan alami. Non-real-time (Qwen-Omni). |
Visual understanding | 2025-03-24 | qwen2.5-vl-32b-instruct | Model pemahaman visual. Kemampuan menyelesaikan soal matematika mendekati tingkat Qwen2.5VL-72B. Gaya respons telah disesuaikan secara signifikan agar selaras dengan preferensi manusia. Model ini kini memberikan jawaban yang jauh lebih detail dan diformat dengan jelas, terutama untuk pertanyaan objektif dalam matematika, penalaran logis, dan tanya jawab pengetahuan. Pemahaman gambar dan video |
Reasoning model | 2025-03-06 | qwq-plus | Model penalaran QwQ, dilatih pada model Qwen2.5, sangat meningkatkan kemampuan penalaran melalui pembelajaran penguatan. Metrik inti model untuk matematika dan kode (AIME 24/25, LiveCodeBench) dan beberapa metrik umum (IFEval, LiveBench, dll.) mencapai tingkat DeepSeek-R1 berkinerja penuh. Pemikiran mendalam |
Visual understanding | 2025-01-27 | qwen2.5-vl-3b-instruct qwen2.5-vl-7b-instruct qwen2.5-vl-72b-instruct |
|
Text-to-text | 2025-01-27 | qwen-max-2025-01-25 qwen2.5-14b-instruct-1m qwen2.5-7b-instruct-1m |
|
Text-to-text | 2025-01-17 | qwen-plus-2025-01-12 |
|
Multilingual translation | 2024-12-25 | qwen-mt-plus qwen-mt-turbo |
|
Visual understanding | 2024-12-18 | qwen2-vl-72b-instruct |
|
Amerika Serikat
Saat cakupan penerapan layanan adalah Amerika Serikat, penyimpanan data berada di wilayah akses Amerika Serikat (Virginia). Sumber daya komputasi inferensi model dibatasi hanya untuk Amerika Serikat.
Type | Waktu | Model | Deskripsi |
|---|---|---|---|
Role play | 2026-08-30 |
| Seri Model Role-Playing Qwen dirancang khusus untuk skenario interaksi antropomorfis multi-bahasa. Model ini menunjukkan kemampuan lanjutan dalam pemeliharaan konsistensi karakter, perkembangan dialog berbasis konteks, dan keterlibatan empatik, memungkinkan perwujudan karakter personalisasi yang mendalam. |
Visual understanding | 2026-03-14 | qwen3-vl-flash-2026-01-22-us | Versi snapshot baru Qwen-VL ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Dibandingkan snapshot 15 Oktober 2025, model ini secara signifikan meningkatkan kinerja keseluruhan. Model ini mencapai inferensi akurasi lebih tinggi dalam skenario seperti pengenalan visual umum, keamanan, inspeksi toko, dan pemecahan masalah berbasis foto. Lihat Pemahaman gambar dan video. |
Image-to-video based on the first frame | 2026-01-04 | wan2.6-i2v-us | Model ini menambahkan fitur narasi multi-shot. Model ini mendukung audio melalui dubbing otomatis atau menggunakan file audio kustom. Lihat Wan - image-to-video - based on the first frame. |
Text-to-video | 2026-01-04 | wan2.6-t2v-us | Model ini menambahkan fitur narasi multi-shot. Model ini mendukung audio melalui dubbing otomatis atau menggunakan file audio kustom. Lihat Wan - text-to-video. |
Speech recognition | 2026-01-04 | qwen3-asr-flash-us, qwen3-asr-flash-2025-09-08-us | Mendukung audio dengan laju sampel dan saluran suara apa pun. Lihat Pengenalan file audio - Qwen. |
Visual understanding | 2026-01-04 | qwen3-vl-flash-us, qwen3-vl-flash-2025-10-15-us | Ini adalah model pemahaman visual skala kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open source Qwen3-VL-30B-A3B, model ini memberikan kinerja lebih baik dan waktu respons lebih cepat. Lihat Pemahaman gambar dan video. |
Reasoning model | 2026-01-04 | qwen-plus-2025-12-01-us | Ini adalah model dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan respons ringkasan yang lebih ringkas dalam mode berpikir. Lihat Pemikiran mendalam. Dalam mode non-berpikir, kemampuan pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-01-04 | qwen-plus-us | Menawarkan keseimbangan kemampuan. Kinerja inferensinya, biaya, dan kecepatannya berada di antara Qwen-Max dan Qwen-Flash, sehingga cocok untuk tugas dengan tingkat kompleksitas sedang. |
Text-to-text | 2026-01-04 | qwen-flash-us, qwen-flash-2025-07-28-us | Model tercepat dan paling hemat biaya dalam seri Qwen, cocok untuk tugas sederhana. |
Tiongkok daratan
Saat cakupan penerapan layanan adalah Tiongkok daratan, penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
Type | Waktu | Model | Deskripsi |
|---|---|---|---|
Video editing | 2026-04-03 | wan2.7-videoedit | Model video editing Wan 2.7 mendukung editing berbasis instruksi dan migrasi video. Model ini dapat memodifikasi bagian video atau seluruh frame, serta mendukung penggantian referensi multi-gambar dan replikasi gerakan, efek, serta pergerakan kamera. Wan2.7 - video editing |
Image-to-video | 2026-04-03 | wan2.7-i2v | Model image-to-video Wan 2.7 mendukung input multimodal, termasuk teks, gambar, audio, dan video. Model ini menjalankan tiga tugas utama: menghasilkan video dari frame pertama, menghasilkan video dari frame pertama dan terakhir, dan kelanjutan video. Wan2.7 - image-to-video |
Text-to-video | 2026-04-03 | wan2.7-t2v | Model text-to-video Wan 2.7 menambahkan tingkat resolusi baru dan pengaturan rasio aspek kustom. Ini memungkinkan adaptasi fleksibel untuk berbagai skenario kreatif dan kebutuhan penerbitan platform. Wan - text-to-video |
Reference-to-video | 2026-04-03 | wan2.7-r2v | Model reference-to-video Wan 2.7 mendukung referensi subjek dan kustomisasi suara. Model ini dapat menghasilkan video berbasis naskah langsung dari satu gambar storyboard multi-panel. Wan - reference-to-video |
Reasoning model | 2026-04-02 | qwen3.6-plus, qwen3.6-plus-2026-04-02 | Qwen3.6-Plus dengan peningkatan signifikan dalam kemampuan coding (Agentic Coding, pemrograman frontend, dll.) dan pengalaman Vibe Coding yang sangat ditingkatkan. Penalaran tujuan umum semakin ditingkatkan. Kemampuan multimodal termasuk pengenalan universal, OCR, dan lokalisasi objek ditingkatkan secara signifikan. Masalah yang diketahui dari rilis Qwen3.5-Plus juga diperbaiki. Penggunaan identik dengan qwen3.5-plus. Ikhtisar generasi teks |
Image generation and editing | 2026-04-01 | wan2.7-image-pro, wan2.7-image | Model generasi dan pengeditan gambar Wan 2.7 mendukung teks-ke-gambar, teks-ke-set-gambar, gambar-ke-set-gambar, pengeditan gambar, generasi dengan banyak referensi gambar, dan pengeditan interaktif, dengan peningkatan kinerja dalam rendering teks, konsistensi subjek, dan mengikuti instruksi kompleks. Seri Pro mendukung output 4K; versi akselerasi menyeimbangkan kualitas dan kecepatan respons. Wan - image generation and editing 2.7 |
Omni-modal | 2026-03-30 | qwen3.5-omni-plus, qwen3.5-omni-plus-2026-03-15, qwen3.5-omni-flash, qwen3.5-omni-flash-2026-03-15 | Model omni-modal terbaru. Model ini mendukung analisis video panjang, notulen rapat, output subtitle, audit keamanan, dan interaksi audio-video. Model ini juga mendukung pemahaman mendalam dan pembuatan deskripsi untuk konten audio dan video, mengenali 113 bahasa, dan menghasilkan audio dalam 36 bahasa. Model ini dapat memproses input audio hingga 3 jam dan video hingga 1 jam, serta mendukung pencarian web dan instruksi untuk mengontrol volume, kecepatan, dan emosi output audio. Non-real-time (Qwen-Omni) |
Omni-modal | 2026-03-30 | qwen3.5-omni-plus-realtime, qwen3.5-omni-plus-realtime-2026-03-15, qwen3.5-omni-flash-realtime, qwen3.5-omni-flash-realtime-2026-03-15 | Model multimodal real-time terbaru dari Qwen. Dibandingkan generasi sebelumnya Qwen3-Omni-Flash-Realtime, model ini menampilkan peningkatan kecerdasan yang signifikan dan setara dengan Qwen3.5-Plus. Model ini secara native mendukung pencarian web (WebSearch), interupsi suara, dan kontrol suara. Model ini mengenali 113 bahasa dan dialek, serta menghasilkan ucapan dalam 36 bahasa dan dialek. Real-time (Qwen-Omni-Realtime) |
Reasoning model | 2026-03-11 | MiniMax-M2.5 | Model baru dari MiniMax, menampilkan kecepatan respons cepat dan unggul dalam tugas seperti pemrograman dan pekerjaan kantor. Penggunaan |
Speech recognition | 2026-03-05 | fun-asr-realtime-2026-02-28 | Fun-ASR real-time speech recognition menambahkan model snapshot baru, yang menunjukkan kinerja lebih baik dibandingkanfun-asr-realtime-2025-11-07. Real-time speech recognition - Fun-ASR/Gummy/Paraformer |
Image generation and editing | 2026-03-03 | qwen-image-2.0, qwen-image-2.0-2026-03-03, qwen-image-2.0-pro, qwen-image-2.0-pro-2026-03-03 | Seri Qwen-Image2.0 mendukung generasi dan pengeditan gambar. Seri Pro menawarkan kemampuan yang lebih kuat dalam rendering teks, tekstur realistis, dan pemahaman semantik. Versi akselerasi menyeimbangkan performa dengan kecepatan respons. Qwen - text-to-image, Qwen - image editing |
Speech recognition | 2026-03-03 | qwen3-asr-flash-2026-02-10 | Pengenalan file audio Qwen menambahkan model snapshot baru, yang menunjukkan kinerja lebih baik dibandingkanqwen3-asr-flash-2025-09-08. Audio file recognition - Qwen |
Speech synthesis | 2026-03-02 | cosyvoice-v3.5-plus, cosyvoice-v3.5-flash | Model CosyVoice3.5 dirilis. Model ini berfokus pada kloning suara dan desain, serta mendukung kendali instruksi untuk sintesis ucapan. Real-time speech synthesis - CosyVoice |
Reasoning model | 2026-02-24 | qwen3.5-flash, qwen3.5-flash-2026-02-23, qwen3.5-122b-a10b, qwen3.5-27b, qwen3.5-35b-a3b | Model terbaru Qwen3.5-Flash dan model open source dari Alibaba. Model-model ini mendukung input teks, gambar, dan video, memberikan respons cepat, serta mencapai kinerja keseluruhan yang mendekati qwen3.5-plus. Model-model ini juga mendukung tool calling bawaan. Text generation overview |
Code model | 2026-02-20 | qwen3-coder-next | Model generasi kode open-source generasi berikutnya dalam seri Qwen3. Model ini mendukung interaksi alat multi-turn, memiliki peningkatan pemahaman kode tingkat repositori, dan kompatibilitas yang lebih baik dengan alat pemrograman AI. Kemampuan kode (Qwen-Coder) |
Reasoning model | 2026-02-18 | glm-5 | Model terbaru Zhipu, dirancang untuk skenario pemrograman dan agen, unggul dalam rekayasa sistem kompleks dan tugas agen jangka panjang. GLM |
Reasoning model | 2026-02-16 | qwen3.5-plus, qwen3.5-plus-2026-02-15, qwen3.5-397b-a17b | Model Qwen3.5-Plus dan model open source terbaru dari Alibaba. Model-model ini mendukung input teks, gambar, dan video serta memberikan kinerja luar biasa di berbagai tugas seperti pemahaman bahasa, penalaran logis, generasi kode, tugas agen, pemahaman gambar, pemahaman video, dan interaksi antarmuka pengguna grafis (GUI). Model-model ini juga mendukung tool calling bawaan. Ikhtisar generasi teks |
Speech recognition | 2026-02-13 | qwen3-asr-flash-realtime-2026-02-10 | Model snapshot baru ditambahkan untuk speech recognition real-time Qwen, yang menunjukkan kinerja lebih baik dibandingkanqwen3-asr-flash-realtime-2025-10-27. Real-time speech recognition - Qwen |
Speech recognition | 2026-02-12 | fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28 | Model ASR ringan baru berbasis arsitektur Fun-ASR, dioptimalkan untuk skenario 8 kHz dan cocok untuk pelanggan yang sensitif terhadap biaya. Real-time speech recognition - Fun-ASR/Gummy/Paraformer |
Speech synthesis | 2026-02-10 | qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26 | Sintesis ucapan Qwen memperkenalkan model Instruct, yang memungkinkan Anda mengontrol efek sintesis secara presisi menggunakan instruksi bahasa alami. Speech synthesis - Qwen |
Speech synthesis | 2026-02-10 | qwen3-tts-vd-2026-01-26 | Sintesis ucapan Qwen memperkenalkan model desain suara, yang memungkinkan Andamembuat suara kustom menggunakan deskripsi teks. Speech synthesis - Qwen |
Speech synthesis | 2026-02-10 | qwen3-tts-vc-2026-01-22 | Sintesis ucapan Qwen memperkenalkan model kloning suara, yang memungkinkan Andasecara cepat mengkloning suara dari sampel audio asli. Speech synthesis - Qwen |
Speech synthesis | 2026-02-04 | qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22 | Sintesis ucapan real-time Qwen menambahkan model Instruct, yang memungkinkan Anda mengontrol efek sintesis secara presisi menggunakan instruksi bahasa alami. Real-time speech synthesis - Qwen |
Reference-to-video | 2026-02-02 | wan2.6-r2v-flash | Menghasilkan video multi-shot dengan dubbing otomatis, menggunakan penampilan karakter dari video referensi atau gambar. Wan - Reference-to-Video |
Text generation and visual understanding | 2026-01-30 | kimi-k2.5 | Model pemahaman visual dari Moonshot AI yang unggul dalam tugas kecerdasan umum seperti generasi kode dan pemahaman visual. Model ini mendukung input gambar, video, dan teks, serta dapat melakukan tugas dialog dan agen. Kimi - Alibaba Cloud |
Speech recognition | 2026-01-28 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 | Seri Qwen3-ASR-Flash-Filetrans kini mendukung timestamp tingkat kata. Atur parameter baru |
Reasoning model | 2026-01-27 | qwen3-max-2026-01-23 | Dibandingkan versi snapshot 23 September 2025, model ini secara efektif menggabungkan mode berpikir dan non-berpikir, meningkatkan kinerja keseluruhan secara signifikan. Dalam mode berpikir, model terintegrasi dengan tiga alat: pencarian web, ekstraksi informasi web, dan interpreter kode. Dengan menggunakan alat eksternal selama proses berpikirnya, model ini mencapai akurasi lebih tinggi pada masalah kompleks. OpenAI compatible - Respons |
Visual understanding | 2026-01-23 | qwen3-vl-flash-2026-01-22 | Snapshot baru Qwen-VL. Dibandingkan snapshot 15 Oktober 2025, model ini secara efektif menggabungkan mode berpikir dan non-berpikir, meningkatkan kinerja keseluruhan model secara signifikan. Model ini mencapai akurasi inferensi yang lebih tinggi dalam skenario bisnis seperti pengenalan visual umum, pemantauan keamanan, inspeksi toko dan patroli, serta pemecahan masalah berbasis foto. Pemahaman gambar dan video |
Image-to-video | 2026-01-17 | wan2.6-i2v-flash | Mendukung pembuatan video dengan dan tanpa suara. Kedua jenis video tersebut ditagih secara independen sesuai aturan penagihan masing-masing. Model ini juga menyediakan kemampuan narasi multi-shot dan pemrosesan audio. Wan - Image-to-video - based on first frame |
Image editing | 2026-01-17 | qwen-image-edit-max, qwen-image-edit-max-2026-01-16 | Seri Qwen-Image-Edit-Max menawarkan kemampuan pengeditan yang lebih stabil dan kaya, peningkatan kemampuan desain industri dan inferensi geometris, serta peningkatan konsistensi karakter dan presisi pengeditan. Pengeditan gambar - Qwen |
Speech synthesis | 2026-01-16 | qwen3-tts-vc-realtime-2026-01-15 | Model snapshot baru ditambahkan untuk sintesis ucapan real-time Qwen. Kinerja voice cloning (Qwen) lebih dioptimalkan. Model baru ini terdengar lebih alami dan lebih dekat dengan suara asli dibandingkan qwen3-tts-vc-realtime-2025-11-27. Real-time speech synthesis - Qwen |
Text-to-image | 2026-01-12 | qwen-image-plus-2026-01-09 | Model snapshot baru ini untuk generasi teks-ke-gambar Qwen merupakan versi distilasi dan akselerasi dari qwen-image-max yang menghasilkan gambar berkualitas tinggi secara cepat. Qwen - text-to-image |
Reasoning model | 2026-01-12 | deepseek-v3.2 | Model deepseek-v3.2 mendukung caching implisit dan eksplisit untuk meningkatkan kecepatan respons dan mengurangi biaya penggunaan tanpa memengaruhi kualitas respons. Context cache |
Image-to-video | 2026-01-08 | wan2.2-kf2v-flash | Berdasarkan prompt dan frame awal serta akhir input, model ini dapat menghasilkan video dinamis yang mulus. First-and-last-frame-to-video |
Speech recognition | 2026-01-06 | qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Qwen3-ASR-Flash mendukung mode kompatibel OpenAI. Audio file recognition - Qwen |
Speech synthesis | 2026-01-05 | cosyvoice-v3-flash | Sintesis ucapan CosyVoice menambahkan 24 suara baru (lihat Daftar suara):
|
Text-to-image | 2025-12-31 | qwen-image-max, qwen-image-max-2025-12-30 | Seri Max model generasi gambar Qwen meningkatkan realisme dan kealamian gambar dibandingkan seri Plus, secara efektif mengurangi artefak hasil generasi AI, serta unggul dalam aspek seperti tekstur karakter, detail tekstur, dan rendering teks. Qwen - text-to-image |
Image editing | 2025-12-23 | qwen-image-edit-plus-2025-12-15 | Model snapshot terbaru untuk pengeditan gambar Qwen meningkatkan konsistensi karakter, kemampuan desain industri, dan inferensi geometris dibandingkan versi sebelumnya. Model ini juga mengoptimalkan keselarasan tata letak spasial, tekstur, dan gaya antara gambar yang diedit dan gambar asli, menghasilkan pengeditan yang lebih presisi. Pengeditan gambar - Qwen |
Text-to-image | 2025-12-19 | z-image-turbo | Model text-to-image ringan yang dengan cepat menghasilkan gambar berkualitas tinggi. Model ini mendukung rendering bilingual dalam bahasa Tiongkok dan Inggris, pemahaman semantik kompleks, berbagai gaya dan tema, serta adaptasi fleksibel terhadap berbagai resolusi dan rasio aspek. Text-to-image Z-Image |
Visual understanding | 2025-12-19 | qwen3-vl-plus-2025-12-19 | Model snapshot baru Qwen-VL ini menampilkan peningkatan kemampuan mengikuti instruksi dan latensi lebih rendah. Pemahaman gambar dan video |
Speech recognition | 2025-12-19 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17, qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Pengenalan ucapan kini mendukung 9 bahasa tambahan, termasuk Ceko dan Denmark. Audio file recognition - Qwen |
Speech recognition | 2025-12-17 | qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27 | Pengenalan ucapan kini didukung dalam sembilan bahasa tambahan, termasuk Ceko dan Denmark. Real-time speech recognition - Qwen |
Speech recognition | 2025-12-17 | qwen3-asr-flash, qwen3-asr-flash-2025-09-08 | Mendukung audio dengan laju sampel dan saluran suara apa pun. Audio file recognition - Qwen |
Speech recognition | 2025-12-17 | fun-asr-mtl, fun-asr-mtl-2025-08-25 | Mendukung pengenalan ucapan untuk 31 bahasa, termasuk Tiongkok, Inggris, Jepang, dan Korea. Ideal untuk skenario di Asia Tenggara. Audio file recognition - Fun-ASR/Paraformer/SenseVoice |
Speech synthesis | 2025-12-16 | qwen3-tts-vd-realtime-2025-12-16 (snapshot) | Model snapshot baru untuk sintesis ucapan real-time Qwen menggunakan suara yang dihasilkan oleh voice design (Qwen) untuk sintesis real-time berlatensi rendah dan stabilitas tinggi. Model ini mendukung output multibahasa, secara otomatis menyesuaikan nada berdasarkan teks, dan mengoptimalkan kinerja sintesis untuk teks kompleks. Real-time speech synthesis - Qwen |
Text-to-image | 2025-12-16 | wan2.6-t2i | Antarmuka sinkron baru ditambahkan. Antarmuka ini mendukung pemilihan dimensi kustom dalam batasan luas piksel total dan rasio aspek. Wan - Text-to-image V2 |
Image generation and editing | 2025-12-16 | wan2.6-image | Mendukung pengeditan gambar dan output campuran gambar-teks. Wan - Image Generation and Editing 2.6 |
Image-to-video - based on first frame | 2025-12-16 | wan2.6-i2v | Menambahkan fitur narasi multi-shot dan dukungan audio, sehingga Anda dapat menggunakan dubbing otomatis atau mengunggah file audio kustom. Wan - Image-to-video - based on first frame |
Reference-to-video | 2025-12-16 | wan2.6-r2v | Menghasilkan video multi-shot berdasarkan penampilan dan suara karakter dari video referensi. Model ini juga mendukung dubbing otomatis. Wan - Reference-to-Video |
Text-to-video | 2025-12-16 | wan2.6-t2v | Menambahkan fitur narasi multi-shot, yang mendukung audio menggunakan dubbing otomatis atau file audio kustom. Text-to-Video |
Speech recognition | 2025-12-12 | fun-asr, fun-asr-2025-11-07 | Pembaruan fitur untuk pengenalan file audio Fun-ASR:
|
Speech synthesis | 2025-12-11 | cosyvoice-v3-flash, cosyvoice-v3-plus |
|
Omni-modal | 2025-12-04 | qwen3-omni-flash-2025-12-01 | Model snapshot terbaru Qwen Omni meningkatkan jumlah timbre yang didukung menjadi 49 dan menampilkan peningkatan signifikan pada kemampuan mengikuti instruksi, memungkinkannya memahami teks, gambar, audio, dan video secara efisien. Non-real-time (Qwen-Omni) |
Real-time multimodal | 2025-12-04 | qwen3-omni-flash-realtime-2025-12-01 | Model snapshot terbaru untuk versi real-time Qwen Omni menawarkan interaksi multimodal berlatensi rendah. Jumlah timbre yang didukung meningkat menjadi 49, dan kemampuan mengikuti instruksi serta pengalaman interaktif model ditingkatkan secara signifikan. Real-time (Qwen-Omni-Realtime) |
Speech translation | 2025-12-04 | qwen3-livetranslate-flash, qwen3-livetranslate-flash-2025-12-01 | Qwen3-LiveTranslate-Flash adalah model terjemahan audio dan video yang menerjemahkan antara 18 bahasa, seperti Tiongkok, Inggris, Rusia, dan Prancis. Model ini menggunakan konteks visual untuk meningkatkan akurasi terjemahan dan menyediakan output teks maupun ucapan. Audio and video file translation - Qwen |
Reasoning model | 2025-12-04 | deepseek-v3.2 | DeepSeek-V3.2 adalah model resmi yang memperkenalkan DeepSeek Sparse Attention, yaitu mekanisme perhatian jarang. Ini juga merupakan model DeepSeek pertama yang mengintegrasikan berpikir dengan penggunaan alat, dan mendukung tool calling dalam mode berpikir maupun non-berpikir. |
Multilingual translation | 2025-12-02 | qwen-mt-lite | Model dasar terjemahan teks Qwen mendukung terjemahan antara 31 bahasa. Dibandingkan qwen-mt-flash, model ini memberikan respons lebih cepat dengan biaya lebih rendah, sehingga cocok untuk skenario yang sensitif terhadap latensi. Kemampuan terjemahan (Qwen-MT) |
Voice cloning | 2025-11-27 | qwen-voice-enrollment | Qwen merilis model kloning suara. Model ini dapat dengan cepat menghasilkan suara yang sangat mirip dari klip audio selama 5 detik atau lebih. Ketika dikombinasikan dengan model qwen3-tts-vc-realtime-2025-11-27, model ini dapat mengkloning suara seseorang dengan fidelitas tinggi dan mengeluarkannya secara real time dalam 11 bahasa. Voice cloning (Qwen) |
Speech synthesis | 2025-11-27 | qwen3-tts-vc-realtime-2025-11-27 (snapshot) | Sintesis ucapan real-time Qwen telah merilis model snapshot baru yang menyediakan sintesis real-time berlatensi rendah dan stabilitas tinggi menggunakan suara yang dihasilkan oleh voice cloning (Qwen). Model ini juga mendukung output multibahasa, secara otomatis menyesuaikan intonasi berdasarkan teks, dan mengoptimalkan sintesis untuk teks kompleks. Real-time speech synthesis - Qwen |
Speech synthesis | 2025-11-27 | qwen3-tts-flash-realtime-2025-11-27 (snapshot) | Sintesis ucapan real-time Qwen merilis model snapshot baru. Model ini menawarkan latensi rendah dan stabilitas tinggi. Model ini menyediakan lebih banyak pilihan suara, dan satu suara dapat mendukung output multibahasa. Model ini secara otomatis menyesuaikan intonasinya berdasarkan teks dan meningkatkan sintesis untuk teks kompleks. Real-time speech synthesis - Qwen |
Speech synthesis | 2025-11-27 | qwen3-tts-flash-2025-11-27 (snapshot) | Sintesis ucapan Qwen merilis model snapshot baru. Model ini menawarkan lebih banyak pilihan suara, dan satu suara mendukung output multibahasa. Model ini secara otomatis menyesuaikan nadanya dengan teks dan menyediakan sintesis yang dioptimalkan untuk teks kompleks. Speech synthesis - Qwen |
Text extraction | 2025-11-21 | qwen-vl-ocr-2025-11-20 (snapshot) | Versi snapshot dari model ekstraksi teks Qwen ini dibangun di atas arsitektur Qwen3-VL dan secara signifikan meningkatkan parsing dokumen dan lokalisasi teks. Ekstraksi teks |
Speech recognition | 2025-11-20 | qwen3-asr-flash-filetrans, qwen3-asr-flash-filetrans-2025-11-17 (snapshot) | Pengenalan File Audio Qwen merilis model baru. Model ini dirancang untuk transkripsi asinkron file audio dan mendukung rekaman hingga 12 jam. Audio file recognition - Qwen |
Speech synthesis | 2025-11-19 | cosyvoice-v3-flash | Versi ini meningkatkan akurasi pengucapan dan kemiripan suara dibandingkan versi sebelumnya. Model ini juga mendukung lebih banyak bahasa, termasuk Jerman, Spanyol, Prancis, Italia, dan Rusia. Real-time speech synthesis - CosyVoice/Sambert |
Reasoning model | 2025-11-11 | kimi-k2-thinking | Ini adalah model berpikir dari Moonshot AI. Model ini memiliki kemampuan agen dan penalaran umum, unggul dalam penalaran mendalam, serta dapat menyelesaikan masalah kompleks melalui tool calling multi-langkah. Kimi - Alibaba Cloud |
Multilingual translation | 2025-11-10 | qwen-mt-flash | Dibandingkan qwen-mt-turbo, model ini mendukung output inkremental streaming dan memiliki peningkatan kinerja keseluruhan. Kemampuan terjemahan (Qwen-MT) |
Image-to-video | 2025-11-04 | wan2.2-animate-mix | Mengganti karakter utama dalam video referensi dengan karakter dari gambar input, sekaligus mempertahankan adegan, pencahayaan, dan nada video asli untuk mencapai penggantian karakter yang mulus. Wan - Video character replacement |
Reasoning model | 2025-11-03 | qwen3-max-preview | Mode berpikir dari model qwen3-max-preview memberikan peningkatan signifikan dalam kemampuan penalaran keseluruhan, terutama menunjukkan kinerja superior dalam pemrograman agen, penalaran akal sehat, matematika, sains, dan tugas umum. Pemikiran mendalam |
Image-to-video | 2025-11-03 | wan2.2-animate-move | Memindahkan gerakan dan ekspresi karakter dari video template ke gambar karakter statis tunggal untuk menghasilkan video karakter dalam gerak. Wan - Image-to-action |
Image editing | 2025-10-31 | qwen-image-edit-plus, qwen-image-edit-plus-2025-10-30 | Berdasarkan qwen-image-edit, model ini menawarkan kinerja inferensi dan stabilitas sistem yang dioptimalkan. Model ini secara besar-besaran mengurangi waktu respons untuk generasi dan pengeditan gambar, serta mendukung pengembalian beberapa gambar dalam satu permintaan. Pengeditan gambar - Qwen |
Real-time speech recognition | 2025-10-27 | qwen3-asr-flash-realtime, qwen3-asr-flash-realtime-2025-10-27 | Model speech recognition real-time Qwen memiliki fitur deteksi bahasa otomatis. Model ini dapat mengenali 11 jenis bahasa dan mentranskripsi audio secara akurat di lingkungan kompleks. Real-time speech recognition - Qwen |
Visual understanding | 2025-10-21 | qwen3-vl-32b-thinking, qwen3-vl-32b-instruct | Model Dense 32B dari seri Qwen3-VL. Kinerja keseluruhannya hanya berada di bawah model Qwen3-VL-235B. Model ini unggul dalam pengenalan dan pemahaman dokumen, kecerdasan spasial, pengenalan objek, deteksi visual 2D, dan penalaran spasial. Model ini cocok untuk tugas persepsi kompleks dalam skenario umum. Pemahaman gambar dan video |
Visual understanding | 2025-10-16 | qwen3-vl-flash, qwen3-vl-flash-2025-10-15 | Model pemahaman visual berukuran kecil dari seri Qwen3. Model ini secara efektif menggabungkan mode berpikir dan non-berpikir. Dibandingkan model open source Qwen3-VL-30B-A3B, model ini menunjukkan kinerja lebih baik dan waktu respons lebih cepat. Pemahaman gambar dan video |
Visual understanding | 2025-10-14 | qwen3-vl-8b-thinking, qwen3-vl-8b-instruct | Model dense 8B dari seri Qwen3-VL, tersedia dalam versi berpikir dan non-berpikir. Model ini menggunakan lebih sedikit memori GPU dan dapat melakukan pemahaman dan penalaran multimodal. Model ini mendukung konteks ultra-panjang seperti video dan dokumen panjang, posisi visual 2D/3D, serta kecerdasan spasial dan pengenalan objek yang komprehensif. Pemahaman gambar dan video |
Visual understanding | 2025-10-03 | qwen3-vl-30b-a3b-thinking, qwen3-vl-30b-a3b-instruct | Berdasarkan model open source Qwen3-VL generasi baru, model ini tersedia dalam versi berpikir dan non-berpikir. Model ini memiliki waktu respons cepat dan kemampuan yang lebih kuat untuk pemahaman multimodal, penalaran, dan tugas agen visual. Model ini juga mendukung konteks ultra-panjang seperti video dan dokumen. Kemampuan kecerdasan spasial dan pengenalan objeknya sepenuhnya ditingkatkan untuk menangani tugas dunia nyata yang kompleks. Pemahaman gambar dan video |
Reasoning model | 2025-09-30 | deepseek-v3.2-exp | Model arsitektur inferensi hibrida yang mendukung mode berpikir dan non-berpikir. Model ini memperkenalkan mekanisme perhatian jarang untuk meningkatkan efisiensi pelatihan dan inferensi untuk teks panjang. Model ini memiliki harga lebih rendah dibandingkan deepseek-v3.1. Lihat DeepSeek - Alibaba Cloud. |
Text-to-image | 2025-09-23 | qwen-image-plus | Model ini unggul dalam rendering teks kompleks, terutama Tiongkok dan Inggris. Model ini dapat membuat tata letak multimedia kompleks dari gambar dan teks. Model ini lebih hemat biaya dibandingkan qwen-image. Text-to-image (Qwen-Image) |
Visual understanding | 2025-09-23 | qwen3-vl-plus, qwen3-vl-plus-2025-09-23, qwen3-vl-235b-a22b-thinking, qwen3-vl-235b-a22b-instruct | Seri model pemahaman visual Qwen3 secara efektif menggabungkan mode berpikir dan non-berpikir, dan kemampuan agen visualnya bersifat kelas dunia. Versi ini menampilkan peningkatan komprehensif dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Persepsi dan pengenalan visualnya secara signifikan ditingkatkan. Pemahaman gambar dan video |
Code model | 2025-09-23 | qwen3-coder-plus-2025-09-23 | Dibandingkan versi sebelumnya (snapshot 22 Juli), versi ini memiliki ketahanan yang lebih baik untuk tugas turunan dan tool calling, serta keamanan kode yang ditingkatkan. Kemampuan kode (Qwen-Coder) |
Reasoning model | 2025-09-11 | qwen-plus-2025-09-11 | Model ini merupakan bagian dari seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini mengikuti instruksi lebih baik dan memberikan ringkasan yang lebih ringkas dalam mode berpikir. Lihat Deep thinking. Dalam mode non-thinking, model ini memiliki peningkatan pemahaman bahasa Tiongkok dan penalaran logis. Lihat Ikhtisar generasi teks. |
Reasoning model | 2025-09-11 | qwen3-next-80b-a3b-thinking, qwen3-next-80b-a3b-instruct | Generasi baru model open source berbasis Qwen3. Model berpikir memiliki kemampuan mengikuti instruksi yang ditingkatkan dan memberikan ringkasan yang lebih ringkas dibandingkan qwen3-235b-a22b-thinking-2507. Lihat Deep thinking. Model instruct memiliki peningkatan kemampuan pemahaman bahasa Tiongkok, penalaran logis, dan generasi teks dibandingkan qwen3-235b-a22b-instruct-2507. Lihat Ikhtisar generasi teks. |
Text generation | 2025-09-05 | qwen3-max-preview | Model pratinjau Qwen-Max, dibangun di atas Qwen3, menawarkan peningkatan signifikan dalam kemampuan umum dibandingkan seri Qwen 2.5. Model ini menunjukkan peningkatan besar dalam pemahaman teks Tiongkok dan Inggris, mengikuti instruksi kompleks, tugas subjektif terbuka, tugas multibahasa, dan tool calling. Model ini juga cenderung menghasilkan halusinasi pengetahuan yang lebih sedikit. |
Text, image, video, voice, etc. | 2025-08-05 | Ini adalah rilis pertama di wilayah Beijing. |
Tiongkok (Hong Kong)
Saat cakupan penerapan layanan adalah Tiongkok (Hong Kong), penyimpanan data berada di wilayah akses Tiongkok (Hong Kong). Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok (Hong Kong).
Type | Waktu | Model | Deskripsi |
|---|---|---|---|
Reasoning model | 2026-03-17 | qwen3-max, qwen3-max-2026-01-23 | Dibandingkan snapshot 23 September 2025, model ini lebih mengintegrasikan mode berpikir dan non-berpikir untuk peningkatan kinerja keseluruhan yang signifikan. |
Reasoning model | 2026-03-17 | qwen-plus, qwen-plus-2025-12-01 | Model ini merupakan bagian dari seri Qwen3 dan merupakan peningkatan dari qwen-plus-2025-07-28. Dalam mode berpikir, model ini mengikuti instruksi lebih baik dan memberikan ringkasan yang lebih ringkas. Lihat Deep thinking. Dalam mode non-berpikir, pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-03-17 | qwen3.5-flash, qwen3.5-flash-2026-02-23 | Ini adalah model open source terbaru dari Alibaba, Qwen3.5-Flash. Model ini mendukung input teks, gambar, dan video, memberikan respons cepat. Lihat Ikhtisar generasi teks. |
Visual understanding | 2026-03-17 | qwen3-vl-plus, qwen3-vl-plus-2025-12-19 | Model pemahaman visual seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Kemampuan agen visualnya termasuk yang terbaik di dunia. Versi ini mencakup peningkatan komprehensif terhadap pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini menampilkan peningkatan signifikan dalam persepsi dan pengenalan visual, pengikutan instruksi yang lebih baik, dan latensi lebih rendah. Lihat Pemahaman gambar dan video. |
Uni Eropa
Saat cakupan penerapan layanan adalah Uni Eropa, penyimpanan data berada di wilayah akses Jerman (Frankfurt). Sumber daya komputasi inferensi model dibatasi hanya untuk Uni Eropa.
Type | Waktu | Model | Deskripsi fitur |
|---|---|---|---|
Reasoning model | 2026-03-20 | qwen3-max, qwen3-max-2026-01-23 | Dibandingkan snapshot 23 September 2025, model ini mengintegrasikan mode berpikir dan non-berpikir untuk meningkatkan kinerja keseluruhan secara signifikan. |
Reasoning model | 2026-03-20 | qwen-plus, qwen-plus-2025-12-01 | Ini adalah model seri Qwen3. Dibandingkan qwen-plus-2025-07-28, model ini menawarkan pengikutan instruksi yang lebih baik dalam mode berpikir dan memberikan respons ringkasan yang lebih ringkas. Lihat Deep thinking. Dalam mode non-berpikir, pemahaman bahasa Tiongkok dan penalaran logisnya ditingkatkan. Lihat Ikhtisar generasi teks. |
Reasoning model | 2026-03-20 | qwen3.5-flash, qwen3.5-flash-2026-02-23 | Qwen3.5-Flash adalah model open source terbaru dari Alibaba. Model ini mendukung input teks, gambar, dan video serta memberikan respons cepat. Lihat Ikhtisar generasi teks. |
Visual understanding | 2026-03-20 | qwen3-vl-plus, qwen3-vl-flash, qwen3-vl-flash-2025-10-15 | Model pemahaman visual seri Qwen3 ini secara efektif mengintegrasikan mode berpikir dan non-berpikir. Kemampuan agen visualnya bersifat kelas dunia. Versi ini mencakup peningkatan utama dalam pengkodean visual, kecerdasan spasial, dan pemikiran multimodal. Model ini menampilkan peningkatan besar dalam persepsi dan pengenalan visual, pengikutan instruksi yang lebih baik, dan latensi lebih rendah. Lihat Pemahaman gambar dan video. |
Code capability | 2026-03-20 | qwen3-coder-next | Ini adalah model generasi kode open source generasi baru dari seri Qwen3. Model ini mendukung interaksi alat multi-turn. Model ini juga memiliki peningkatan pemahaman kode tingkat repositori dan kompatibilitas yang lebih baik dengan alat pemrograman AI. Lihat Code capability (Qwen-Coder). |