阿里巴巴推出Qwen3,树立混合推理开源AI领域新标杆
阿里云 2025年4月29日
中国杭州,2025年4月29日 — 阿里巴巴推出了最新一代的开源大语言模型(LLM)系列Qwen3,为AI创新树立了新标杆。
Qwen3系列包含六个密集模型和两个混合专家(MoE)模型,为开发人员提供了跨移动设备、智能眼镜、自动驾驶汽车、机器人等构建新一代应用程序的灵活性。
所有Qwen3模型,包括密集模型(0.6B、1.7B、4B、8B、14B和32B参数)和MoE模型(含3B激活参数的30B、含22B激活参数的235B),现在均为开源,可在全球范围内获取。
思考模式与非思考模式相结合的混合推理
Qwen3是阿里巴巴的首款混合推理模型,融合了传统大语言模型能力与先进动态推理技术。 Qwen3模型可以在进行复杂多步骤任务(如数学、编码和逻辑推理)的思考模式与实现快速通用响应的非思考模式之间无缝切换。
对于通过API访问Qwen3的开发人员,该模型可精细控制思考持续时间(最多38,000个词元),从而在智能性能与计算效率之间实现更佳的平衡。 值得注意的是,与其他先进的模型相比,Qwen3-235B-A22B MoE模型大幅降低了部署成本,进一步彰显了阿里巴巴打造普惠高性能AI的坚定承诺。
在多语言技能、智能体功能、推理和人类一致性方面取得多项突破
Qwen3在包含36万亿个词元的大型数据集上进行了训练,该数量是其前代模型Qwen2.5的两倍,因此在推理、指令遵循、工具调用和多语言任务方面实现了大幅性能提升。
主要功能包括:
• 精通多语言:支持119种语言和方言,在翻译和多语言指令遵循方面表现突出。
• 先进的智能体集成功能:原生支持模型上下文协议(MCP)和强大的函数调用,在复杂的基于智能体的任务中性能领跑开源模型。
• 出色的推理能力:在数学、编码和逻辑推理基准评测方面超越之前的千问大模型(思考模式下的QwQ和非思考模式下的Qwen2.5)。
• 增强的人类一致性:提供更自然的创意写作、角色扮演和多轮对话体验,可实现更自然、富有沉浸感的交互体验。

Qwen3模型在各类行业基准评测中均取得顶尖水准成绩
得益于模型架构方面的进步、训练数据增加以及更有效的训练方法,Qwen3模型在各类行业基准评测中均取得顶尖水准成绩,例如AIME25(数学推理)、LiveCodeBench(编码能力)、BFCL(工具和函数调用功能)以及Arena-Hard(指令微调大模型的基准评测)。 此外,为了开发混合推理模型,实现了四阶段的训练过程,其中包含长思维链(CoT)冷启动、基于推理的强化学习(RL)、思考模式融合以及通用RL。
开放共享,推动创新
Qwen3模型现可在Hugging Face、Github和ModelScope魔搭社区上免费下载,并且可在chat.qwen.ai上进行深入探索。 API访问权限即将通过阿里巴巴的AI模型开发平台百炼提供。 Qwen3还为阿里巴巴的旗舰AI超级助手应用程序夸克提供支持。
自首次发布以来,千问大模型系列已在全球范围内吸引3亿多次下载。 开发人员已在Hugging Face上创建超过100,000个基于千问的衍生模型,令千问成为全球采用最广泛的开源AI模型系列之一。
关于阿里巴巴集团
阿里巴巴集团的使命是让在任何地方都能轻松开展业务。 该公司旨在建立面向未来的商业基础设施。 我们憧憬,客户能依托阿里巴巴实现会面、办公与生活一体化;同时立志成为一家可持续经营逾百年的优质企业。
