Alibaba Cloud Model Studio に統合された Qwen および Wan モデルシリーズは、当社が独自に開発・訓練したモデルであり、インターネット上から公開されている情報、第三者パートナーから提供された非公開データ、データラベリングサービスおよび有償契約者による提供データ、および当社の独自モデルによって生成された合成データなど、多様なソースから構成されるデータを用いて訓練されています。当社のモデルは、テキスト、画像、動画、音声を含む数兆トークン規模のデータセットを用いて訓練されています。これらのデータセットのうち、最も早いものについては、当社モデルの開発開始時点より前、2022 年 1 月以前から使用されています。
当社モデルのトレーニングデータは、推論サービスのコア機能(一般言語理解、高度な推論、マルチモーダル対話、ロングコンテキスト処理、視覚生成など)を包括的に支援するよう、体系的に設計・厳選されています。トレーニングデータは、世界に関する知識をモデルに付与するだけでなく、タスクアライメント、モダリティ融合、推論サービスにおける機能強化を通じて、多様で専門的かつマルチモーダルなユーザー要件に対して、効率的・安全・正確な応答を実現することを目的としています。当社のデータセットには、著作権、商標、特許により保護されているデータやパブリックドメインのデータが含まれる場合があります。また、合成データの活用は、トレーニングデータの可用性制約への対応、複雑なタスクの処理能力向上、モデルの汎化性能および知覚性能の改善、ならびにモデルの安全性・堅牢性の確保を目的としています。
データ品質の維持および潜在的リスクの軽減のため、当社では厳格なクリーニングおよびフィルタリング機構を適用しています。データ前処理段階において、トレーニングデータセットから個人情報を削減するためのフィルタリング措置を実施しています。お客様の Alibaba Cloud Model Studio 上の業務データを、当社モデルの開発または改善に使用することはありません。ただし、お客様が個別に明示的な同意を提供された場合はこの限りではありません。当社では、包括的なデータクリーニング、処理、構造最適化を支える厳格なデータガバナンスフレームワークを確立しており、データ品質・セキュリティ・多様性を確保するため、以下の段階を含みます:
事前学習(Pre-training)段階:
生のトレーニングデータに対し、自動コンテンツセーフティスクリーニングおよび人手によるレビュー機構を含む厳格なクリーニング・フィルタリングプロシージャを適用し、有害またはセンシティブなコンテンツを体系的に除去します。これらの措置は、推論時にモデルがバイアスの影響を能動的に識別・緩和できるよう設計されており、モデル出力の公平性および中立性を高めることを目的としています。事後学習(Post-training)段階:
言語モデル向けのデータ拡張および最適化。データ品質の観点から、教育的価値、ドメインカバー率、言語タイプ、推論の複雑度、安全性レベルなど、複数ディメンションにわたる詳細なアノテーションフレームワークを開発しました。その上で、高品質なデータをこれらのアノテーションに基づき選定しています。並行して、当社の独自専門モデル(例:Qwen-Math、Qwen-Coder)により生成された合成データを積極的に注入しています。これらの実践により、多言語理解、複雑な推論、ロングコンテキストモデリングなどのコア機能におけるモデル性能が大幅に向上するとともに、トレーニングデータの制御性も強化されます。
視覚生成モデル向けの専門的前処理。マルチモーダルデータに対しては、高精度 OCR やドキュメント構造解析、2D/3D 空間意味アノテーション、動画フレームとテキストコンテンツ間の明示的な時系列アライメントなど、ターゲットを絞った前処理を実施しています。さらに、大規模マルチモーダル合成データセットを体系的に構築しています。これらの取り組みは、ビジョンと言語のクロスモーダルアライメントを強化し、複雑なドキュメントや長尺動画といった高次元情報の理解を支援するとともに、視覚生成およびエージェントベースの対話といった先進的アプリケーションに高品質なトレーニング基盤を提供することを目的としています。
安全性アライメント。専用の安全性データセットを構築し、安全性アライメントを実施することで、モデル固有の安全性機能を強化します。
これらのすべてのプロセスの最終的な目的は、データ品質およびタスクアライメントの向上、モデルの安全性および規制準拠の確保、および汎用・専門・マルチモーダルの各シナリオにおける推論サービスの意図した性能目標の正確な達成です。