Alibaba Cloud で Qwen を使ったマルチモーダルチャットアシスタントの構築
リファレンスアーキテクチャ
お客様の課題:
マルチモーダルデータを理解するチャットアシスタントの構築には、高性能な AI モデル、強力な生成 AI 開発プラットフォーム、そして包括的なソリューションが必要です。
ソリューション:
-
Alibaba Cloud は、マルチモーダル AI 開発の基盤となる技術的な柱を提供します。
Qwen-Audio:さまざまな音声入力を処理する大規模音声言語モデルです。
Qwen-VL:画像を分析し、詳細なニュアンスやテキストを読み取る大規模視覚言語モデルです。
OpenSearch:ベクトル検索と LLM を活用し、Q&A システムをカスタマイズする対話型検索サービスです。
Qwen-Agent:LLM アプリケーション開発のためのフレームワークです。指示に従い複雑なタスクを実行するインテリジェントなエージェントを統合管理します。
PAI-EAS:数クリックで Qwen やその他の主要なマルチモーダル AI モデルを Web サービスとしてデプロイできます。
これらのプロダクトはプランナーエージェントによって連携しています。このエージェントの API を ECS にデプロイし、DingTalk やその他のインスタントメッセンジャー (IM) に接続できます。
PAI-EAS での Llama 2 モデルのデプロイ
結果デモ
Llama 2 について:
Llama はオープンソースの LLM です。前モデルの Llama 1 と比較して、Llama 2 はトレーニングデータが増加し、コンテキスト長も拡張されているため、大規模な自然言語生成においてより汎用性と精度が向上しています。Llama 2 には 70 億、130 億、700 億パラメータなど、さまざまなスケールのバージョンがあります。
デプロイ:
-
PAI-EAS (Elastic Algorithm Service) は、Machine Learning Platform for AI (PAI) のコンポーネントであり、AI アプリケーションを簡単にデプロイ・管理できます。PAI-Blade 推論アクセラレータを搭載しており、従来の手法と比べて最大 6 倍高速な推論速度で LLM のパフォーマンスを向上させるハードウェアアクセラレータです。より多くのデータを処理し、より高速なレスポンスを生成し、言語ベースのアプリケーションのパフォーマンスを強化できます。ブログで提供されるサンプルコードを使用して、数クリックで PAI-EAS 上の WebUI から Llama 2 を実行できます。また、ブログ内の Python Wrapper コードで API を使用して Llama 2 サービスをセットアップすることも可能です。カスタムモデルを Llama 2 にマウントする方法についてもブログで解説しています。
Alibaba Cloud の生成 AI
生成 AI でイノベーションを加速し、新たなビジネスの成功を創出。
PAI での Stable Diffusion モデルの実行
結果デモ
Stable Diffusion について:
Stable Diffusion は、高度なディープラーニングアルゴリズムと技術を活用し、テキストの記述に基づいて視覚的に魅力ある画像を生成するオープンソースのクロスモーダル生成モデルです。生成画像を反復的に更新することで、最終結果の品質、整合性、忠実度を段階的に向上させます。
デプロイ:
-
PAI-DSW (Data Science Workshop) を使用して Stable Diffusion モデルをファインチューニングできます。PAI-DLC (Deep Learning Container) では、主要なディープラーニングフレームワークのすぐに使えるコンテナを使用して、合理的なディープラーニング環境を素早くセットアップ・管理できます。最後に、PAI-EAS で数クリックでモデルをデプロイし、テキストから画像への生成サービスを作成できます。
ブログ
GenAI-Diffusion 画像生成ソリューションでクリエイティブの可能性を解き放つ
この記事では、高コストや長い開発期間をかけずに、Stable Diffusion モデルを使用して独自のテキストから画像への生成サービスを構築する方法を紹介します。
ドキュメント
EAS で Stable Diffusion をデプロイして AI 画像生成を数クリックで実現
このトピックでは、PAI-EAS を使用して Stable Diffusion Web UI を Web アプリケーションとしてデプロイする方法を説明します。デプロイしたアプリケーションをモデル推論に利用できます。
AnalyticDB for PostgreSQL によるベクトルクエリと分析
結果デモ
お客様の課題:
大量かつ複雑な非構造化データは、リアルタイムパフォーマンス分析、高コスト、システム互換性の面で従来のベクトルデータベースに課題をもたらしています。ビジネスのスケーラビリティも大きな懸念事項です。
ソリューション:
-
AnalyticDB for PostgreSQL は、超並列処理 (MPP) 機能を備えたクラウドネイティブなデータウェアハウスです。ベクトルデータベース機能により、ドキュメント、メール、画像、Web コンテンツなどの大規模な非構造化データを管理でき、大量の構造化データと非構造化データの管理・処理、リアルタイム分析、変化するビジネスニーズへの適応を必要とする最新のデータサービスに最適です。ドメイン固有の要件を持つ企業は、AnalyticDB for PostgreSQL を活用して、ドメイン固有データや専門データに基づくトピックで正確な結果を生成できます。この例では、LLM の学習・理解能力と AnalyticDB for PostgreSQL のコア機能を組み合わせたチャットボットを簡単に構築できます。組み込みのベクトルデータ検索と全文検索により、企業のナレッジを活用した専門的かつタイムリーな回答を提供します。
Alibaba Cloud の生成 AI
生成 AI でイノベーションを加速し、新たなビジネスの成功を創出。
OpenSearch Vector Search Edition で対話型検索サービスを構築
結果デモ
お客様の課題:
EC やオンラインソーシャルプラットフォームなどの業界では、大量の非構造化データが絶えず増加・変化しており、顧客からの問い合わせは複雑でリアルタイムな応答が求められます。LLM ベースの検索サービスでは、正確性とリアルタイム性に対する顧客ニーズを満たすことが難しく、高いハードウェアコストも課題となります。
ソリューション:
-
OpenSearch は、数十億レベルの 128 次元ドキュメント (ベクトルデータ) や、ミリ秒レベルのクエリ応答で数千レベルの QPS をサポートする高性能検索サービスです。ベクトルデータ向けのさまざまな検索アルゴリズムを統合し、ハイブリッド検索、式によるフィルタリング、検索中のフィルタリングなど複雑な検索要件に対応します。また、データ圧縮機能ときめ細かなインデックス構造設計により、ストレージとメモリの使用量を削減し、大規模環境でのハードウェアコストを節約します。サービスツールを通じて OpenSearch と LLM を組み合わせることで、ビジネス向けのインテリジェントかつ専用のリアルタイム検索サービスを構築できます。ハードウェアへの多額の投資を必要とせずに、サービス品質とリアルタイム性を向上させることが可能です。
Stable Diffusion モデルによるバーチャル試着サービスの構築
結果デモ
お客様の課題:
画像ベースのバーチャル試着は、ターゲットモデルに指定の衣類を着用させた画像を生成するもので、より便利でパーソナライズされたユーザー体験を提供します。しかし、特に大規模環境において、自然で鮮やかな効果を安定的に維持することは困難です。
ソリューション:
-
LoRA (Low-Rank Adaptive Relational Attention) は、AI 画像生成で広く使用されているアルゴリズムです。少数のパラメータと少量のデータセットを追加するだけで、生成モデルのファインチューニングが可能です。Platform for AI (PAI) を使用すると、LoRA と Stable Diffusion モデルに基づく AI 画像生成を簡単かつ迅速にファインチューニングでき、学習パラメータ数と GPU メモリ要件を削減しながら、モデル、ポーズ、背景の幅広い生成空間を提供します。これにより、ファッションリテール業界におけるよりパーソナライズされたインテリジェントな顧客体験の新たな可能性が開かれます。
