|
日付
|
イメージバージョン
|
組み込みライブラリバージョン
|
更新内容
|
|
2024年6月21日
|
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.4
タグ:chat-llm-webui:3.0
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.4-flash-attn
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.4-vllm
タグ:chat-llm-webui:3.0-vllm
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.4-vllm-flash-attn
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.4-blade
タグ:chat-llm-webui:3.0-blade
|
-
Torch:2.3.0
-
Torchvision:0.18.0
-
Transformers:4.41.2
-
vLLM:0.5.0.post1
-
vllm-flash-attn:2.5.9
-
ブレード:0.7.0
|
-
Rerank モデルのデプロイをサポートしました。
-
埋め込み、Rerank、LLM モデルについて、単独または組み合わせでのデプロイをサポートしました。
-
Transformers バックエンドが Deepseek-V2、Yi 1.5、および Qwen2 をサポートしました。
-
Qwen1.5 のモデルタイプを qwen1.5 に更新しました。
-
vLLM バックエンドが Qwen2 をサポートしました。
-
BladeLLM バックエンドが Llama3 および Qwen2 をサポートしました。
-
HuggingFace バックエンドがバッチ入力をサポートしました。
-
BladeLLM バックエンドが OpenAI Chat をサポートしました。
-
BladeLLM メトリクスへのアクセスに関する問題を修正しました。
-
Transformers バックエンドが FP8 モデルのデプロイをサポートしました。
-
Transformers バックエンドが、AWQ、HQQ、Quanto を含む複数の量子化ツールをサポートしました。
-
vLLM バックエンドが FP8 をサポートしました。
-
vLLM およびブレードの推論パラメーターがストップワードをサポートしました。
-
Transformers バックエンドが H シリーズ GPU と互換になりました。
|
|
2024年4月30日
|
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.3
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.3-flash-attn
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.3-vllm
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.3-vllm-flash-attn
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.3-blade
|
-
Torch:2.3.0
-
Torchvision:0.18.0
-
Transformers:4.40.2
-
vLLM:0.4.2
-
ブレード:0.5.1
|
-
埋め込みモデルのデプロイをサポートしました。
-
vLLM バックエンドがトークン使用量を返すようになりました。
-
Sentence-Transformers モデルのデプロイをサポートしました。
-
Transformers バックエンドが yi-9B、qwen2-moe、llama3、qwencode、qwen1.5-32G/110B、phi-3、および gemma-1.1-2/7B をサポートしました。
-
vLLM バックエンドが yi-9B、qwen2-moe、SeaLLM、llama3、および phi-3 をサポートしました。
-
ブレードバックエンドが qwen1.5 および SeaLLM をサポートしました。
-
LLM モデルと埋め込みモデルのマルチモデルデプロイをサポートしました。
-
Transformers バックエンド向けの flash-attn イメージをリリースしました。
-
vLLM バックエンド向けの flash-attn イメージをリリースしました。
|
|
2024年3月28日
|
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.2
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.2-vllm
-
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:3.0.2-blade
|
-
Torch:2.1.2
-
Torchvision:0.16.2
-
Transformers:4.38.2
-
vLLM:0.3.3
-
ブレード:0.4.8
|
-
ブレード推論バックエンドを導入しました。単一マシンのマルチ GPU および量子化構成をサポートします。
-
Transformers バックエンドが、tokenizer の chat template に基づく推論を実行するようになりました。
-
HF バックエンドが Multi-LoRA 推論をサポートしました。
-
ブレードが量子化モデルのデプロイをサポートしました。
-
ブレードがモデルを自動的にシャーディングするようになりました。
-
Transformers バックエンドが Deepseek および Gemma をサポートしました。
-
vLLM バックエンドが Deepseek および Gemma をサポートしました。
-
ブレードバックエンドが qwen1.5 および yi モデルをサポートしました。
vLLM および Blade イメージで、/metrics エンドポイントへのアクセスを有効にしました。
-
Transformers バックエンドのストリーミングレスポンスにトークン統計が含まれるようになりました。
|
|
2024年2月22日
|
|
-
Torch:2.1.2
-
Torchvision:0.16.2
-
Transformers:4.37.2
-
vLLM:0.3.0
|
-
vLLM の拡張パラメーター構成を追加し、すべての vLLM 推論パラメーターを実行時に変更できるようになりました。
-
vLLM が Multi-LoRA をサポートしました。
-
vLLM が量子化モデルのデプロイをサポートしました。
-
vLLM イメージから LangChain デモの依存関係を削除しました。
-
Transformers 推論バックエンドが qwen1.5 および qwen2 モデルをサポートしました。
-
vLLM 推論バックエンドが qwen1.5 および qwen2 モデルをサポートしました。
|
|
2024年1月23日
|
|
-
Torch:2.1.2
-
Torchvision:0.16.2
-
Transformers:4.37.2
-
vLLM:0.2.6
|
-
バックエンドイメージを分離し、個別にコンパイルおよびリリースできるようにしました。新しい BladeLLM バックエンドを導入しました。
-
標準の OpenAI API をサポートしました。
-
Baichuan などのモデルでパフォーマンスメトリクスをサポートしました。
-
yi-6b-chat、yi-34b-chat、secgpt などのモデルをサポートしました。
openai/v1/chat/completions エンドポイントを chatglm3 の履歴形式に対応させました。
-
非同期ストリーミングを最適化しました。
-
vLLM でサポートされるモデルの一覧を HuggingFace と同期しました。
-
バックエンド呼び出しインターフェイスを最適化しました。
-
エラーログを改善しました。
|
|
2023年12月6日
|
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:2.1
タグ:chat-llm-webui:2.1
|
-
Torch:2.0.1
-
Torchvision:0.15.2
-
Transformers:4.33.3
-
vLLM:0.2.0
|
-
HuggingFace バックエンドが、mistral、zephyr、yi-6b、yi-34b、qwen-72b、qwen-1.8b、qwen7b-int4、qwen14b-int4、qwen7b-int8、qwen14b-int8、qwen-72b-int4、qwen-72b-int8、qwen-1.8b-int4、および qwen-1.8b-int8 モデルをサポートしました。
-
vLLM バックエンドが Qwen および ChatGLM1/2/3 モデルをサポートしました。
-
HuggingFace 推論バックエンドがフラッシュアテンションをサポートしました。
-
ChatGLM シリーズモデルでパフォーマンスメトリクスをサポートしました。
-
ロール設定をサポートするために、--history-format コマンドライン引数を追加しました。
-
LangChain デモが Qwen モデルをサポートしました。
-
FastAPI のストリーミングインターフェイスを最適化しました。
|
|
2023年9月13日
|
eas-registry.cn-hangzhou.cr.aliyuncs.com/pai-eas/chat-llm-webui:2.0
タグ:chat-llm-webui:2.0
|
-
Torch:2.0.1+cu117
-
Torchvision:0.15.2+cu117
-
Transformers:4.33.3
-
vLLM:0.2.0
|
-
vLLM および HuggingFace の複数のバックエンドをサポートしました。
-
ChatLLM および Llama2 モデル向けの LangChain デモを追加しました。
-
Baichuan、Baichuan2、Qwen、Falcon、Llama2、ChatGLM、ChatGLM2、ChatGLM3、および yi モデルをサポートしました。
-
対話ストリーミング向けに HTTP および WebSocket をサポートしました。
-
非ストリーミングレスポンスに生成トークン数が含まれるようになりました。
-
すべてのモデルでマルチターン対話を有効化しました。
-
対話履歴のエクスポートをサポートしました。
-
System Prompt の設定と、テンプレートなしのプロンプト連結をサポートしました。
-
推論パラメーターを設定可能にしました。
-
推論時間を出力するログ向けのデバッグモードを追加しました。
-
vLLM バックエンドでは、単一マシンのマルチ GPU デプロイに対してテンソル並列処理 (TP) 方式がデフォルトになりました。
-
Float32、Float16、Int8、Int4 など、さまざまな精度でのモデルデプロイをサポートしました。
|