glm-5 は、コーディングとエージェントのシナリオに特化したモデルです。744B の基盤上に構築され、非同期強化学習とスパースアテンション技術を活用することで、複雑なシステムエンジニアリングの分野でオープンソースの SOTA (最先端) を達成し、その能力は Claude Opus に迫ります。
推論サービスプロバイダー
glm-5 の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | テキスト |
モデル体験 | 対応 | Function Calling | 対応 |
構造化出力 | 非対応 | Web 検索 | 非対応 |
プレフィックス補完 | 非対応 | コンテキストキャッシュ | 対応 |
バッチ推論 | 非対応 | ファインチューニング | 非対応 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 169984 | 最大出力長 | 16384 |
コンテキストウィンドウ | 202752 | 最大入力長 (思考モード) | 169984 |
最大出力長 (思考モード) | 16384 | 最大思考チェーン長 | 32768 |
料金
このページには、期間限定のプロモーションを除いた、モデル API 呼び出しの基本料金のみが記載されています。プロモーション情報については、Model Studio コンソールをご参照ください。
中国 (北京)
32k<Input<=200k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.86 | 100 万トークンあたり |
出力 | 3.154 | 100 万トークンあたり |
入力 (暗黙的キャッシュ) | 0.172 | 100 万トークンあたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 500 |
TPM (1 分あたりのトークン数) | 1,000,000 |