すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:HappyOyster ユーザーガイド

最終更新日:Sep 25, 2026

HappyOyster ワールドモデルユーザーガイド:Adventure、Directing、Actingモードの機能、ショーケース、およびプロンプト作成について。

概要

HappyOysterはオープンワールドモデルシリーズです。テキストや画像を入力すると、リアルタイムでインタラクティブなデジタルワールドを生成し、アドベンチャー、ディレクション、アクティングの3つのモードをカバーします。オンラインで試すにはHappyOysterウェブサイトにアクセスしてください。

モード機能入力出力
アドベンチャー(ワールド探索)一人称または三人称で生成された世界に入り、自由に移動、戦闘、騎乗できますテキスト + 初フレーム画像リアルタイムインタラクティブビデオストリーム
ディレクション(リアルタイムディレクション)3分のビデオをストリーミングし、いつでもコマンドを挿入してストーリーを変更できますテキスト / 初フレーム画像 / 複数画像参照一時停止、巻き戻し、分岐機能を備えたリアルタイムインタラクティブビデオストリーム
アクティング(キャラクターロールプレイ)表情、動作、音声で応答する生成されたキャラクターと対面で会話できますテキスト + 初フレーム画像リアルタイムインタラクティブビデオストリーム

アドベンチャー(ワールド探索)

テキストと初回フレーム画像の入力から、あらゆるスタイルのオープンワールドシーンを生成し、多様なインタラクションを提供します。リアルタイムの移動とカメラ操作を備えた一人称および三人称視点をサポートします。画像と1行の説明文だけで、移動、戦闘、インタラクションが可能なワールド、例えば乗馬、飛行、運転、様々なスタイルのワールド探索に入ることができます。作成時にプレイしたいものをwant定義すれば、ワールドがそれに応答します。

ショーケース

視点の比較

一人称三人称
没入型一人称視点探索 — ドライビングやステルスに適しています。キャラクターの全身を見ることができ、アクションアドベンチャーやロールプレイに適しています。

シーン認識インタラクション

モデルはフレーム内の内容を理解し、シーン内のオブジェクトに基づいて一致するゲームプレイを展開します。

主体のモーション環境インタラクション物理的反応
ダッシュ、ジャンプ、しゃがみ、攻撃(キャラクタータイプにより異なる)乗り物への搭乗、シーンのギミック発動衝突、バウンド、重力などの物理フィードバック

ワールドスタイル

あらゆるスタイルのワールド生成をサポートします。以下にいくつかの例を示します。

フェルト-アイランドゲーム宇宙-ムーンウォークファンタジー-飛行
カートン素材のレンダリング、非リアルな探索低重力物理、宇宙シーンのインタラクション飛行、空飛ぶほうきなどのファンタジーインタラクション
動物騎乗戦闘と攻撃乗り物
乗馬、降馬、騎乗操作パンチ、弓、銃器、魔法車、自転車、スケートボード

インタラクション

機能説明
主体のモーションダッシュ、ジャンプ、しゃがみ、攻撃(キャラクタータイプにより異なります)
戦闘素手、弓、銃器、魔法、ソロ/デュオ戦闘
騎乗と乗り物馬への乗降、車、自転車、スケートボード
環境インタラクション乗り物への搭乗、物理衝突応答
ワールドスタイルリアル、アニメ、フェルト、宇宙、ファンタジーなど、あらゆるスタイル
視点一人称(没入型POV) / 三人称(アクションアドベンチャー)

プロンプトの作成

2つの基本原則:第一に、シーンにあるものだけがプレイ対象となります。第二に、want反応はすべて記述します。記述しないオブジェクトはプレイ対象にならず、記述しない反応は実行されません。

以下の5つのポイントに沿って制作の記述を書くと、インタラクションがより期待に沿ったものになります。

  1. **視点:**まず一人称か三人称かを決定します。一人称は没入型ドライビングや一人称視点の探索に適しています。三人称は自分のキャラクターを見ることができ、アクションアドベンチャーやロールプレイに適しています。

  2. **プレイするキャラクター:**主人公の性別/アイデンティティ/外見を明記します(例:「革鎧を纏った女戦士」)。これは特に三人称において重要であり、キャラクターの外見がモーションスタイルを直接決定するためです。

  3. **武器/装備:**戦闘や攻撃をwant場合、手に持っているものを明記します:素手/長弓/銃器/魔法/剣。アイテムが異なれば、利用可能なアクションも異なります。

  4. **相手と反応:**誰を攻撃するかだけでなく、「命中後に何が起きるか」を記述します。相手がよろめく/衝撃で倒れる/盾を上げて防御する、さらにwant衝撃エフェクト(火花、噴き出す炎、衝撃波)を記述します。モデルはあなたが記述した反応を実行します。反応とエフェクトが具体的であるほど、衝撃力が強くなります。

  5. **インタラクション可能なオブジェクト:**騎乗や運転をwant場合、馬、車、自転車、スケートボードなどをフレーム内に登場させます。オブジェクトがフレーム内にない場合、それに乗ることはできません。

プロンプト例

三人称-アクションアドベンチャー

Third-person view: a female warrior in leather armor stands at the center of
an arena, holding a longbow, as a giant wolf lunges at her; sparks burst when
the arrow lands, the wolf flinches and stumbles back in pain, dust kicks up
from the sand, and the stands are packed with spectators.

利用可能なインタラクション:抜銃と射撃、回避、近接戦闘。命中すると火花が散り、狼の被弾リアクションが発生します。

一人称-没入型ドライビング

First-person view: I sit in the driver's seat of a vintage classic car, both
hands on the wheel, a dusk coastal highway ahead; the engine roars as I hit the
gas, and the wheels kick up dust from the road.

利用可能なインタラクション:加速、ステアリング操作、ハイウェイ走行。加速時にはエンジン音と土煙のフィードバックがあります。

参考例

初回フレームプロンプト生成された動画
ポストアポカリプスサバイバル写実的なシネマティックゲームビジュアル。三人称オーバーザショルダー視点、使い古された暗いレザージャケットを着た男が、廃墟の村の未舗装道路に立ち、戦闘態勢でショットガンを構えています。遠くの霧の中では、数体の歪んだ人型生物がゆっくりと近づいてきています。周囲には崩壊した木造家屋、廃墟となった風車、積み上げられた薪があります。空は曇って暗く、全体的な雰囲気は圧迫感と恐怖に満ちており、色調は主に灰褐色と暗緑色です。

ディレクション(リアルタイムディレクション)

テキスト、初回フレーム画像、または複数の参照画像から、最大3分の動画をストリーミングします。生成中のいつでもコマンドを挿入してストーリーの方向性を変更でき、一時停止、巻き戻し、分岐をサポートします。アップロードした画像を参照してキャラクター/小道具の外見を固定し、完全な一貫性を保ちます。

ショーケース

ストーリーテリング

1キャラクターシーン2キャラクターシーン
1キャラクターのモノローグまたはアクションシーン。2キャラクターの会話、リアルな映画のような質感。

一人称視点の没入型インタラクション

一人称視点の屋外探索リアルなキャラクターインタラクション
一人称視点での屋外環境の散策。リアルなキャラクターとの対面リアルタイムインタラクション。

コア機能

機能説明
ストリーミング生成リアルタイム生成と再生、完全なレンダリングを待つ必要はありません
コマンド挿入生成中にいつでも新しいコマンドを挿入して、キャラクターの動作、カメラワーク、またはシーンの環境を変更できます
一時停止と巻き戻し一時停止してから続行するか、任意のポイントまで巻き戻して再実行します
マルチモーダル参照アップロードされた画像を参照して、キャラクター/小道具の外観をロックし、3分間の一貫性を維持します

コマンド挿入タイプ

タイプ例備考
アクション トリガー「彼女は突然立ち上がる。」/「彼はカップを置く。」短く明確なアクション、最も信頼性が高い
カメラワーク「顔のクローズアップにカット。」/「カメラをゆっくりと引く。」シネマティック用語の方がより正確です
シーン変更「雨が降り始める。」/「時間は夕暮れにジャンプする。」環境変数を挿入してムードを変えます
新しいキャラクター「ドアが押し開けられ、黒い帽子を被った男が入ってくる。」外観と最初のアクションを明確に記述します

プロンプトの作成

3分の動画には構成された脚本が必要です。6部構成のプロンプト構造を推奨します。

パート名前目的
1世界観時空 + ジャンル + 中心的な競合、1-2文で物語の座標を設定します
2キャラクター性別/年齢/外観/服装/性格/感情/音声 — 7つの必須要素 + 外観をロックするための参照画像
3スタイル監督 / カラーグレード / 照明 — 3つのアンカー
4シーンシーンタイプ / 周囲のムード / レイアウト / 環境音 — 4つの次元
5フルスクリプト設定ロック(視点/被写体/音声/ペースのロック)+ ショットプラン(オープニング/展開/転換/維持/クロージング — 5幕)
6ネガティブリスト表示/再生してはならない画像/音声要素

セクションごと

① World-Time-space + genre + core conflict
Sentence skeleton: [Year + season], [city / specific location], the genre is [narrative style], the core conflict is [one-line conflict].

② Character-7 essentials + consistency
1-Basics — gender / age / build / temperament
2-Appearance — hairstyle & color / facial features / key identifiers (scar / mole / glasses)
3-Clothing — top / bottom / shoes / accessories; the more specific, the more stable the consistency
4-Identity — occupation / class / social role
5-Personality — 1-2 keywords (reserved-hot-tempered-outwardly tough)
6-Current emotion — what they're thinking, bothered by, or waiting for in this moment
7-Voice / timbre — gendered voice + age range + accent + overall feel; a must for multi-character scenes

③ Style-Three anchors: director / color grade / lighting
1-Director / genre anchor — "Japanese family-drama texture," "Hong Kong neon light and shadow," "hard-edged cold-tone sci-fi"
2-Color grade — "warm gold tone, low saturation," "cool blue base + neon highlights"
3-Lighting type — "natural light dominant," "hard top light," "side back-light from a window"

④ Scene-4 dimensions + key-item reference
1-Scene type (indie indoor café / abandoned suburban factory / ancient inn hall / school rooftop)
2-Ambient mood (warm and relaxed / crowded and noisy / cold and oppressive / quiet and suspenseful)
3-Layout (table & chair placement / key prop positions / spatial depth / main furnishings)
4-Ambient sound — 2-3 specific sounds (indoor BGM + distant nature sound + occasional voices)

⑤ Full script-Settings lock + shot plan
a) Settings lock-6 recommended LOCKs
  VIEWPOINT LOCK  Use a single viewpoint throughout; no switching
  POV SELF-LOCK   In POV, "my" face / full body / mirror reflection never appears
  CAST LIMIT      ≤ 3 subjects in frame at once
  SUBJECT LOCK    Character clothing / hairstyle / props unchanged for 3 minutes
  VOICE LOCK      In multi-character scenes, each voice stays fixed; no swapping
  PACE LOCK       No single silence / pause exceeds 2 seconds

b) Shot plan-5 shots × 4 frames
  Open   [0:00-0:10] HOOK — strong opening, no flat exposition
  Build  [0:10-0:50] Establish character relationships; introduce the first variable
  Turn   [0:50-1:40] The film's one and only surprise (reversal / conflict / choice)
  Sustain[1:40-2:30] Emotional breathing room; density can thin but never fully silent
  Close  [2:30-3:00] End on one image / one line / one action; throw an interaction hook

  Each shot specifies:
  [Context] What's happening + where the lead is and what they're doing + visual anchor
  [Key lines] Format: CharacterName(voice cue) "line"; in multi-character scenes, mark the speaker
  [Pacing] Verifiable hard metrics, e.g., "at least 2 lines in 10 seconds"

⑥ Negative list-What not to show
Only state special taboos that can't be derived from the settings lock; don't repeat positive settings.
Image taboos: e.g., "no night scenes / rain / cars"
Sound taboos: no post-production voiceover / narration / BGM drowning out voices

アクティング(キャラクターロールプレイ)

テキストと初回フレーム画像の入力から、対面型のバーチャルキャラクターを生成します。あなたが話しかけると、キャラクターは表情、動作、声でリアルタイムに応答し、外見、声、性格は3分間一貫して維持されます。画像をアップロードして、思い描いたキャラクターを具現化し、リアルタイムの会話を始めましょう。

ショーケース

アクティングのコアインタラクションは「あなたとキャラクターの対面」です。あなたが話しかけると、キャラクターは表情、動作、セリフでリアルタイムに応答します。セッション中、キャラクターは常に同じ人物です。

リアル-対面2D様式化-コンパニオン
リアルなキャラクター。会話に合わせて表情や声色が自然に変化し、外見は最後まで固定されます。2D様式化アニメ/イラスト調キャラクター — 自然な表情と声色の変化を伴う対面リアルタイム会話もサポートします。

コア機能

機能説明
リアルタイム対話あなたがセリフを言うと、キャラクターが表情、動作、セリフで即座に応答します
対面POVデフォルトは一人称視点、カメラは常にキャラクターの顔に向いており、ユーザーは画面に映りません
長期的な一貫性キャラクターの外観、服装、音声、性格は3分間変わらずに維持されます。画像をアップロードして外観を正確にロックします

コアインタラクション

機能効果
リアルタイム対話あなたがセリフを言うと、キャラクターが表情、動作、セリフで即座に応答します。まるで実際の会話のようです
対面POVフレームは常にキャラクターの顔に向いており、あなたの腕/前腕のみがフレームに入り、キャラクターに注意を向けさせます
外観ロック画像をアップロードしてキャラクターの外観と重要な小道具をロックします。全体を通して顔や音声の変化はありません
感情の連続性会話が進むにつれて、キャラクターの表情や口調は自然に変化します。固定されたテンプレートではありません

プロンプトの作成

アクティングのプロンプトは、キャラクター自体とあなたとキャラクターの関係性に焦点を当てます。以下の5つの次元に沿って構成します。

次元説明例
ペルソナ性別/年齢/外観/服装/アイデンティティ/性格"二十代前半の若い女性、長いストレートの黒髪、クリーム色のニットセーターを着用、穏やかで笑顔"
音声性別のある音声 + 年齢層 + アクセント + 気質「若い女性の声、明るく、少しはにかんだような鼻声」
関係性と設定キャラクターとの関係性 + 現在のシーン「恋人同士、夕暮れの窓際のカフェ、暖かい黄色い光」
視点ロックPOV + 「自分」の手の特徴「全体を通して、彼女と私の右手のみがフレームに入る(成人男性、はっきりとした指の関節)」
オープニングキャラクターの最初の動作と最初のセリフ「彼女は顎に手を当て、私を見て、笑顔でこう言います。『今日はこんなに早く来たのね』」

プロンプト例

First-person face-to-face view. Opposite me is a young woman in her early
twenties, long straight black hair, wearing a cream knit sweater, gentle and
smiley; young female voice, bright, with a slightly coy nasal tone.
We are lovers, right now in a café by the window at dusk, warm yellow light.
She rests her chin on her hand, looks at me, and says with a smile:
"You're here so early today."
Throughout, only she and my right hand enter frame (adult male, well-defined
knuckles, no accessories); my face and reflection never appear.

インタラクション:リアルタイムで彼女と会話したり、冗談を言ったり、カップを渡したりします。彼女は表情、動作、声色で応答します。

次のステップ

3つのモードを理解したら、API / SDKによる統合についてはHappyOysterの概要を参照してください。