HappyOyster 世界模型使用指南:Adventure、Directing、Acting 三大模式的能力说明、效果展示与提示词编写方法。
概览
HappyOyster 是开放式世界模型系列,输入文本或图像即可实时生成可交互的数字世界,覆盖世界探索、实时导演、角色演绎三种模式。可前往 HappyOyster 官网 在线体验:
| 模式 | 做什么 | 输入 | 输出 |
|---|---|---|---|
| Adventure 世界探索 | 以第一/第三人称进入生成的世界,自由移动、战斗、骑乘 | 文本 + 首帧图 | 实时可交互视频流 |
| Directing 实时导演 | 流式生成 3 分钟视频,中途随时注入指令改变剧情走向 | 文本 / 首帧图 / 多图参考 | 实时交互视频流,支持暂停、回溯、分支 |
| Acting 角色演绎 | 与生成的角色面对面实时对话,角色用表情、动作、语音回应 | 文本 + 首帧图 | 实时交互视频流 |
Adventure 世界探索
基于文本 + 首帧图输入,生成支持任意风格、多项互动的开放世界场景。支持第一人称与第三人称视角的实时位移与镜头控制。一张图配上一句描述,就能进入一个可移动、可战斗、可互动的世界,例如骑马、飞行、驾驶、探索不同风格的世界,创建时定义你想玩什么,世界就会回应什么。
效果展示
视角对比
| 第一人称 | 第三人称 |
|---|---|
| 沉浸式 POV 探索,适合驾驶、潜行。 | 能看到角色全身,适合动作冒险、角色扮演。 |
场景感知互动
模型会理解画面内容,根据场景中的对象开放对应玩法。
| 主体运动 | 环境交互 | 物理响应 |
|---|---|---|
| 冲刺、跳跃、下蹲、攻击(因角色类型而异) | 进入环境中的载具、触发场景机关 | 碰撞、弹跳、重力等物理反馈 |
世界风格
支持任意风格的世界生成,以下是部分风格示例:
| 毛毡风-海岛游戏 | 太空-月球漫步 | 奇幻-空中飞行 |
|---|---|---|
| 卡通材质渲染,非写实风格探索 | 低重力物理反馈,太空场景交互 | 飞行、飞天扫把等奇幻世界交互 |
| 动物骑乘 | 战斗与攻击 | 载具出行 |
|---|---|---|
| 上下马、骑乘控制 | 出拳、弓箭、枪械、魔法 | 汽车、自行车、滑板 |
交互能力
| 能力 | 说明 |
|---|---|
| 主体运动 | 冲刺、跳跃、下蹲、攻击(动作因角色类型而异) |
| 战斗 | 出拳、弓箭、枪械、魔法、单人/双人打斗 |
| 骑乘与载具 | 上下马、汽车、自行车、滑板 |
| 环境交互 | 进入载具、物理碰撞响应 |
| 世界风格 | 写实、动画、毛毡风、太空、奇幻等任意风格 |
| 视角 | 第一人称(沉浸 POV)/ 第三人称(动作冒险) |
提示词编写
两条核心原则:第一,场景里有什么,就有机会玩什么;第二,想要什么反应,就把反应一起写出来。没写到的对象玩不了,没写到的反应也演不出来。
创建描述按这 5 点来写,互动会更贴合预期:
-
视角: 先定第一人称还是第三人称。第一人称适合沉浸驾驶、POV 探索;第三人称能看到自己的角色,适合动作冒险、角色扮演。
-
你扮演谁: 写清主体角色的性别 / 身份 / 外形(如「身穿皮甲的女战士」)。第三人称尤其要写,角色长什么样直接决定动作风格。
-
武器 / 装备: 想战斗、攻击就写明手里拿什么:拳脚 / 长弓 / 枪械 / 魔法 / 长剑。角色拿的东西不同,能用的动作也不同。
-
对手与反应: 除了写清打谁,更要写出「命中之后会怎样」:对方踉跄后退 / 中招倒地 / 举盾格挡,以及想要的打击特效(火花迸溅、火焰喷出、冲击波)。模型会照着你写的反应去演,反应和特效写得越具体,打击感越强。
-
可交互物件: 想骑乘、驾驶,就让马、车、自行车、滑板等出现在画面里。物件没进画面,就没法上去玩。
提示词示例
第三人称-动作冒险
第三人称视角,一名身穿皮甲的女战士站在竞技场中央,手持长弓,
对面一头巨狼正向她扑来;箭矢命中时迸出火花,巨狼吃痛踉跄后退,
沙地扬尘,看台坐满观众。
可交互动作:拉弓射击、闪避、近身搏斗,命中有火花和巨狼受击反应。
第一人称-沉浸驾驶
第一人称视角,我坐在一辆复古老爷车的驾驶座,双手握着方向盘,
前方是黄昏的海岸公路;踩下油门时引擎轰鸣,车轮卷起路面尘土。
可交互动作:加速、转向、沿公路行驶,加速时有引擎声和扬尘反馈。
参考示例
| 首帧图 | 提示词 | 生成视频 |
|---|---|---|
![]() | 写实风格的电影级游戏画面。第三人称越肩视角,一名穿着破旧深色皮夹克的男子站在废弃村庄的泥土小路上,手持霰弹枪呈战斗姿态。远处迷雾中,几个扭曲的人形生物正缓缓逼近。周围是坍塌的木屋、破败的风车和堆积的柴火,天空阴沉灰暗,整体氛围压抑恐怖,色调以灰褐和暗绿为主。 |
Directing 实时导演
基于文本、首帧图或多张参考图输入,流式生成最长 3 分钟视频。生成过程中可随时注入指令改变剧情走向,支持暂停、回溯和分支创作。引用上传的参考图可锁定角色和道具外观,保持全程一致。
效果展示
剧情演绎
| 单人场景故事 | 双人场景故事 |
|---|---|
| 单角色独白或行动场景。 | 两人对手戏,写实电影质感。 |
POV 沉浸互动
| POV 户外探索 | 写实人物互动 |
|---|---|
| 第一人称视角在户外环境中漫游。 | 面对面与写实角色实时互动。 |
核心能力
| 能力 | 说明 |
|---|---|
| 流式生成 | 实时生成并播放,无需等待完整渲染 |
| 指令注入 | 生成过程中随时插入新指令,改变人物动作、镜头调度、场景环境 |
| 暂停与回溯 | 暂停后继续,或回溯到任意时间点重新演绎 |
| 多模态参考 | 引用上传的参考图,锁定角色/道具外观,保持 3 分钟一致性 |
指令注入类型
| 类型 | 示例 | 说明 |
|---|---|---|
| 动作触发 | "她突然站起来。" / "他把杯子放下。" | 短句 + 明确动作,最稳定 |
| 镜头调度 | "切到面部特写。" / "镜头慢慢拉远。" | 用电影术语效果更精准 |
| 场景变化 | "开始下雨。" / "时间跳到傍晚。" | 注入环境变量改变氛围 |
| 新角色入场 | "门被推开,一个戴黑帽子的男人走进来。" | 写清外观 + 第一个动作 |
提示词编写
3 分钟视频需要结构化剧本。推荐六段式提示词结构:
| 段落 | 名称 | 作用 |
|---|---|---|
| 1 | 世界观 | 时空 + 类型 + 核心冲突,1-2 句定位叙事坐标 |
| 2 | 人物 | 性别/年龄/外形/服装/性格/情绪/音色 7 要素 + 参考图锁外观 |
| 3 | 风格 | 导演流派 / 调色 / 光线三锚点 |
| 4 | 场景 | 场景类型 / 环境氛围 / 布局构造 / 环境音四维度 |
| 5 | 完整脚本 | 设定锁死(视角/主体/音色/节奏 LOCK)+ 分镜安排(起/推/转/延/收 5 幕) |
| 6 | 负面清单 | 不要出现的画面/声音元素 |
逐段写法
① 世界观-时空 + 类型 + 核心冲突
句式骨架:[年份 + 季节],[城市 / 具体地点],类型是 [叙事流派],核心冲突是 [一句话冲突]。
② 人物-7 要素 + 一致性
1-基本 性别 / 年龄 / 体型 / 气质
2-外形 发型发色 / 五官特征 / 重要标识(疤痕 / 痣 / 眼镜)
3-服装 上衣 / 下装 / 鞋 / 配饰,写得越具体一致性越稳
4-身份 职业 / 阶层 / 社会角色
5-性格 1-2个关键词(沉默寡言-急性子-表面强势)
6-当下情绪 这一刻他在想什么,烦什么,等什么
7-音色 / 嗓音 性别音 + 年龄段 + 口音 + 整体气质,多人对手戏必加
③ 风格-导演 / 调色 / 光线三锚点
1-导演 / 流派锚点 "日式家庭片质感"、"港式霓虹光影"、"硬派冷调科幻"
2-调色 "暖金色调偏低饱和"、"冷蓝主色 + 霓虹高光"
3-光线类型 "自然光为主"、"硬光顶光"、"窗光侧逆"
④ 场景-4 维度 + 关键物品参考
1-场景类型(室内独立咖啡馆 / 城郊废弃工厂 / 古代客栈大堂 / 学校天台)
2-环境氛围(温暖松弛 / 拥挤喧闹 / 阴冷压抑 / 静谧悬疑)
3-布局构造(桌椅摆位 / 关键道具位置 / 空间纵深 / 主要陈设)
4-环境音 2-3 种具体声音(室内 BGM + 远处自然音 + 偶发人声)
⑤ 完整脚本-设定锁死 + 分镜安排
a) 设定锁死-6 条推荐 LOCK
VIEWPOINT LOCK 全程只用一种视角,不允许切换
POV SELF-LOCK POV 视角下不出现「我」的脸/全身/镜面倒影
CAST LIMIT 同时入画主体 ≤ 3 人
SUBJECT LOCK 人物服饰/发型/道具 3 分钟内不变
VOICE LOCK 多人戏中每个角色音色固定,不互换
PACE LOCK 单次静默/留白不超过 2 秒
b) 分镜安排-5 个分镜 × 4 个框架
起 [0:00-0:10] HOOK 强开场,不平淡铺陈
推 [0:10-0:50] 交代角色关系,引入第一个变量
转 [0:50-1:40] 全片唯一一次意外(反转/冲突/抉择)
延 [1:40-2:30] 情绪呼吸,密度可稍松但不完全静默
收 [2:30-3:00] 一个画面/一句话/一个动作收尾,抛互动钩子
每个分镜写清:
[语境] 在发生什么 + 主角在哪在做什么 + 视觉锚点
[关键台词] 格式:角色名(音色提示)"台词",多人戏每句标说话人
[节奏要求] 可验收的硬指标,如"10 秒里至少 2 句台词"
⑥ 负面清单-不要出现什么
只写设定锁死推不出的特殊禁忌,不要重复正向设定。
画面禁忌:如"不要出现夜景 / 雨 / 汽车"
声音禁忌:不要加后期旁白 / 解说 / BGM 盖过人声
Acting 角色演绎
基于文本 + 首帧图输入,生成一个面对面的虚拟角色。用户说话时,角色用表情、动作和语音实时回应,长相、嗓音和性格保持 3 分钟不变。上传一张图,就能把心里的角色请到面前,开始一段实时对戏。
效果展示
Acting 的核心交互是「你和 TA 面对面」——你说话,TA 用表情、动作和台词实时回应,整段陪伴里 TA 始终是同一个人。
| 写实-面对面互动 | 2D风格化-角色陪伴 |
|---|---|
| 写实风格角色,表情和语气随对话自然变化,全程外观锁定。 | 动漫/插画等 2D 风格化角色,同样支持面对面实时对话,表情与语气自然变化。 |
核心能力
| 能力 | 说明 |
|---|---|
| 实时对话 | 用户说一句,角色用表情、动作、台词即时回应 |
| 面对面 POV | 默认第一人称视角,镜头始终对着角色的脸,用户不出镜 |
| 长程一致 | 角色的长相、服饰、嗓音、性格保持 3 分钟不变,可上传图片精准锁定外观 |
核心交互展示
| 能力 | 效果 |
|---|---|
| 实时对话 | 你说一句,TA 立刻用表情、动作和台词回应,像真的在和你对话 |
| 面对面 POV | 画面对面始终是 TA 的脸,入画的只有你的手/前臂,注意力全在对面 |
| 外观锁定 | 上传图片锁住 TA 的长相和关键道具,全程不换脸、不变声 |
| 情绪连续 | TA 的表情和语气会随对话推进自然变化,不是固定模板 |
提示词编写
Acting 的提示词聚焦于角色本身和你与角色的关系。按以下 5 个维度构造:
| 维度 | 说明 | 示例 |
|---|---|---|
| 人设 | 性别/年龄/外形/服装/身份/性格 | 「二十出头的年轻女性,长直黑发,穿米白色针织衫,温柔爱笑」 |
| 音色 | 性别音 + 年龄段 + 口音 + 气质 | 「年轻女声、清亮、带一点撒娇的鼻音」 |
| 关系与情境 | 你和角色的关系 + 当下场景 | 「恋人,傍晚靠窗的咖啡馆,暖黄灯光」 |
| 视角锁定 | POV + 「我」的手部特征 | 「全程只入画她和我的右手(成年男性、骨节分明)」 |
| 开场 | 角色的第一个动作和第一句话 | 「她托着腮看向我,笑着说'你今天怎么来得这么早'」 |
提示词示例
第一人称面对面视角,对面是一位二十出头的年轻女性,长直黑发,
穿米白色针织衫,性格温柔爱笑;年轻女声、清亮、带一点撒娇的鼻音。
我们是恋人,此刻在傍晚靠窗的咖啡馆,暖黄灯光。
她托着腮看向我,笑着说"你今天怎么来得这么早"。
全程只入画她和我的右手(成年男性、骨节分明、无饰品),
我的脸和倒影一概不出现。
交互效果:和她实时对话、开玩笑、递杯子,她会用表情、动作和语气回应。
下一步
了解三种模式后,如需通过 API / SDK 接入,请参见 HappyOyster 概述。
