全部产品
Search
文档中心

大模型服务平台百炼:HappyOyster使用指南

更新时间:Sep 20, 2026

HappyOyster 世界模型使用指南:Adventure、Directing、Acting 三大模式的能力说明、效果展示与提示词编写方法。

概览

HappyOyster 是开放式世界模型系列,输入文本或图像即可实时生成可交互的数字世界,覆盖世界探索、实时导演、角色演绎三种模式。可前往 HappyOyster 官网 在线体验:

模式做什么输入输出
Adventure 世界探索以第一/第三人称进入生成的世界,自由移动、战斗、骑乘文本 + 首帧图实时可交互视频流
Directing 实时导演流式生成 3 分钟视频,中途随时注入指令改变剧情走向文本 / 首帧图 / 多图参考实时交互视频流,支持暂停、回溯、分支
Acting 角色演绎与生成的角色面对面实时对话,角色用表情、动作、语音回应文本 + 首帧图实时交互视频流

Adventure 世界探索

基于文本 + 首帧图输入,生成支持任意风格、多项互动的开放世界场景。支持第一人称与第三人称视角的实时位移与镜头控制。一张图配上一句描述,就能进入一个可移动、可战斗、可互动的世界,例如骑马、飞行、驾驶、探索不同风格的世界,创建时定义你想玩什么,世界就会回应什么。

效果展示

视角对比

第一人称第三人称
沉浸式 POV 探索,适合驾驶、潜行。能看到角色全身,适合动作冒险、角色扮演。

场景感知互动

模型会理解画面内容,根据场景中的对象开放对应玩法。

主体运动环境交互物理响应
冲刺、跳跃、下蹲、攻击(因角色类型而异)进入环境中的载具、触发场景机关碰撞、弹跳、重力等物理反馈

世界风格

支持任意风格的世界生成,以下是部分风格示例:

毛毡风-海岛游戏太空-月球漫步奇幻-空中飞行
卡通材质渲染,非写实风格探索低重力物理反馈,太空场景交互飞行、飞天扫把等奇幻世界交互
动物骑乘战斗与攻击载具出行
上下马、骑乘控制出拳、弓箭、枪械、魔法汽车、自行车、滑板

交互能力

能力说明
主体运动冲刺、跳跃、下蹲、攻击(动作因角色类型而异)
战斗出拳、弓箭、枪械、魔法、单人/双人打斗
骑乘与载具上下马、汽车、自行车、滑板
环境交互进入载具、物理碰撞响应
世界风格写实、动画、毛毡风、太空、奇幻等任意风格
视角第一人称(沉浸 POV)/ 第三人称(动作冒险)

提示词编写

两条核心原则:第一,场景里有什么,就有机会玩什么;第二,想要什么反应,就把反应一起写出来。没写到的对象玩不了,没写到的反应也演不出来。

创建描述按这 5 点来写,互动会更贴合预期:

  1. 视角: 先定第一人称还是第三人称。第一人称适合沉浸驾驶、POV 探索;第三人称能看到自己的角色,适合动作冒险、角色扮演。

  2. 你扮演谁: 写清主体角色的性别 / 身份 / 外形(如「身穿皮甲的女战士」)。第三人称尤其要写,角色长什么样直接决定动作风格。

  3. 武器 / 装备: 想战斗、攻击就写明手里拿什么:拳脚 / 长弓 / 枪械 / 魔法 / 长剑。角色拿的东西不同,能用的动作也不同。

  4. 对手与反应: 除了写清打谁,更要写出「命中之后会怎样」:对方踉跄后退 / 中招倒地 / 举盾格挡,以及想要的打击特效(火花迸溅、火焰喷出、冲击波)。模型会照着你写的反应去演,反应和特效写得越具体,打击感越强。

  5. 可交互物件: 想骑乘、驾驶,就让马、车、自行车、滑板等出现在画面里。物件没进画面,就没法上去玩。

提示词示例

第三人称-动作冒险

第三人称视角,一名身穿皮甲的女战士站在竞技场中央,手持长弓,
对面一头巨狼正向她扑来;箭矢命中时迸出火花,巨狼吃痛踉跄后退,
沙地扬尘,看台坐满观众。

可交互动作:拉弓射击、闪避、近身搏斗,命中有火花和巨狼受击反应。

第一人称-沉浸驾驶

第一人称视角,我坐在一辆复古老爷车的驾驶座,双手握着方向盘,
前方是黄昏的海岸公路;踩下油门时引擎轰鸣,车轮卷起路面尘土。

可交互动作:加速、转向、沿公路行驶,加速时有引擎声和扬尘反馈。

参考示例

首帧图提示词生成视频
末日生存写实风格的电影级游戏画面。第三人称越肩视角,一名穿着破旧深色皮夹克的男子站在废弃村庄的泥土小路上,手持霰弹枪呈战斗姿态。远处迷雾中,几个扭曲的人形生物正缓缓逼近。周围是坍塌的木屋、破败的风车和堆积的柴火,天空阴沉灰暗,整体氛围压抑恐怖,色调以灰褐和暗绿为主。

Directing 实时导演

基于文本、首帧图或多张参考图输入,流式生成最长 3 分钟视频。生成过程中可随时注入指令改变剧情走向,支持暂停、回溯和分支创作。引用上传的参考图可锁定角色和道具外观,保持全程一致。

效果展示

剧情演绎

单人场景故事双人场景故事
单角色独白或行动场景。两人对手戏,写实电影质感。

POV 沉浸互动

POV 户外探索写实人物互动
第一人称视角在户外环境中漫游。面对面与写实角色实时互动。

核心能力

能力说明
流式生成实时生成并播放,无需等待完整渲染
指令注入生成过程中随时插入新指令,改变人物动作、镜头调度、场景环境
暂停与回溯暂停后继续,或回溯到任意时间点重新演绎
多模态参考引用上传的参考图,锁定角色/道具外观,保持 3 分钟一致性

指令注入类型

类型示例说明
动作触发"她突然站起来。" / "他把杯子放下。"短句 + 明确动作,最稳定
镜头调度"切到面部特写。" / "镜头慢慢拉远。"用电影术语效果更精准
场景变化"开始下雨。" / "时间跳到傍晚。"注入环境变量改变氛围
新角色入场"门被推开,一个戴黑帽子的男人走进来。"写清外观 + 第一个动作

提示词编写

3 分钟视频需要结构化剧本。推荐六段式提示词结构:

段落名称作用
1世界观时空 + 类型 + 核心冲突,1-2 句定位叙事坐标
2人物性别/年龄/外形/服装/性格/情绪/音色 7 要素 + 参考图锁外观
3风格导演流派 / 调色 / 光线三锚点
4场景场景类型 / 环境氛围 / 布局构造 / 环境音四维度
5完整脚本设定锁死(视角/主体/音色/节奏 LOCK)+ 分镜安排(起/推/转/延/收 5 幕)
6负面清单不要出现的画面/声音元素

逐段写法

① 世界观-时空 + 类型 + 核心冲突
句式骨架:[年份 + 季节],[城市 / 具体地点],类型是 [叙事流派],核心冲突是 [一句话冲突]。

② 人物-7 要素 + 一致性
1-基本 性别 / 年龄 / 体型 / 气质
2-外形 发型发色 / 五官特征 / 重要标识(疤痕 / 痣 / 眼镜)
3-服装 上衣 / 下装 / 鞋 / 配饰,写得越具体一致性越稳
4-身份 职业 / 阶层 / 社会角色
5-性格 1-2个关键词(沉默寡言-急性子-表面强势)
6-当下情绪 这一刻他在想什么,烦什么,等什么
7-音色 / 嗓音 性别音 + 年龄段 + 口音 + 整体气质,多人对手戏必加

③ 风格-导演 / 调色 / 光线三锚点
1-导演 / 流派锚点 "日式家庭片质感"、"港式霓虹光影"、"硬派冷调科幻"
2-调色 "暖金色调偏低饱和"、"冷蓝主色 + 霓虹高光"
3-光线类型 "自然光为主"、"硬光顶光"、"窗光侧逆"

④ 场景-4 维度 + 关键物品参考
1-场景类型(室内独立咖啡馆 / 城郊废弃工厂 / 古代客栈大堂 / 学校天台)
2-环境氛围(温暖松弛 / 拥挤喧闹 / 阴冷压抑 / 静谧悬疑)
3-布局构造(桌椅摆位 / 关键道具位置 / 空间纵深 / 主要陈设)
4-环境音 2-3 种具体声音(室内 BGM + 远处自然音 + 偶发人声)

⑤ 完整脚本-设定锁死 + 分镜安排
a) 设定锁死-6 条推荐 LOCK
  VIEWPOINT LOCK  全程只用一种视角,不允许切换
  POV SELF-LOCK   POV 视角下不出现「我」的脸/全身/镜面倒影
  CAST LIMIT      同时入画主体 ≤ 3 人
  SUBJECT LOCK    人物服饰/发型/道具 3 分钟内不变
  VOICE LOCK      多人戏中每个角色音色固定,不互换
  PACE LOCK       单次静默/留白不超过 2 秒

b) 分镜安排-5 个分镜 × 4 个框架
  起 [0:00-0:10] HOOK 强开场,不平淡铺陈
  推 [0:10-0:50] 交代角色关系,引入第一个变量
  转 [0:50-1:40] 全片唯一一次意外(反转/冲突/抉择)
  延 [1:40-2:30] 情绪呼吸,密度可稍松但不完全静默
  收 [2:30-3:00] 一个画面/一句话/一个动作收尾,抛互动钩子

  每个分镜写清:
  [语境] 在发生什么 + 主角在哪在做什么 + 视觉锚点
  [关键台词] 格式:角色名(音色提示)"台词",多人戏每句标说话人
  [节奏要求] 可验收的硬指标,如"10 秒里至少 2 句台词"

⑥ 负面清单-不要出现什么
只写设定锁死推不出的特殊禁忌,不要重复正向设定。
画面禁忌:如"不要出现夜景 / 雨 / 汽车"
声音禁忌:不要加后期旁白 / 解说 / BGM 盖过人声

Acting 角色演绎

基于文本 + 首帧图输入,生成一个面对面的虚拟角色。用户说话时,角色用表情、动作和语音实时回应,长相、嗓音和性格保持 3 分钟不变。上传一张图,就能把心里的角色请到面前,开始一段实时对戏。

效果展示

Acting 的核心交互是「你和 TA 面对面」——你说话,TA 用表情、动作和台词实时回应,整段陪伴里 TA 始终是同一个人。

写实-面对面互动2D风格化-角色陪伴
写实风格角色,表情和语气随对话自然变化,全程外观锁定。动漫/插画等 2D 风格化角色,同样支持面对面实时对话,表情与语气自然变化。

核心能力

能力说明
实时对话用户说一句,角色用表情、动作、台词即时回应
面对面 POV默认第一人称视角,镜头始终对着角色的脸,用户不出镜
长程一致角色的长相、服饰、嗓音、性格保持 3 分钟不变,可上传图片精准锁定外观

核心交互展示

能力效果
实时对话你说一句,TA 立刻用表情、动作和台词回应,像真的在和你对话
面对面 POV画面对面始终是 TA 的脸,入画的只有你的手/前臂,注意力全在对面
外观锁定上传图片锁住 TA 的长相和关键道具,全程不换脸、不变声
情绪连续TA 的表情和语气会随对话推进自然变化,不是固定模板

提示词编写

Acting 的提示词聚焦于角色本身和你与角色的关系。按以下 5 个维度构造:

维度说明示例
人设性别/年龄/外形/服装/身份/性格「二十出头的年轻女性,长直黑发,穿米白色针织衫,温柔爱笑」
音色性别音 + 年龄段 + 口音 + 气质「年轻女声、清亮、带一点撒娇的鼻音」
关系与情境你和角色的关系 + 当下场景「恋人,傍晚靠窗的咖啡馆,暖黄灯光」
视角锁定POV + 「我」的手部特征「全程只入画她和我的右手(成年男性、骨节分明)」
开场角色的第一个动作和第一句话「她托着腮看向我,笑着说'你今天怎么来得这么早'」

提示词示例

第一人称面对面视角,对面是一位二十出头的年轻女性,长直黑发,
穿米白色针织衫,性格温柔爱笑;年轻女声、清亮、带一点撒娇的鼻音。
我们是恋人,此刻在傍晚靠窗的咖啡馆,暖黄灯光。
她托着腮看向我,笑着说"你今天怎么来得这么早"。
全程只入画她和我的右手(成年男性、骨节分明、无饰品),
我的脸和倒影一概不出现。

交互效果:和她实时对话、开玩笑、递杯子,她会用表情、动作和语气回应。

下一步

了解三种模式后,如需通过 API / SDK 接入,请参见 HappyOyster 概述。