我正在玩GPT-5.6 sol和Image-2的副业项目,结果我开发了一个叫做World Scroll的小技能。相比于生成单个图片,你可以编写一个短脚本,将几个场景连接起来,生成它们看起来像同一个地方,然后让视频模型填充它们之间的运动。结果是,页面上滚动等于在世界中行走。详细信息,因为我知道有人会问: * 静止图像:GPT-5.6 sol,图像-2。关键在于在提示中非常明确地描述光照、颜色温度和摄像机角度,以便5个单独的生成看起来像一个连续的场景,而不是5个随机的幻想图片。 * 过渡:Seedance 2.0,将静止图像作为每个片段的起始/结束帧。 * 成本:大约每个过渡视频2美元,整个项目约10美元。 * 前端只是一个滚动驱动的HTML页面。滚动位置映射到世界中的你的位置。我选择了5个经典的D&D场景,并写了一个小脚本将它们串联起来: 1.废弃的门——夕阳时分的老矮人门,楼梯消失在黑暗中。下一次你要走下去之前的最后一点光线。 2.晶晶深渊——一个巨大的螺旋深渊,蓝晶体在墙壁上冷光闪烁,瀑布流入浓雾,使你无法看到底部。 3.真菌丛林——深渊底部开出一个更大的真菌丛林,高于树的蘑菇,漂浮的孢子像尘埃一样漂浮。 4.深渊之城——没有地面的城市,只有桥梁和塔楼穿过空中,橙色光从窗户中闪烁。 5.龙圣所——世界的底部,经过淹没的废墟,一个龙围绕着自己的蛋围绕着宝藏,宝藏比上面的城市还要老。 我还卡住了两个问题:如果场景之间的光照或地理距离超过一步,会出现一致性漂移;视频模型有时会在起始/结束帧之间发明不符合两端的几何学。锁定摄像机角度在提示中帮助了我,但这不是一个真正的解决方案。