← Back to blog

现在 AI 能做什么样的游戏:能力边界、素材、数值

AI游戏开发AI Game工程实践
Table of contents

封面:AI 做游戏,卡的不是写代码

我最近几个月都在做 AI Game 这个赛道,公司的核心业务就是这一块,这篇写一些我对这个game赛道 AI 能力边界的判断:AI 现在能做到什么程度、又会在哪里卡住,以及我做AI Game生成平台踩过的一些坑。

当模型来到fable 5、opus 5时代之后,几乎就能实现大部分游戏的ont-shot(一段比较专业的prompt直出游戏)。举个例子:七月的时候我一段prompt丢进去,直出了一个中国风水墨的修仙爬塔,并且让AI自己试玩,保证数值的合理性,最后数值确实很合理。

目前来说 AI 对于 Game 生成的能力界限是非常清楚的,而且这个界限跟游戏本身难不难关系不大。

一、决定上限的其实是引擎,不是模型

先把一个可能反直觉的结论放前面:AI 能不能帮你写游戏,取决于游戏的表示形式,而不是模型智能。 LLM 只会操作文本,所以引擎越接近纯文本,AI 越强;越依赖可视化编辑器,AI 越弱。

这里有两层原因:

  • 游戏里只有代码是文本,场景图、节点图、二进制资产 AI 都看不见,所以代码越多,Ai的掌控感越强,反之则越弱
  • 公开代码量决定模型熟练度,模型见过的代码越多,写得越稳。

按这个框架给主流引擎排个序:

  • 不依赖任何引擎,直接使用简单的Web栈,如:Three.js、Phaser等等
  • Godot 是引擎侧面上最适合 AI 的,纯文本场景加脚本、CLI 启动、体积小、MIT 协议,2025 年 GMTK 游戏 jam 的占比已经直逼 Unity。
  • Unity 靠语料量排第二,也支持 MCP 把场景层级和运行时状态翻译成文本喂给 Agent
  • Unreal 最难出效果,宏满天飞的 C++ 加二进制的 Blueprints。

所以我的判断是:选引擎比选工具重要得多,引擎决定 AI 游戏上限的八成。 不同模型的能力同质化很严重,头部模型挤在同一个水平区间,Agent 的差异主要在工作流程,而不在模型模型本身的智能,把游戏引擎选对是最重要的事情,后面省的事是几何级的。

1️⃣ 为什么现在看到的AI游戏几乎都是 H5 和 Canvas 这类页面小游戏

这些游戏生成简单只是表象,根子是它们技术栈的代码在训练数据里最密集。一个 Canvas 实现的爬塔或者消除,GitHub 上各种教程里躺着几万份变体,从渲染循环到碰撞判定到状态机,写法高度收敛,模型见过太多次,生成的时候几乎是在走熟路,很少会出现语法层面的问题。

反过来看一个完整的商业引擎项目,公开的完整工程几乎没有,能见到的都是片段和 demo。模型对它的了解是拼凑出来的,一到需要整体一致性的地方就容易出错。

判断 AI 在哪个品类强,看的不是这个品类难不难,是公开代码的量有多少。 这条不只对游戏成立,你换任何一个技术栈去问 AI,都会遵循同样的规律在。这也是为什么我不太相信 AI 马上能做 3A 这种说法,模型来到5时代(fable5\opus5)之后,对于Game来说,模型缺的不是智能,而是缺对应的大量公开工程数据。

2️⃣ 静态资源多的好做,动态素材多的难做

这条界限我测试下来非常稳定,也是我们团队的共识:游戏里静态元素越多越好做、生成效果越稳定;动态元素越多越容易出错,效果也很难保证。

好做的几类游戏:策略、爬塔、卡牌、放置、解谜、经营,这些游戏的画面主体是静态的,一张图放在那里,交互靠点击和数值变化推进,这几类游戏通常一次直出就有很不错的效果。

难做的几类游戏:动作、格斗、平台跳跃。这些游戏的核心体验在帧与帧之间,一个攻击动作要有起手、判定、收招,还要和物理法则、无敌帧、手感对齐。

本质上的差别是在动态素材游戏中需要极强的一致性,而且是好几种一致性同时成立:动画帧之间要连贯、动画和判定框要对齐、判定和玩家手感要对得上,AI 生成游戏的时候这几样是分开做的,最后生成游戏产物很容易其中的一环、或者多环无法衔接。

所以选题的时候先看这个游戏的体验落在静态还是动态上,落在动态的游戏,几乎很难一次性成,需要不断打磨效果,直到拥有足够的Game feel。

3️⃣ AI 深水区:联机、帧级同步、构建管线

按强弱区分,AI 的强弱区非常固定,玩法脚本、样板代码、shader、程序化生成、可见报错的 debug 是 AI 的强势区,这几类它确实做得又快又稳。

但多人联机、帧级音画同步、构建管线是固定弱势区,这几个地方依旧是模型的深水区,很难稳定的生成合适的效果。

当然,也不是说这部分完全无法落地,只是想要实现上述能力目前靠AI一把梭难度还是很大,需要在工程层面进行额外的加强处理,像是多人联机游戏我们平台就已经实现了

这其实和前面说的是同一个规律:联机和帧级同步需要的不是代码量,是跨进程的一致性判断,这类公开工程数据极少,AI 没有可学的东西。

二、代码已经不是瓶颈了,卡人的是素材和数值

这一条可能和很多人的直觉相反,页面小游戏这个量级的代码,现在的 coding 能力基本不用操心,写得出来、跑得起来、逻辑也对,几乎不会有瓶颈,代码层面大概只有两个点还有问题。

会出现的一种问题就是AI没办法发现自己游戏的非语法Bug,比如开屏可能有一个’开始’Button,我们经常会碰到的情况是这个Button无法点击、点击了没有反应;而AI意识不到这个问题,因为AI直接调用了Button对应的代码进行验证,而不是尝试mock一次点击,像这种非语法层面的Bug还是频繁出现。

另一种问题是AI的页面设计,经常会不尽人意,整体页面排版缺少美观性,并且经常不考虑页面各个元素的间距,盒子元素的宽度,导致页面经常会很挤或者非常松散,也会有文字溢出这种情况出现,这种情况可以提前给AI参考图来规避。

AI 生产力在小型项目上是真的,过了大约一万行或者耦合变紧之后会倒挂。 有实验数据,16 个资深开发者在成熟仓库上用 AI 反而慢了近两成,但自我感觉快了;高采用团队 PR 合并量翻倍的同时,review 时间也接近翻倍,所以代码不是瓶颈这个结论,只对你完全使用AI生成的页面小游戏成立。

真正决定AI游戏好不好玩的是除代码外的两样东西:游戏和数值,素材决定它看起来像不像个游戏,数值决定它玩起来是不是那个味儿,这两样东西都无法靠模型的代码生成解决。

三、如何稳定的生成游戏素材

4️⃣ 第一层:生图本身的失败率

作为一个AI 游戏生成平台,在工程层面我们通常会使用多种模型来生素材,对于这些不同的模型,构造一个统一的超集参数接口是必要的。游戏生图真正的难点是出图质量不稳、以及如何保证成套风格的一致性。

失败率高在游戏场景里比在别的场景里更要命。你要的不只是一张好图,是一整套风格一致的图:同一个角色的不同状态、同一套 UI 的不同按钮、同一个世界观的不同场景,单张达标率八成听着不低,但凑一套二十张全部达标的概率就很低了。

所以素材这一环真正的指标不是单张出图质量,是成套图片的一致性。 这两个指标的差距,是我在这条链路上花掉最多时间的地方。

5️⃣ 第二层:透明背景

游戏素材几乎都要透明底,角色、道具、UI 元素都得能叠在场景上。

出图模型给的是带背景的完整图,模型又不支持直接通过接口生成透明背景,需要使用程序进行抠图。

这一步我专门花时间做过透明素材的处理和导出联调,听起来是个小工序,实际它卡在整条流水线的关键一环:抠不干净,前面出图再好也用不了;批量处理不稳,就没法规模化出素材。

这类工序性的问题很容易被低估,因为有很多图形就是不规则的,尽可能的扣下不规则图形、保证最后的图片效果是一个挺复杂的工程。

6️⃣ 第三层:动画

角色要动起来,2D 有两条主要路线。

精灵图(序列帧)。一帧一张图,播起来就是动画。做法直白,美术自由度最高,代价是体积大、不能程序化插值、改一个动作要重画一整套。我搭了我们平台的精灵图生成能力,回到上面那条成套一致性问题:跨帧的角色漂移是硬伤,衣服细节、武器长度、面部都会变,作为动图容易有抖动、动作小等问题。

骨骼动画。给角色搭骨骼层级,把切片绑到骨头上,动画记录的是骨骼的关键帧变换。这条路业界主流工具是 Spine,导出骨骼数据加图集,各引擎都有 runtime,好处是文件小、动作可复用、能在程序里做过渡混合,一个受击动作可以从任何姿势自然接进去,但是AI没办法设计出骨骼的动作,会违反很多物理规则。AI 能帮你出切片素材,但骨骼怎么搭、每个动作的关键帧怎么设计,这是设计不是生成。它要的是结构化输出加动作设计的审美判断,而这类数据公开的极少。

我们最后采用的是精灵图路线,经过多版的调整,最后效果也还不错。

7️⃣ 音视频

BGM 和短音效(点击、受击、金币)现在 AI 能出可用的,成熟素材库也够用,这块不是瓶颈;粒子、shader 这类程序化特效本质是代码,AI 也可以完成。

真正还没解决的是让 Agent 理解音视频内容并据此做判断,生成和游戏风格匹配的背景音乐,挑选合适的短音效等等,以及在音频方面,使用专门的API或者模型效果依旧是大于通用大模型直出。

四、数值:AI 给的是均衡解,不是体验曲线

8️⃣ 为什么 AI 出的数值经常看起来合理

爬塔、卡牌、放置这类游戏的数值结构在公开资料里非常多:成长曲线、伤害公式、掉率设计、经济循环,教程和拆解文章一大堆,所以 AI 给出的初版数值通常是自洽的,不会出现一刀秒杀或者打三百下打不死的离谱情况。

但自洽和好玩是两件事,我的判断是 AI 倾向于给均衡解,各项数值互相平衡、曲线平滑。而游戏体验要的恰恰是有峰谷的曲线:某一关明显卡、过了之后一段爽、中间给一个能翻盘的变量。这种刻意的不均衡 AI 不会主动给,因为它优化的目标是合理,不是有起伏。

9️⃣ 数值怎么验,我觉得应该交给 agent

数值好不好,靠人手玩几局是验不出来的,样本太少。

比较靠谱的做法应该是跑模拟:写一个能自动玩的脚本或者 agent,跑几千局,看胜率分布、通关时长分布、卡关集中在哪一层。数值问题在分布图上一眼就能看出来,比人肉试有效得多。

它也正好是 agent 在游戏这个场景里比在别处更有意思的地方:游戏是少数能让 agent 自己跑出评估数据的软件形态。 现在很多模型发布都会让模型来做游戏也是同样的道理,游戏需要涉及到coding\素材生成\数值玩法设计等等,能够多维度的验证模型能,并且想要做好 game eval是非常有难度的,

五、我现在的判断

现在这个阶段,AI 能独立完成的是静态资源为主的页面小游戏,从代码到可玩,一次直出没问题。往动作类、往需要连贯动画的方向走,它交付的就不是成品而是半成品,人要补的正是最费时间的那部分。

代码这条链路对AI来说已经通了,素材和数值这两条还没有。

素材卡在成套一致性和动作设计,数值卡在没有便宜且合理的验证手段,接下来值得关注的不是模型会不会更聪明,是这两条链路上会不会出专门的工具:一个能稳定出成套一致素材的工具,一个能自动跑数值模拟或者游戏数值设计的工具。

还有一条给普通人的使用AI生成游戏的操作结论,也是我最近实践下来的:先选引擎再选工具,先把可玩的核心循环搓出来,尽量选择生成静态内容多的游戏,给 Agent 接上验证闭环(能自己跑游戏看结果)。