游戏引擎代码语料全景调研:公开数据集、代码转语料工具链与多模态空白

1153 字
6 分钟
游戏引擎代码语料全景调研:公开数据集、代码转语料工具链与多模态空白

要训练一个懂游戏引擎的代码模型,第一个问题是:公开语料到底有多少、质量如何? 这篇调研系统扫了一遍 HuggingFace 和 GitHub 上主流游戏引擎的代码数据集,顺带盘点了”把代码仓库变成训练语料”的工具链,最后落到一个重要结论:游戏引擎方向的多模态语料目前是空白。

一、主流引擎的公开语料#

引擎公开语料
Godot
Unity✅ 多个现成指令集
Unreal✅ UE5 代码/QA 数据集
RPG Maker✅ MV/XP 数据集
Roblox/Luau

Godot#

数据集体积许可类型
icici121/godot-gdscript-dataset629MBapache-2.0项目源码(最热门)
wallstoneai/godot-gdscript-dataset629MBapache-2.0同上同源
minosu/godot_dodo_4x_60k12MBmit6 万条「指令→GDScript」对
glaiveai/godot_4_docs5MBGodot4 文档
bunnycore/Gd-Script、dotfantasy/godot-code 等GDScript 代码/片段

Unity#

数据集体积许可类型
vishnuOI/unity-dev-instructions75MBcc-by-4.048,929 条指令-代码对
Hypersniper/unity_api_2022_3544MBapache-2.0API 文档
KaQyn/unity_stack177MB多重C# 代码
AmnaHassan/…GDD-Code-Pairs5MB代码↔游戏设计文档
neph1/Unity_Code_QnA、robertzeng/unity3ddoc 等代码/QA/文档

Unreal Engine#

数据集体积许可类型
AdamCodd/unreal-engine-5-raw405MBapache-2.0UE5 原始代码
AdamCodd/unreal-engine-5-code14MBapache-2.0UE5 清洗后代码
olympusmonsgames/unreal-engine-5-code-split144MB代码(切分版)
TunstallTensor/unreal-engine-5.7-qa150MBmitUE5.7 QA
KoeYe/UnrealPythonCode 等Python/UnrealScript/文档

RPG Maker 与其他#

数据集体积许可类型
NintenHero/RPG-Maker-MV-Data250MBcc-by-nc-sa-4.0MV 工程数据
NintenHero/RPG-Maker-XP-Data29MBXP 工程数据
GitHub: rpgtkoolmv/corescript 等引擎核心 JS

衍生方向还有 Roblox/Luau(Roblox/luau_corpus 46MB、TorpedoSoftware/the-luau-stack 104MB 等)、通用 gamedev(mlfoundations-dev/gamedev_* 系列最大 100 万样本)、以及 LOVE2D / Bevy / Pygame / Verse-UEFN 的零散数据集。

二、代码→语料的工具链#

拿到代码仓库之后,怎么变成模型能吃的语料?分两类工具:

仓库压平工具(把代码变成结构化文本):

工具是什么
repomix整仓库打包成单个 AI 友好文件
gitingestGitHub 链接 hub→ingest 即得文本;pip install gitingest
code2prompt代码库→带目录树的 prompt,能数 token
files-to-prompt文件→prompt,优化 Claude XML 格式
yek按 token 预算 + git 历史挑重要文件
tree-sitter按语法树(AST)抽「函数+注释」对

合成数据框架(用 LLM 反向造指令语料):

框架是什么
distilabel合成数据流水线,喂代码→LLM 反向写指令
Data-Juicer100+ 算子清洗/去重/合成,支持多模态
NeMo CuratorGPU 加速大规模清洗+合成
Augmentoolkit原始文档→QA 数据集,带答案校验
Bespoke Curator构建高质量数据集的库
DataDreamerprompt→造数据→训练一条龙
Lilac数据集可视化探索/质检

方法论层面主要是 Self-Instruct / OSS-Instruct / OpenCodeInstruct 三条路线。

三、多模态代码数据集:全是网页,没有游戏引擎#

这是调研里最重要的发现。现有”看图写代码”的多模态数据集和基准,产出的几乎全是 HTML/网页代码Python 绘图代码

仅评测用(量小,不能训练)

名称是什么产出代码规模
MMCode看图解→写代码Python 等算法代码3548 题
HumanEval-V看图解→写代码Python253 题
ChartMimic看图表→画图代码Python 绘图评测集
Flow2Code流程图/UML→代码C/C++/Java/Python评测集
Design2Code设计稿→前端HTML/CSS484 对
V-GameGym游戏画面→代码Python (Pygame)2219

可训练(量大)

名称是什么产出代码规模
WebSight截图→网页HTML/Tailwind82 万~192 万
Web2Code网页截图→代码HTML88 万
BigDocs多模态文档→代码HTML/Markdown/多种750 万
CodeSCAN编程截屏→识别代码24 种语言1.2 万
Pix2CodeUI 截图→代码自定义 DSL1750

唯一沾游戏的 V-GameGym 是 Python+Pygame,而且只能用来打分。针对 Godot/Unity/UE 的”编辑器画面/运行画面 ↔ 引擎源码”多模态训练语料,目前没有任何公开数据集——对做游戏引擎多模态而言,现有工作只能借方法,数据本身用不上。这既是障碍,也是机会:谁先把这类语料造出来,谁就有先发优势。

四、落盘结果#

调研同时把可用数据集实际下载验证了一遍,共 34 个数据集、约 3.1 GB 成功落盘:

引擎目录子集数体积
godot10697 MB
unity12894 MB
ue8570 MB
rpgmaker4288 MB
roblox-luau5146 MB
gamedev-general6527 MB
other-engines43 MB

有 5 个数据集因仓库受限或改名下载失败(如 AdamCodd/Unreal-engine-5.5、TorpedoSoftware/the-luau-stack),实际使用时需要注意甄别失效仓库。

总结#

  • 纯代码语料:四大引擎都有可用的公开数据集,Unity 和 Godot 生态最好,且有现成的指令微调格式
  • 工具链成熟:从仓库压平到 LLM 合成指令,每个环节都有开源工具,语料生产的工程门槛不高
  • 多模态是空白:游戏引擎方向的”画面↔代码”训练语料不存在,需要借鉴 WebSight/Web2Code 的构建方法自建——这是这个方向最值得投入的地方

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

游戏引擎代码语料全景调研:公开数据集、代码转语料工具链与多模态空白
https://www.yolof.top/posts/game-engine-code-corpus-survey/
作者
方静文
发布于
2026-06-16
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
方静文
AI 开发应用工程师 / Fang's Blue Hour
公告
欢迎来到 Fang's Blue Hour!这里记录我的 AI 应用开发实践、开源项目与技术调研。
分类
标签
站点统计
文章
16
分类
5
标签
50
总字数
22,571
运行时长
0
最后活动
0 天前
站点信息
构建平台
Vercel
博客版本
Firefly v6.13.5
文章许可
CC BY-NC-SA 4.0

文章目录