上周到现在,基本完成了一个通用的VLM纯视觉玩游戏的框架,针对的是即时性一般(类似于植物大战僵尸这种可以中途暂停的)的游戏。中途踩了大量的坑,记录一下。
0、Hermes每次要模型接收图片不是得用命令行读文件就是调用另一个模型端点读图,效率低下和损失信息二选一,原本计划是一个通用SKILL最后不得不自己搭Agent。
1、由于各种原因导致的模型定位的不准确,包括但不限于老游戏分辨率太小(PVZ只有800x600)、llama.cpp+Qwen3-VL缩放图片后给出的坐标因为没还原缩放导致坐标偏移。光是让模型点的准就折腾了好几天。目前敲定的技术路线是得确保游戏分辨率不能低于720p,不然模型定位都容易出现偏移问题。
2、小尺寸模型智力不够。好不容易点准了,中国象棋分不清楚棋子是敌方还是我方,PVZ不断尝试收集阳光但不放植物挡僵尸。完全是按照GUI操作电脑手机的路子来玩游戏的,虽然说是在意料之内吧,但还是挺让人崩溃的。
中间折腾了一大堆东西,包括提升模型视觉Token预算,换Gemma-4换Qwen3-VL都没用。好在最后是跑通了,确认是本地部署的Qwen3.8-27B模型性能不够,整套工具、工作流,以及很要命的是没有问题的。也没有心情测云端API了,下一步是让模型玩纯键盘/手柄操作的游戏,先来个GBA宝可梦试试水
#ai #大模型 #游戏 #视觉多模态 #agent #qwen
