agent-vision-toolkit

agent-vision-toolkit

为纯文本模型提供图像理解、问答、前端UI还原和GUI自动化等视觉能力。

Agent Skill编程与开发开源
形态
Agent Skill
是否开源
GitHub Stars
★ 1.0k
收录来源
skill-github

能力说明

agent-vision-toolkit 是一个专为纯文本模型设计的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原和GUI自动化等功能。它可以通过无缝集成多个主流代理(如Codex、Claude Code、Pi等),直接识别粘贴的图片。这个工具箱使文本模型能够处理视觉任务,提升其在多模态任务中的表现。适合需要增强文本模型视觉能力的开发者和团队。

能力点

  • 多图理解
  • 图片问答
  • 前端UI还原
  • GUI自动化
  • 无缝集成主流代理
  • 直接识别粘贴图片

适用场景

增强文本模型的图像理解能力实现基于图像的问答系统自动化前端UI测试提高GUI自动化效率

接入方式

依赖:API KeyNode 环境
请参考项目README中的安装说明进行安装。

以上信息由 AI 基于公开资料整理,可能存在偏差,以来源为准。

常见问题

如何安装agent-vision-toolkit?

请参考项目README中的安装说明进行安装。

支持哪些主流代理?

支持Codex、Claude Code、Pi等。

是否开源?

是,MIT许可证。

相关 Skill