- 形态
- Agent Skill
- 是否开源
- 是
- GitHub Stars
- ★ 1.0k
- 收录来源
- skill-github
能力说明
agent-vision-toolkit 是一个专为纯文本模型设计的视觉工具箱和技能,支持多图理解、图片问答、前端UI还原和GUI自动化等功能。它可以通过无缝集成多个主流代理(如Codex、Claude Code、Pi等),直接识别粘贴的图片。这个工具箱使文本模型能够处理视觉任务,提升其在多模态任务中的表现。适合需要增强文本模型视觉能力的开发者和团队。
能力点
- ▪多图理解
- ▪图片问答
- ▪前端UI还原
- ▪GUI自动化
- ▪无缝集成主流代理
- ▪直接识别粘贴图片
适用场景
增强文本模型的图像理解能力实现基于图像的问答系统自动化前端UI测试提高GUI自动化效率
接入方式
依赖:API KeyNode 环境
请参考项目README中的安装说明进行安装。
以上信息由 AI 基于公开资料整理,可能存在偏差,以来源为准。
常见问题
如何安装agent-vision-toolkit?
请参考项目README中的安装说明进行安装。
支持哪些主流代理?
支持Codex、Claude Code、Pi等。
是否开源?
是,MIT许可证。
相关 Skill
gemini-cli
Gemini CLI 是一个开源的 AI 代理,将 Gemini 的强大功能直接带入终端。
MCP
sast-skills
将你的AI编码助手转变为SAST扫描器,自动检测代码中的漏洞。
Agent Skill
audit-skills
轻量级代码审计插件,专注于安全边界检查。
Agent Skill
scientific-agent-skills
将任何AI代理转变为科学助手,提供147种即用型科研技能。
Agent Skill
susi_alexa_skill
通过 Alexa 与 Susi AI 进行问答交互的技能。
Agent Skill
claude-context
为 Claude Code 提供代码搜索能力,使整个代码库成为上下文。
MCP