- 形态
- Agent Skill
- 是否开源
- 是
- GitHub Stars
- ★ 1.2k
- 收录来源
- skill-github
能力说明
Claude Vision Skill 是一个脚本,使不具备图像识别能力的 AI 模型能够通过调用外部视觉模型来处理图片。用户只需发送图片,AI 会自动返回文字描述。支持多种视觉模型,如阿里云百炼和 OpenAI。配置过程包括下载 `vision.js`、替换 API Key 和模型名,并将 `CLAUDE.md` 合并到项目中。适用于需要图像识别功能的各种场景。
能力点
- ▪读取图片并转换为 base64
- ▪调用外部视觉模型 API
- ▪返回图片的文字描述
- ▪支持多种视觉模型
适用场景
在 Claude Code 项目中添加图像识别功能在 cyberboss 中集成图像识别自动化处理用户发送的图片
接入方式
依赖:API KeyNode 环境
git clone https://github.com/asuojun/claude-vision-skill.git; 将 `vision.js` 和 `CLAUDE.md` 添加到项目中,替换 API Key 和模型名。
以上信息由 AI 基于公开资料整理,可能存在偏差,以来源为准。
常见问题
支持哪些视觉模型?
支持阿里云百炼(推荐)、OpenAI 及其他兼容 OpenAI 格式的模型。
如何获取 API Key?
前往对应平台注册并申请 API Key。
相关 Skill
gemini-cli
Gemini CLI 是一个开源的 AI 代理,将 Gemini 的强大功能直接带入终端。
MCP
sast-skills
将你的AI编码助手转变为SAST扫描器,自动检测代码中的漏洞。
Agent Skill
c-code-style
C 代码风格和编码规则,附带 AI 代理技能以编写、编辑和格式化代码。
Agent SkillC 语言代码风格
scientific-agent-skills
将任何AI代理转变为科学助手,提供147种即用型科研技能。
Agent Skill
susi_alexa_skill
通过 Alexa 与 Susi AI 进行问答交互的技能。
Agent Skill
claude-context
为 Claude Code 提供代码搜索能力,使整个代码库成为上下文。
MCP