claude-vision-skill

claude-vision-skill

让无识图能力的模型获得图片识别功能。

Agent Skill编程与开发开源
形态
Agent Skill
是否开源
GitHub Stars
★ 1.2k
收录来源
skill-github

能力说明

Claude Vision Skill 是一个脚本,使不具备图像识别能力的 AI 模型能够通过调用外部视觉模型来处理图片。用户只需发送图片,AI 会自动返回文字描述。支持多种视觉模型,如阿里云百炼和 OpenAI。配置过程包括下载 `vision.js`、替换 API Key 和模型名,并将 `CLAUDE.md` 合并到项目中。适用于需要图像识别功能的各种场景。

能力点

  • 读取图片并转换为 base64
  • 调用外部视觉模型 API
  • 返回图片的文字描述
  • 支持多种视觉模型

适用场景

在 Claude Code 项目中添加图像识别功能在 cyberboss 中集成图像识别自动化处理用户发送的图片

接入方式

依赖:API KeyNode 环境
git clone https://github.com/asuojun/claude-vision-skill.git; 将 `vision.js` 和 `CLAUDE.md` 添加到项目中,替换 API Key 和模型名。

以上信息由 AI 基于公开资料整理,可能存在偏差,以来源为准。

常见问题

支持哪些视觉模型?

支持阿里云百炼(推荐)、OpenAI 及其他兼容 OpenAI 格式的模型。

如何获取 API Key?

前往对应平台注册并申请 API Key。

相关 Skill