modlens

modlens

为纯文本模型提供视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

Agent Skill编程与开发开源
形态
Agent Skill
是否开源
GitHub Stars
★ 1.3k
收录来源
skill-github

能力说明

ModLens 是 DeepSeek Harness 的第一个视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力。用户只需粘贴图片,即可获得结构化的 JSON 证据,包括 OCR 文本、版面信息和语义分析。该插件安装简单,无需额外配置,支持多种平台如 Claude Code、Codex、Pi 和 OpenCode。适用于需要将图像信息转换为结构化数据的开发者和研究人员。

能力点

  • OCR 文本识别
  • 版面分析
  • 语义理解
  • 图像转结构化 JSON

适用场景

图像内容提取文档自动化处理视觉辅助编程多模态数据分析

接入方式

依赖:Node.jsAPI Key (可选)
npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.16.5

以上信息由 AI 基于公开资料整理,可能存在偏差,以来源为准。

常见问题

如何安装 ModLens?

使用 npx 命令安装:npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.16.5

ModLens 支持哪些平台?

支持 Claude Code、Codex、Pi 和 OpenCode 等平台。

是否需要 API Key?

可以使用免费的 Gemini API Key 或其他 OpenAI 兼容的 API Key,也可以选择不使用 API Key。

相关 Skill