Docs文档

入门

ModLens 是给纯文本模型用的 CLI 插件。图片进去,结构化证据出来。

DeepSeek 和 GLM 的主力对话模型是纯文本的,无法读图。ModLens 是它们可以调用的 CLI。支持直接粘贴图片识别,不必先存成文件再提供路径。

给在 Claude Code、Codex、Pi、OpenCode 或 DeepSeek Harness 里跑纯文本 DeepSeek、GLM 或 MiMo Pro 的人用。

配置写在 ~/.modlens/config.json。网站不在运行时路径里。

在 DeepSeek Harness 里安装

在 dsh 上,ModLens 是原生插件:

npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2

装完即有 modlens_read_image 工具。重启 dsh,在模型选择器里找带 (modlens vision) 后缀的条目。

在其他 Harness 里安装

把这句话发给你的 AI:

https://github.com/liustack/modlens 的 INSTALL.md 安装并配置 modlens skill,完成后运行体检并把结果告诉我。

逐步流程在安装手册(英文,agent 用)。安装会先盘点机器上已有的东西,复用前会先问你,最后用 modlens doctor 体检。

第一次识别

视觉引擎就绪之后:

modlens -i screenshot.png

输出是固定的 JSON。参数和故障转移链见 CLI 手册。JSON 契约见输出契约

接下来

  • 宿主接入:图片在 Codex、Claude Code、Pi、OpenCode、dsh 里怎么抵达模型
  • 视觉引擎:六个内置 provider,四家可复用 CLI,故障转移
  • 配置手册~/.modlens/config.json 里的每一个键
  • 故障排查:CLI 实际会打印的报错
  • 安全说明:恢复出的文件,图片内容当作不可信输入
  • 更新日志(英文)