入门
ModLens 是给纯文本模型用的 CLI 插件。图片进去,结构化证据出来。
DeepSeek 和 GLM 的主力对话模型是纯文本的,无法读图。ModLens 是它们可以调用的 CLI。支持直接粘贴图片识别,不必先存成文件再提供路径。
给在 Claude Code、Codex、Pi、OpenCode 或 DeepSeek Harness 里跑纯文本 DeepSeek、GLM 或 MiMo Pro 的人用。
配置写在 ~/.modlens/config.json。网站不在运行时路径里。
在 DeepSeek Harness 里安装
在 dsh 上,ModLens 是原生插件:
npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.24.2
装完即有 modlens_read_image 工具。重启 dsh,在模型选择器里找带 (modlens vision) 后缀的条目。
在其他 Harness 里安装
把这句话发给你的 AI:
按 https://github.com/liustack/modlens 的 INSTALL.md 安装并配置 modlens skill,完成后运行体检并把结果告诉我。
逐步流程在安装手册(英文,agent 用)。安装会先盘点机器上已有的东西,复用前会先问你,最后用 modlens doctor 体检。
第一次识别
视觉引擎就绪之后:
modlens -i screenshot.png
输出是固定的 JSON。参数和故障转移链见 CLI 手册。JSON 契约见输出契约。