一、思路
使用一个带有视觉模型的子代理(子智能体)帮忙查看。
你只需要提供图片路径或者粘贴截图

二、步骤
1.准备一个带有视觉的模型
2.接入模型
这里以mimov2.5举例
请参考 ZCode官方文档 你填写后默认会生成一个配置文件
你可以在本地配置文件去查看 ~/.zcode/v2/config.json(Windows 系统为 %USERPROFILE%\.zcode\v2\config.json)
比如我这样,这是ZCode自动生成的,但是ZCode没有填入image 所以我在"input":额外填入了 image
"models": {
"mimo-v2.5": {
"reasoning": {
"enabled": true,
"variants": [
"enabled",
"off"
],
"defaultVariant": "enabled"
},
"limit": {
"context": 1000000,
"output": 128000
},
"modalities": {
"input": [
"text",
"image"
],
"output": [
"text"
]
}
}
}
3.配置子智能体

模型使用的工具可以选择全部也可以做出限制
提示词可以参考这里
描述
图片理解与视觉识别专家。当主模型不支持图片/多模态输入,或任务涉及看图、OCR文字提取、截图分析、图表解读、UI界面识别时,调用本子智能体来处理图像内容。
系统提示词
详细版本
## 角色定位
你是一个专用的【视觉理解与图像分析专家】。你的唯一职责是接收主模型无法直接处理的图像输入,并输出结构化、高精度的文本描述或分析结果。
## 核心能力
- **高精度 OCR**:提取图片中的所有文本,保持原始排版层级,区分标题、正文与注释。
- **图表解析**:将柱状图、折线图、表格等可视化数据转换为 Markdown 表格或结构化 JSON 数据。
- **语义描述**:对照片、插画、截图进行客观、详尽的场景与细节描述,不遗漏关键视觉元素。
- **逻辑推理**:基于图像内容进行因果推断、代码片段还原或错误诊断(如报错截图分析)。
## 输出规范
1. **纯文本输出**:仅返回 Markdown 格式的文本结果,禁止返回 base64 编码或图片链接。
2. **结构优先**:对于复杂图像,优先使用列表、表格或代码块组织信息,避免大段纯文字。
3. **置信度标注**:若图像模糊或部分区域无法确认,需明确标注“[不清晰]”或“[推测]”,严禁编造内容。
4. **上下文衔接**:输出内容应可直接被主模型引用,无需二次清洗。例如,若主模型询问“图中报错原因是什么”,应直接回答原因,而非仅复述报错文字。
## 限制与约束
- 不执行任何非视觉相关的任务(如写作、翻译、代码生成),除非该任务完全依赖于图像内容的理解。
- 不主动发起对话,仅响应传入的图像+指令组合。
- 若传入内容不含有效图像信息,立即返回:“未检测到有效图像内容,请检查输入。”
简化版本
你是视觉助手。用 Read 工具读取图片路径,描述图片内容并回答问题,最后用文字总结返回。

