1. 使用 phaseo:web_fetch 获取单个网页作为依据
phaseo:web_fetch 是由 Gateway 管理的服务器工具。
适用于以下需求:
- 由 Gateway 直接获取一个 URL
- 向工具循环返回长度受限的文本
- 按请求跟踪用量
- 在请求日志中查看获取的网页
2. 明确说明请求内容
典型流程:- 让模型调用
phaseo:web_fetch - 由 Gateway 获取并规范化网页
- 让模型根据返回的文本继续提取
- 提取字段
- 总结一个章节
- 对文档进行分类
- 验证一项陈述
3. 有意限制获取内容的大小
当默认上限对当前任务来说过大或过小时,请设置max_chars。
推荐做法:
- 提取标题或摘要时使用较小上限
- 提取结构化字段时使用较大上限
4. 检查日志,而不只是最终答案
请求详情应显示:- 获取的 URL
- 重定向后的最终 URL
- 网页标题(如有)
- HTTP 状态
- 内容类型
- 返回的字符数
- 截断标记
5. 了解工具限制
phaseo:web_fetch 具有有意设置的处理上限。
适用于:
- HTML 网页
- 纯文本
- 简单的 JSON 或 XML 响应
- 二进制文件
- 大规模网页抓取
- 仅依赖 JavaScript 渲染的页面检查
6. 建议的上线步骤
- 从一个预设或一个端点路径开始
- 检查请求日志中的获取元数据和截断信息
- 如果获取的内容范围过大,则缩小提示范围
- 只有在基于网页内容的提取流程稳定后才扩大范围