Skip to main content
当工作流需要先获取一个网页并将其转换为长度受限的文本,再由模型进行提取、摘要或分类时,请使用此方案。

1. 使用 phaseo:web_fetch 获取单个网页作为依据

phaseo:web_fetch 是由 Gateway 管理的服务器工具。 适用于以下需求:
  • 由 Gateway 直接获取一个 URL
  • 向工具循环返回长度受限的文本
  • 按请求跟踪用量
  • 在请求日志中查看获取的网页
如果已经知道 URL,这比广泛搜索更合适。

2. 明确说明请求内容

典型流程:
  1. 让模型调用 phaseo:web_fetch
  2. 由 Gateway 获取并规范化网页
  3. 让模型根据返回的文本继续提取
在提示中明确说明获取网页后的最终任务:
  • 提取字段
  • 总结一个章节
  • 对文档进行分类
  • 验证一项陈述

3. 有意限制获取内容的大小

当默认上限对当前任务来说过大或过小时,请设置 max_chars。 推荐做法:
  • 提取标题或摘要时使用较小上限
  • 提取结构化字段时使用较大上限
如果网页内容很多,应缩小提取任务范围,而不是取消获取大小限制。

4. 检查日志,而不只是最终答案

请求详情应显示:
  • 获取的 URL
  • 重定向后的最终 URL
  • 网页标题(如有)
  • HTTP 状态
  • 内容类型
  • 返回的字符数
  • 截断标记
通过此视图确认模型使用了预期网页作为依据。

5. 了解工具限制

phaseo:web_fetch 具有有意设置的处理上限。 适用于:
  • HTML 网页
  • 纯文本
  • 简单的 JSON 或 XML 响应
不适用于:
  • 二进制文件
  • 大规模网页抓取
  • 仅依赖 JavaScript 渲染的页面检查
要验证浏览器渲染的内容,请使用浏览器工作流,不要只依赖获取的文本。

6. 建议的上线步骤

  1. 从一个预设或一个端点路径开始
  2. 检查请求日志中的获取元数据和截断信息
  3. 如果获取的内容范围过大,则缩小提示范围
  4. 只有在基于网页内容的提取流程稳定后才扩大范围

相关内容

最后修改于 2026年10月2日