> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 使用 web fetch 为后续提取提供依据

> 使用 `phaseo:web_fetch` 将长度受限的网页文本载入工具循环，以便进行确定性的后续提取和审核。

当工作流需要先获取一个网页并将其转换为长度受限的文本，再由模型进行提取、摘要或分类时，请使用此方案。

## 1. 使用 `phaseo:web_fetch` 获取单个网页作为依据

`phaseo:web_fetch` 是由 Gateway 管理的服务器工具。

适用于以下需求：

* 由 Gateway 直接获取一个 URL
* 向工具循环返回长度受限的文本
* 按请求跟踪用量
* 在请求日志中查看获取的网页

如果已经知道 URL，这比广泛搜索更合适。

## 2. 明确说明请求内容

典型流程：

1. 让模型调用 `phaseo:web_fetch`
2. 由 Gateway 获取并规范化网页
3. 让模型根据返回的文本继续提取

在提示中明确说明获取网页后的最终任务：

* 提取字段
* 总结一个章节
* 对文档进行分类
* 验证一项陈述

## 3. 有意限制获取内容的大小

当默认上限对当前任务来说过大或过小时，请设置 `max_chars`。

推荐做法：

* 提取标题或摘要时使用较小上限
* 提取结构化字段时使用较大上限

如果网页内容很多，应缩小提取任务范围，而不是取消获取大小限制。

## 4. 检查日志，而不只是最终答案

请求详情应显示：

* 获取的 URL
* 重定向后的最终 URL
* 网页标题（如有）
* HTTP 状态
* 内容类型
* 返回的字符数
* 截断标记

通过此视图确认模型使用了预期网页作为依据。

## 5. 了解工具限制

`phaseo:web_fetch` 具有有意设置的处理上限。

适用于：

* HTML 网页
* 纯文本
* 简单的 JSON 或 XML 响应

不适用于：

* 二进制文件
* 大规模网页抓取
* 仅依赖 JavaScript 渲染的页面检查

要验证浏览器渲染的内容，请使用浏览器工作流，不要只依赖获取的文本。

## 6. 建议的上线步骤

1. 从一个预设或一个端点路径开始
2. 检查请求日志中的获取元数据和截断信息
3. 如果获取的内容范围过大，则缩小提示范围
4. 只有在基于网页内容的提取流程稳定后才扩大范围

## 相关内容

* [调试网页搜索请求](./web-search-debugging.mdx)
* [工具调用](../guides/tool-calling.mdx)
* [修复结构化 JSON 响应](./response-healing-for-structured-json.mdx)


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.