讀取網址¶
這頁的用途¶
Read URL 任務從指定的網址抓取網頁內容,並轉成乾淨的 Markdown 或保留原始 HTML,方便後續交給大型語言模型 (LLM) 處理、匯入知識庫或做資料分析。常見情境:
- 抓取文章、部落格或新聞內容,餵給 RAG 流程。
- 擷取文件頁面,匯入知識庫。
- 從網頁取得產品描述或規格。
- 把網頁內容轉成 Markdown,方便 LLM 閱讀。
開始前
一般網址不需任何前置資源。若目標網站需要驗證或特定連線設定,可選用一個 HTTP 類型的連結器 (Connector) 來提供請求標頭(見下方欄位說明)。連結器建立方式見 連結器資源頁。
操作步驟¶
-
新增一個 Read URL 任務節點,點選它開啟右側設定表單(如何新增請見 任務使用指南)。在「新增狀態」面板裡它叫「讀取網址」——搜尋框打
Read URL會找不到,請搜「讀取網址」或直接在分類裡找。
-
在「名稱」填步驟名稱。
- 在「網址」填要讀取的網頁網址(必須是
http://或https://開頭的合法網址),也可用 JSONPath 從輸入帶入(路徑寫法見 JSONPath 語法)。 -
視需要展開「進階任務設定」設定連結器、HTTP 標頭、格式、文字數量上限、逾時與 Meta 屬性。

-
設定「下一個狀態」,視需要填「附註」,再用「測試任務」按鈕()試跑。
完整欄位說明¶
下表只列 Read URL 任務特有的欄位。名稱、附註、下一個狀態、輸入與輸出、錯誤處理等共用分區,請見 任務通用設定。
設定分頁(基本欄位)¶
| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 網址 | 是 | https:// | 要讀取的網頁網址,支援靜態頁面。必須是 http:// 或 https:// 開頭的合法網址。可用 JSONPath 從輸入帶入,例如 $.article_url。 |
進階任務設定(摺疊區塊)¶
展開設定分頁底部的「進階任務設定」可看到下列 Read URL 特有欄位:
| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 連結器 | 否 | 無 | 選用一個 HTTP 類型的連結器來提供請求標頭,可安全存放敏感資訊(如驗證金鑰)。若直接在 HTTP 標頭填寫,值會以明文儲存且不受保護。可清除、也可從輸入動態帶入。建立方式見 連結器資源頁。 |
| HTTP 標頭 | 否 | 空表格 | 要附加到請求的自訂 HTTP 標頭,例如 User-Agent、Authorization、Cookie。是一張「鍵/值」表格,按 逐列新增。某些網站會擋預設爬取,可加自訂 User-Agent 降低被封鎖機率。需隱藏敏感資訊時建議改用連結器。把滑鼠移到欄位上,標籤右側會出現「JSON」開關,可改成一次貼上整包標頭(開關平常隱藏,見 任務通用設定)。 |
| 格式 | 否 | Markdown | 從網頁讀出的內容格式。可選 Markdown(輕量標記語言,呈現結構化資訊,建議用於 LLM)或 HTML(原生網頁格式,保留完整排版與結構)。 |
| 文字數量上限 | 否 | 4096 | 讀取內容的最大字數,用來限制長度避免內容過長壓垮 LLM。兩種用法:有填數字時就是上限,可填的最小值是 1024(比 1024 小的數字不接受);整格清空代表不設上限、讀取完整內容。 |
| 逾時 | 否 | 空白 | 整次讀取的最長秒數,填了就要在 5 到 300 之間。抓取網址與解析文件共用這份預算,所以 PDF 這類文件可能光解析就把時間用完。留空代表不設明確上界。一般情況留空即可,只有整條工作流程有時限、需要硬性限制單次讀取時間時才填。 |
| Meta 屬性 | 否 | 空白 | (只有「格式」為 Markdown 且回應是文字時才生效) 要從網頁的 HTML <meta> 標籤抽出來的屬性名稱。打一個按 Enter 新增一個,可加多筆;命中的項目會前置在內容之前。欄位裡沒有範例提示,寫法就是這樣:og:title、og:description、description、author。 |
「清空」和「最小 1024」不衝突
這兩件事講的是不同狀態:清空=這個欄位沒有值,平台就不做字數限制;一旦填了數字,那個數字才要 ≥ 1024。想讀完整內容就把欄位清空——把滑鼠移到欄位上,右側會浮現清除()鈕,平常不會顯示。實際預設值與下限以後端設定為準。
填了「逾時」之後,抓不到就是抓不到
平台預設會在讀不到時自動換一種連線協定再試一次;一旦設了「逾時」,抓取逾時就是最終結果,不會再往下一階協定重試。所以原本「HTTP/2 卡住但 HTTP/1.1 正常」的站台,設了逾時之後就讀不到了。會遇到這種站台就把這一欄留空。
「格式」選了 HTML,「Meta 屬性」就白填了
「Meta 屬性」只在「格式」為 Markdown 時生效,但把「格式」切成 HTML 之後,這個欄位不會變灰、不會隱藏,也不會出現任何警示——畫面上完全看不出它已經失效。填了一堆 og:* 卻什麼都沒拿到時,先回頭確認「格式」是不是被改成 HTML 了。
「Meta 屬性」適合抓標題與摘要
很多網站把文章標題、摘要、封面圖放在 <meta property="og:..."> 裡。要做「一批網址整理成清單」這種事,填 og:title、og:description 就能連同正文一起拿到這些欄位,不必再寫程式去剖析 HTML。記得「格式」要維持 Markdown——選 HTML 時這一欄不生效。
實際範例與預期結果¶
設定內容:
- 網址:
$.article_url - 格式:Markdown
- 文字數量上限:
2000
工作流程輸入:
{
"article_url": "https://example.com/articles/ai-trends"
}
測試輸出(讀到的內容放在 read_url_output):
{
"errors": null,
"action_type": "read_url_action",
"read_url_output": "# 2025 年 AI 趨勢\n\n人工智慧持續快速發展,出現了幾個關鍵趨勢..."
}
Note
輸出以後端實際回傳為準:讀到的內容放在 read_url_output,action_type 固定為 read_url_action。選 Markdown 時內容為 Markdown 文字,選 HTML 時為 HTML。
下一步¶
- 用 搜尋引擎任務 找出要抓取的網址,再串到這個任務。
- 用 程式碼 (Code) 任務 擷取內容中的特定區段。
- 把內容交給 LLM 任務 做摘要或分析。
- 回到 任務通用設定 了解共用分區。