跳轉到
版本 v1.0.25

資料集

這頁能幫你做什麼

資料集 (Dataset) 用來整理一批「輸入 → 預期輸出」的資料,常用於評估 (Evaluation):你定義好哪些是輸入欄位、哪些是輸出欄位,填入測試樣本後,就能拿來檢驗 Agent 或工作流程的回答是否符合預期。也能用平台的生成功能,依欄位描述自動產生範例資料。簡單說:資料集是你的「測驗題庫」,方便反覆驗證成效。

開始前

前置需求

建立資料集本身不需要其他資源,只要規劃好「要哪些輸入欄位、哪些輸出欄位」即可。建立完成後即可進入評估流程。

操作步驟

  1. 從左側資源選單進入「資料集」清單頁,點建立入口(空清單時是有文字的建立按鈕;清單已有項目時是右上角無文字的「+」圖示)開啟建立表單。表單由「名稱」「輸入欄位」「輸出欄位」「描述」「標籤」五塊組成,下圖是前四塊都填好、標籤留空的樣子(剛開啟時兩張表格是空的):

    資料集建立表單,依序為「名稱」、已各有一筆的「輸入欄位」「輸出欄位」表格、「描述」與空白的「標籤」

  2. 在「名稱」欄輸入名稱。

  3. 在「輸入欄位」表格底部中央的紫色「+」鈕新增輸入欄位,於彈出視窗填好欄位的名稱與描述後儲存。這裡取的名字之後要用:評估時的「使用者提示詞」就是用 {{ 欄位名 }} 把每一筆資料帶進去,所以請取簡短、好記、不含空白的名字(例如 question)。

    「新增欄位」對話框,含「名稱」與「描述」

  4. 在「輸出欄位」表格用同樣方式逐一新增輸出欄位(預期結果)。

  5. 視需要在「描述」填寫整個資料集的用途說明。
  6. 按右上角的「儲存」按鈕完成建立(見步驟 1 圖右上角)。

    存檔後畫面會直接跳進這個資料集的「評估」頁(網址結尾是 /evaluate,麵包屑最後一層是「評估」),可以馬上開始填入或生成資料項目。這一頁上不會有「評估」按鈕——你已經在那一頁了;那顆按鈕在「詳細頁」上,用來從詳細頁跳過來。

之後從清單點名稱,會直接進「評估」頁

資料集有兩個畫面:詳細頁(一般/依賴資源/被依賴資源三個頁籤)與評估頁。從清單點資料集名稱會直接開啟評估頁,不是詳細頁——所以你照本頁往下讀到「資料集詳細頁」時,畫面上看到的很可能是評估頁。要回詳細頁,點頁面標題(資料集名稱)右側的 選單、選唯一那一項「詳細資料」即可(也可以把網址結尾的 /evaluate 拿掉)。

完整欄位說明

主表單

資料集建立表單,「輸入欄位」「輸出欄位」皆為表格且各有一筆欄位,下方依序為「描述」與空白的「標籤」

欄位 必填 預設 說明
名稱 資料集的識別名稱。最多 64 個字,不可用 default 開頭。
輸入欄位 表格。定義餵給 Agent/工作流程的輸入欄位,每筆有名稱與描述。在表格按「+」用「新增欄位」對話框新增(見下)。
輸出欄位 表格。定義預期結果的欄位,每筆有名稱與描述。新增方式同「輸入欄位」。
描述 多行文字,說明整個資料集的用途。
標籤 分類用的小標,貼上後可在清單頁用「標籤」把同一群資源一次篩出來。填法與數量/長度限制見「標籤」欄位

新增欄位(彈出視窗)

在「輸入欄位」或「輸出欄位」表格按「+」時開啟「新增欄位」對話框(對已建欄位按編輯時,同一個對話框標題為「編輯欄位」),用來定義單一欄位:

「新增欄位」對話框,含必填的「名稱」與選填的「描述」

欄位 必填 預設 說明
名稱 欄位名稱,最多 64 個字。
描述 多行文字,說明此欄位代表什麼。

描述寫清楚,生成品質更好

若之後使用評估頁的「生成資料集項目」功能,大型語言模型會參考每個欄位的「描述」來產生範例資料。描述寫得越具體(例如輸入 question 描述為「使用者提出的問題」、輸出 expected_answer 描述為「客服應給出的標準答案」),自動生成的範例就越貼近你的情境。

資料集詳細頁

資料集詳細頁上方有三個頁籤(「一般」「依賴資源」「被依賴資源」),右上角另有「評估」按鈕。下圖為「一般」頁籤,可看到基本資料與當初設定的輸入/輸出欄位:

在清單點資料集名稱不會進到這一頁,會直接跳到「評估」頁

資料集是少數例外:清單上點名稱會直接開啟評估頁。要看下面說的三個頁籤,請把網址結尾的 /evaluate 去掉(也就是 /resources/datasets/<資料集 ID>),或從評估頁的麵包屑回到資料集本身。

資料集詳細頁的「一般」頁籤,顯示 ID、名稱、描述、標籤、最新版本、系統資訊、狀態、建立者、更新者與最後更新,以及「輸入欄位」「輸出欄位」表格;右上角有「評估」按鈕

頁籤/區塊 內容
一般 資料集的基本資料:ID、名稱、描述、標籤、最新版本、系統資訊、狀態、建立者、更新者、最後更新,以及「輸入欄位」與「輸出欄位」兩張表格(該類欄位一個都沒設時,那一欄直接顯示 -,不會出現一張空表格)。卡片右上角的圖示鈕可編輯()、複製()或刪除()。
依賴資源 這個資料集用到的其他資源。
被依賴資源 反過來,有哪些資源用到這個資料集。
「評估」按鈕 右上角的紫色按鈕(帶 圖示),點下去進入評估頁:在那裡填入或生成題目、設定受測對象,並逐筆執行評估

「最新版本」是什麼?為什麼是 0

這個數字指的是資料集項目(題目)的版本,不是資料集設定的版本:每次整批匯入或同步項目成功,版本就加一,讀取一律只讀最新那一版。剛建好、還沒有任何項目的資料集顯示 0,是正常的。

資料集沒有「驗證」功能

資料集詳細頁不提供「驗證憑證/測試連線」按鈕——它不連外部系統。它的用途是當作評估的題庫,效果見下方「使用效果」。

評估頁

點詳細頁右上角的「評估」按鈕進入評估頁。畫面分成兩邊:左邊是「輸入」卡片,設定「要用什麼來跑這批題目」;右邊是資料集項目清單,也就是你的題庫本身。左邊卡片右上角的收合鈕可以把它收起來,讓題庫佔滿整個畫面。

資料集評估頁,左側為「輸入」卡片(變數、執行器類型、大型語言模型、系統提示詞、使用者提示詞),右側為資料集項目清單

上圖是一份還沒有任何題目的資料集:右側清單顯示「找不到更多結果。」,工具列上需要有資料才能用的按鈕(刪除、匯出)也是灰的。整頁的流程是:先在左側設定「用什麼跑」(見下方欄位說明)→ 在右側填入題目 → 逐筆執行評估,結果會出現在右側表格的「執行輸出」欄。

「輸入」卡片欄位

欄位 必填 預設 說明
變數 自動帶入 唯讀。列出這個資料集的「輸入欄位」名稱,就是你在「使用者提示詞」裡可以用 {{ 欄位名 }} 代入的變數。要改請回到資料集編輯輸入欄位。
執行器類型 大型語言模型 用什麼來跑這批題目,三選一(見下方對照表)。切換後下方欄位會跟著換。
大型語言模型 平台預設 LLM 選「大型語言模型」或「結構化大型語言模型」時出現,指定受測的 LLM 資源。選好後欄位右側會出現 「設定」鈕,可覆寫這次評估要用的參數(見下方)。
系統提示詞 空白 選「大型語言模型」或「結構化大型語言模型」時出現。影響模型的角色與回應風格,不支援變數代入
JSON Schema 預設結構 只有「結構化大型語言模型」會出現。用結構編輯器定義輸出必須符合的 JSON 結構。
Agent (無) 只有「Agent」會出現,指定受測的 Agent 資源。
使用者提示詞 空白 實際餵給受測對象的提示詞。支援用 {{ 欄位名 }} 代入資料集欄位值,例如 {{ question }};輸入 {{ 會跳出可用欄位的自動完成。選 LLM 類型時,編輯器上方另有提示詞改寫鈕可請 AI 幫你潤飾。

執行器類型怎麼選

選項 適合 說明
大型語言模型 只想比較「同一批問題、不同模型或不同提示詞」的回答品質 直接用一個 LLM 資源跑,回答是自由格式的文字。
結構化大型語言模型 要驗證「抽出的欄位對不對」,例如合約抽取、表單解析 同上,但強制模型回傳符合你定義的 JSON Schema 的結構化結果,方便逐欄比對。
Agent 要驗證的是「整個 Agent」——含它的工具、知識庫與提示詞 用一個既有的 Agent 跑,等於連工具呼叫一起測。

覆寫這次評估要用的 LLM 參數

選好「大型語言模型」後,欄位右側的 鈕(滑鼠移上去顯示「設定」)會開啟「設定 」對話框(標題帶的是資源名稱,例如「設定 default-llm」,不是模型名稱),讓你只為這次評估調整模型參數。對話框打開時只看得到一個「將輸出轉換為繁體中文」開關,溫度、Top P、Top K、最大 Token、思考功能都收在下方的「進階設定」摺疊區塊裡,要自己點開(實際出現哪些取決於該 LLM 的類型)。這個對話框沒有「儲存」或「放棄」鈕,改完即時生效,看完按右上角的 X 關掉就好。這裡不會動到 LLM 資源本身,也不會出現名稱、類型、模型、地區、憑證、系統提示詞這些屬於資源設定的欄位——各參數的意義見 大型語言模型 (LLM)

用它比較「同一個模型、不同溫度」的差異

想知道把溫度調低會不會讓答案更穩定,不必另外建一個 LLM 資源:在這裡覆寫參數跑一次,再改一次跑第二次,比對兩份結果即可。

右側的資料集項目清單

右側就是你的題庫。上方是「搜尋資料集項目 ID」搜尋框,右邊一排圖示鈕是這份題庫的操作;表格每一列是一筆題目:

欄位 內容
輸入欄位 這筆題目的輸入內容,欄名就是你在資料集定義的輸入欄位(例如 question)。滑鼠移到欄名上會顯示你當初填的「描述」。
輸出欄位 這筆題目的預期輸出(標準答案),欄名為你定義的輸出欄位(例如 expected_answer)。
執行輸出 跑完評估後才會填入,放的是受測 LLM/Agent 這次實際的回答,供你和「輸出欄位」對照。尚未跑過時顯示 -

工具列的圖示鈕(沒有項目時,需要選取或需要有資料的按鈕會呈灰色停用):

按鈕 作用
重新整理 重新載入資料集項目清單。
刪除 刪除勾選的資料集項目;未勾選任何項目時停用。一次最多 100 筆——勾超過 100 筆同樣會停用,滑過顯示「一次最多能處理 100 筆項目。」。按下後會先跳出確認對話框(標題「刪除資料集項目」),列出即將刪除的項目 ID,確認後才真的刪除。
將資料集項目匯出至儲存庫 把項目匯出成檔案存到儲存庫,見下方匯出資料集項目至儲存庫。沒有項目時停用。
編輯資料集項目欄位 開啟選單,可「新增欄位」「刪除欄位」「編輯欄位」——也就是在這裡改這份資料集的輸入/輸出欄位定義,不必回到資料集編輯表單。
(紫色) 開啟選單,用來填入題目,見下方填入題目

這份清單的「每頁筆數」最多只到 100

清單底部的「每頁筆數:」只提供 10、20、50、100 四個選項,沒有其他清單常見的 200。原因是資料集項目的新增、刪除都是「一次最多 100 筆」,把每頁筆數壓在 100 以內,才能讓「全選這一頁」永遠是個做得到的操作。題庫超過 100 筆時就用翻頁分批處理。

填入題目:新增、生成或從儲存庫取代

點右側工具列紫色的 鈕會展開一個選單,三個選項:

資料集項目的「+」選單,三個選項:新增資料集項目、以儲存庫內容取代目前資料集項目、生成資料集項目

選項 作用
新增資料集項目 開對話框逐筆手動填入這一筆的輸入欄位與輸出欄位內容,見下方新增資料集項目
以儲存庫內容取代目前資料集項目 儲存庫 (Storage) 選一個先前匯出(或自行準備)的檔案,整批取代目前的項目,見下方以儲存庫內容取代目前資料集項目
生成資料集項目 請大型語言模型依你的指示自動產生題目,見下方生成資料集項目

一次最多 100 筆

平台處理資料集項目時,一次請求最多 100 筆。所以「新增資料集項目」對話框最多只能排 100 列(滿 100 列後底部的「+」會變灰,滑過顯示「一次最多能處理 100 筆項目。」),批次刪除也一樣。題目更多時就分幾次送,或改用下方的以儲存庫內容取代目前資料集項目整批匯入(那條路走的是背景同步,不受 100 筆限制)。

新增資料集項目

逐筆手動輸入題目。對話框中央是一張表格,欄名就是這份資料集的輸入與輸出欄位(下圖為 questionexpected_answer);剛開啟時表格是空的,按底部中央紫色的「+」一列一列加上去,一次可以排到 100 列,最後按右上角「儲存」把整批送出。

「新增資料集項目」對話框,表格有 question 與 expected_answer 兩欄、已填兩列,每列右側有編輯與刪除圖示,底部中央是紫色「+」

元素 作用
(表格底部中央、紫色) 新增一列,開啟填寫內容的對話框(見下方填寫單筆項目的內容)。已經排到 100 列時停用,滑過顯示「一次最多能處理 100 筆項目。」。
重新打開這一列的填寫對話框,修改內容。
把這一列從表格移除。還沒按「儲存」,所以不會動到題庫。
每列最左側的把手 拖曳調整列的順序。
表格底部的換頁與「每頁筆數:」 這張表格自己也會分頁,預設一頁 10 列。排到第 11 列之後就要翻頁才看得到,不是列不見了。列數還不到一頁時,對話框底部不會出現這排控制項,找不到是正常的。
放棄 關掉對話框,整批放棄,什麼都不會存進題庫。
儲存 把表格裡的所有列一次送出,成功後題庫立刻多出這些題目。

填寫單筆項目的內容

按「+」或 後開啟的對話框,會依這份資料集的欄位定義,一個欄位一個輸入框(欄位標籤就是你當初取的欄位名):

填寫單筆資料集項目的對話框,question 與 expected_answer 各一個帶行號的編輯器

欄位 必填 預設 說明
(每個輸入欄位/輸出欄位各一個) 空白 這一筆題目在該欄位的內容。可以直接寫純文字(例如一個問題、一段標準答案),也可以填 JSON 值(數字、truefalse、陣列、物件)——需要比對結構化結果時很有用。輸入框帶行號,右上角工具列的說明見通用介面元件 — 編輯器工具列

填完按「儲存」回到上一層表格(這一步還沒寫進題庫)。按「放棄」是丟掉這一列,但會先跳出一個「放棄修改/你所做的修改將不會被保存。」的確認框,再按一次「放棄」才會關掉。

有幾筆沒存成功時:重試對話框

按「儲存」後,如果有部分列沒能寫入,平台不會只丟一句錯誤,而是跳出一個對話框,把沒存成功的那幾列原封不動留給你,可以直接重試:

「資料集項目未儲存成功」對話框,內文為「2 筆資料集項目未儲存成功:」,表格第一欄是「錯誤原因」,後面是 question 與 expected_answer 兩欄,右下角有「取消」與「再次儲存」

元素 說明
標題 一筆都沒存成功時是「資料集項目未儲存成功」;有部分已經存進去時是「部分資料集項目未儲存成功」,此時上方會多一行「成功儲存 N 筆資料集項目!」告訴你已經進去幾筆(這個數字是累計的,按過幾次「再次儲存」都會一起算)。
「{N} 筆資料集項目未儲存成功:」 這次有幾列沒存成功。
錯誤原因 表格第一欄,每列沒存成功的原因。文字過長會截斷,按左邊的 展開看全文( 收合)。
資料欄位 錯誤原因之後,依序是這份資料集的各個欄位,內容就是你剛才輸入的那幾列,方便核對。同樣可用展開鈕看完整內容。
取消 關掉對話框。
再次儲存 把表格裡剩下的這幾列重新送一次。若這次全部成功,對話框會自動關閉、題目出現在清單上;若還有失敗,對話框會留下仍未成功的那幾列,讓你再試。

關掉這個對話框,那幾筆就要重新輸入

這個對話框不會因為點旁邊空白處而關閉——它是刻意設計成必須自己決定的。但只要按了「取消」(或關掉它),沒存成功的那幾列就永久消失了,平台不會幫你留稿,只能回到「新增資料集項目」重新輸入一次。所以看到這個對話框時,先按「再次儲存」試一次;真的要放棄,也請先把還需要的內容複製下來。

為什麼會存不進去?

這裡的失敗不是欄位格式檢查——格式有問題會在按「儲存」時就被擋下來,不會走到這個對話框。可能的原因有兩類:一是寫入當下暫時不順(例如短時間內大量寫入),這種按「再次儲存」通常就成功了;二是某一列的內容太大寫不進去,這種重試不會變好,要先回去把那一列的內容縮短。若反覆按「再次儲存」都停在同樣幾列,請把「錯誤原因」的文字提供給系統管理者協助查看。

以儲存庫內容取代目前資料集項目

已經有一份整理好的題庫檔案(例如先前匯出的檔案,或自己用 Excel 整理後另存的檔案)時,用這條路一次匯入。它是「取代」不是「附加」:送出前會先跳出「取代現有的資料集項目」確認對話框(內文「上傳的檔案將取代目前的資料集項目。請確認是否要繼續。」),按「確認」後目前的項目會全部被檔案內容換掉。

欄位 必填 預設 說明
儲存庫 (無) 檔案放在哪個儲存庫 (Storage)。選定後才會出現下面的欄位。
檔案 (無) 儲存庫裡的檔案。只支援 JSONL 與 CSV,其他格式的檔案會停用並顯示「僅支援 CSV, JSONL 檔案。」。選好後右側「檔案預覽」會顯示這個檔案的內容與欄位,未選檔案時顯示「選取檔案後,可在此預覽。」。
輸入欄位 表格。從檔案裡的欄位挑出哪些要當輸入欄位,每筆有「名稱」與「描述」。這裡的選擇會一併更新資料集本身的欄位定義。
輸出欄位 表格。同上,挑出哪些欄位是預期輸出
僅儲存選定欄位 關閉 開關。開啟後,檔案裡沒被選進「輸入欄位」「輸出欄位」的其他欄位就不會存進題庫;關閉則整列照原樣收進來。

匯入是在背景執行的,跑完後才會顯示結果;若有部分列沒匯入成功,會跳出一個對話框告訴你這次有幾筆沒成功。匯入期間請留在這一頁——離開頁面平台就不再追蹤這次的進度,你會看不到結果(實際匯入仍會在背景跑完)。

生成資料集項目

沒有現成題庫時,讓大型語言模型依你的指示直接產生一批題目。對話框的欄位:

「生成資料集項目」對話框,含生成指令、附件與範例兩張表格、執行大型語言模型、生成數量滑桿與「儲存此次設定」開關,右上角有重設、放棄、產生

欄位 必填 預設 說明
生成指令 空白 告訴模型要生成什麼樣的題目(例如「針對退換貨政策產生常見客服問題與標準答案」)。模型會同時參考各欄位的「描述」。
附件 表格(欄位為「名稱」「儲存庫」),用中央的紫色 逐筆新增。可指定儲存庫裡的檔案當生成依據,讓題目貼近你的真實文件。
範例 表格,欄名就是這份資料集的輸入/輸出欄位(上圖為 questionexpected_answer)。還沒定義任何欄位的資料集,這張表格會是空的,請先回資料集加欄位。填幾筆示範,讓生成結果的風格與格式跟著你的範例。
執行大型語言模型 平台預設 LLM 負責生成題目的 LLM 資源(與左側受測用的 LLM 各自獨立)。右側的 鈕可覆寫這次的模型參數。
生成數量 10 滑桿,這次要產生幾筆題目,可拉 1 到 30。
儲存此次設定 開啟 開關。開啟時會記住這次的生成設定,下次開啟對話框直接沿用。

對話框右上角有「重設」(清空回預設)、「放棄」與「產生」。按「放棄」會先跳出「放棄修改/你所做的修改將不會被保存。」的確認框,要再按一次「放棄」才會關掉——就算你一個欄位都沒動也一樣會問(匯出對話框也是這個行為)。按「產生」後模型要跑一會兒,跑完會跳出「選擇資料集項目」對話框,提示「請勾選要新增到資料集的資料集項目:」並列出這次生成的內容——勾選要留下的那幾筆,再按「新增」才會真的存進題庫(每列最右邊的展開鈕可以看完整內容,左邊那個是勾選框;右上角「放棄」則整批不要)。這一步等於也是在存檔,所以同樣可能跳出重試對話框

執行評估

題庫填好、左側「輸入」卡片也設定好之後,就可以跑了。評估是逐筆執行的

  1. 把滑鼠移到右側清單中要跑的那一列上。
  2. 該列右側會出現三顆鈕:「評估」(要按的是這顆)、 選單(裡面是「詳細資料」「編輯」「刪除」,單筆題目要改或要刪就從這裡)、以及最右邊的 展開這一列。點「評估」。
  3. 平台會用左側「輸入」卡片目前的設定跑這一筆:「使用者提示詞」裡的 {{ 欄位名 }} 會換成這一列的實際內容,送給你選的 LLM 或 Agent。
  4. 執行中該鈕會轉圈、提示文字變成「評估中...」;跑完後同一列的「執行輸出」欄就會填入這次的實際回答,可與旁邊的「輸出欄位」(預期輸出)逐筆對照。
  5. 需要重跑就再按一次;要換模型或改提示詞,就改左側「輸入」卡片再按。

「評估」鈕變灰時:提示「請先完成必填欄位。」

左側「輸入」卡片還沒設定完整時,「評估」鈕會停用,滑過顯示「請先完成必填欄位。」。兩種常見情形:執行器類型選「Agent」但還沒選 Agent,或選「結構化大型語言模型」但 JSON Schema 還沒定義任何屬性。補齊後就可以按了。

匯出資料集項目至儲存庫

題庫填好、或跑完評估想留存時,可以把資料集項目匯出成檔案存到儲存庫 (Storage)

  1. 在評估頁右側資料集項目清單的工具列,點 「將資料集項目匯出至儲存庫」。
  2. 選擇要存到哪個「儲存庫」。
  3. 視需要選擇「資料夾」,並在「檔案名稱」填檔名(選了資料夾就必須填)。
  4. 選擇「格式」(JSONL 或 CSV)。
  5. 點「儲存」開始匯出,完成後會顯示「資料集項目已匯出」對話框。
欄位 必填 預設 說明
儲存庫 (無) 要存放檔案的儲存庫資源。選定後才會出現「資料夾」與「檔案路徑」(「格式」一開始就在畫面上)。
資料夾 (無) 儲存庫裡的目標資料夾;不選則存在根目錄,並自動產生檔名
檔案名稱 是(選了資料夾時) (無) 檔名最長 255 字,不可含儲存庫不允許的符號。副檔名會依所選格式自動加上,不用自己打。
格式 JSONL JSONL(每行一筆,適合再餵給程式或其他評估工具)或 CSV(適合用 Excel 開)。

欄位下方的「檔案路徑」會即時顯示這次會寫進去的完整路徑;沒指定資料夾時顯示「將自動產生檔名。」。

匯出完成的對話框會告訴你「已成功匯出 N 筆資料集項目至 <路徑>」,並提供兩個按鈕:「下載」直接把檔案存到你的電腦,「開啟儲存庫」在新分頁打開該儲存庫的檔案清單。若檔案已匯出但自動下載失敗,畫面會提示你到儲存庫手動下載。

沒有任何項目時匯出鈕是灰的

資料集還沒有任何項目、且沒有套用搜尋或篩選時,匯出鈕會停用——沒有東西可以匯出。先填入或生成項目再匯出。

使用效果

資料集本身不會執行,它的價值在於「拿去評估」。完整走完一輪是四步:

  1. 點詳細頁右上角的「評估」按鈕進入評估頁
  2. 在右側用紫色 填入題目——逐筆「新增資料集項目」、用「生成資料集項目」請模型自動產生,或「以儲存庫內容取代目前資料集項目」整批匯入。
  3. 在左側「輸入」卡片指定要受測的 LLM 或 Agent,並寫好「使用者提示詞」(用 {{ 欄位名 }} 代入每筆題目的輸入)。
  4. 對每一列按 「評估」執行,該列的「執行輸出」就會填入實際回答,與你填的「輸出欄位」(預期輸出)並排對照,看得出哪幾題答得不對。

想留存這一輪的結果,用工具列的 匯出到儲存庫

簡單說:填入「輸入/預期輸出」→ 逐筆執行 → 對照「執行輸出」與「輸出欄位」,用來驗證 Agent/工作流程的回答是否符合預期。要把受測對象建好,見 Agent工作流程

下一步

  • Agent:可用資料集評估其回答品質。
  • 樣板 (Template):搭配資料集設計可重複使用的提示。
  • 工作流程:同樣可用資料集驗證輸出是否符合預期。