跳轉到
版本 v1.0.34

資料集

這頁的用途

資料集 (Dataset) 用來整理一批「輸入 → 預期輸出」的資料,常用於評估 (Evaluation):先定義好哪些是輸入欄位、哪些是輸出欄位,填入測試樣本後,就能拿來檢驗 Agent 或工作流程的回答是否符合預期。也能用平台的生成功能,依欄位描述自動產生範例資料。簡單說:資料集就是一份「測驗題庫」,方便反覆驗證成效。

開始前

前置需求

建立資料集本身不需要其他資源,只要規劃好「要哪些輸入欄位、哪些輸出欄位」即可。建立完成後即可進入評估流程。但如果你打算整批匯入題目、或把題庫匯出成檔案,還需要一個儲存庫 (Storage) 資源(見以儲存庫內容取代目前資料集項目匯出)。

操作步驟

  1. 從左側資源選單進入「資料集」清單頁,點建立入口(空清單時是有文字的建立按鈕;清單已有項目時是右上角無文字的「+」圖示)開啟建立表單。表單由「名稱」「輸入欄位」「輸出欄位」「描述」「標籤」五塊組成,下圖是前四塊都填好、標籤留空的樣子(剛開啟時兩張表格是空的):

    資料集建立表單,依序為「名稱」、已各有一筆的「輸入欄位」「輸出欄位」表格、「描述」與空白的「標籤」

  2. 在「名稱」欄輸入名稱。

  3. 在「輸入欄位」表格底部中央的紫色「+」鈕新增輸入欄位,於彈出視窗填好欄位的名稱與描述後儲存。這裡取的名字之後要用:評估時的「使用者提示詞」就是用 {{ 欄位名 }} 把每一筆資料帶進去,所以請取簡短、好記、不含空白的名字(例如 question)。

    「新增欄位」對話框,含「名稱」與「描述」

  4. 在「輸出欄位」表格用同樣方式逐一新增輸出欄位(預期結果)。

  5. 視需要在「描述」填寫整個資料集的用途說明。
  6. 按右上角的「儲存」按鈕完成建立(見步驟 1 圖右上角)。

    存檔後畫面會直接跳進這個資料集的評估設定頁(網址結尾是 /evaluation,麵包屑最後一層是「評估」),可以馬上開始填入或生成資料項目。這一頁上不會有「開始評估」鈕——因為已經在那一頁了;那顆鈕在「詳細頁」上,用來從詳細頁跳過來。

資料集有兩個畫面,別走錯

資料集有兩個畫面:詳細頁(一般/依賴資源/被依賴資源/評估四個頁籤)與評估設定頁(網址結尾 /evaluation,就是上面存檔後跳到的那一頁)。

  • 從清單點名稱進的是詳細頁。清單上把滑鼠移到那一列,右側還會浮出一顆「開始評估」鈕,它會另開一個分頁直接進評估設定頁。
  • 在詳細頁要進評估設定頁,按右上角的「開始評估」鈕。
  • 在評估設定頁要回詳細頁,點頁面標題(資料集名稱)右側的 選單、選「詳細資料」(同一個選單還有一項「評估紀錄」,直接開詳細頁的「評估」頁籤)。

完整欄位說明

主表單

資料集建立表單,「輸入欄位」「輸出欄位」皆為表格且各有一筆欄位,下方依序為「描述」與空白的「標籤」

欄位 必填 預設 說明
名稱 資料集的識別名稱。最多 64 個字,不可用 default 開頭。
輸入欄位 表格。定義餵給 Agent/工作流程的輸入欄位,每筆有名稱與描述。在表格按「+」用「新增欄位」對話框新增(見下)。
輸出欄位 表格。定義預期結果的欄位,每筆有名稱與描述。新增方式同「輸入欄位」。
描述 多行文字,說明整個資料集的用途。
標籤 分類用的小標,貼上後可在清單頁用「標籤」把同一群資源一次篩出來。填法與數量/長度限制見「標籤」欄位

新增欄位(彈出視窗)

在「輸入欄位」或「輸出欄位」表格按「+」時開啟「新增欄位」對話框(對已建欄位按編輯時,同一個對話框標題為「編輯欄位」),用來定義單一欄位:

「新增欄位」對話框,含必填的「名稱」與選填的「描述」

欄位 必填 預設 說明
名稱 欄位名稱,最多 64 個字,只能用字母、數字和底線(中文可以;空格、連字號 -、句點都不行,填了欄位下方顯示「此欄位只能包含字母、數字和底線」),且不能以數字開頭。另外 executor_outputtrajectory資料集評估的保留名稱,填了會擋在欄位下方顯示「此欄位不得使用資料集評估的保留名稱:"executor_output" 或 "trajectory"」,換個名字即可。
描述 多行文字,說明此欄位代表什麼。

描述寫清楚,生成品質更好

若之後使用評估設定頁的「生成資料集項目」功能,大型語言模型會參考每個欄位的「描述」來產生範例資料。描述寫得越具體(例如輸入 question 描述為「使用者提出的問題」、輸出 expected_answer 描述為「客服應給出的標準答案」),自動生成的範例就越貼近實際情境。

資料集詳細頁

資料集詳細頁上方有四個頁籤(「一般」、「依賴資源」、「被依賴資源」、「評估」),右上角另有「開始評估」按鈕。「評估」頁籤是歷次評估的紀錄清單,說明見資料集評估。下圖為「一般」頁籤,可看到基本資料與當初設定的輸入/輸出欄位:

資料集詳細頁的「一般」頁籤,顯示 ID、名稱、描述、標籤、最新版本、系統資訊、狀態、建立者、更新者與最後更新,以及「輸入欄位」「輸出欄位」表格;右上角有「開始評估」鈕

頁籤/區塊 內容
一般 資料集的基本資料:ID、名稱、描述、標籤、最新版本、系統資訊、狀態、建立者、更新者、最後更新,以及「輸入欄位」與「輸出欄位」兩張表格(該類欄位一個都沒設時,那一欄直接顯示 -,不會出現一張空表格)。卡片右上角的圖示鈕可編輯()、複製()或刪除()。刪除的確認框裡還有一個「刪除依賴資源」勾選項——不勾就只刪這份資料集,勾了會連它用到的相依資源一起刪,一般情況不要勾。
依賴資源 這個資料集用到的其他資源。
被依賴資源 反過來,有哪些資源用到這個資料集。
「開始評估」按鈕 右上角的紫色按鈕(帶 圖示),點下去進入評估設定頁:在那裡填入或生成題目、設定受測對象,並啟動評估。畫面上另有一個叫「評估」的頁籤(歷次紀錄清單),兩者不同。

「最新版本」是什麼?為什麼是 0

這個數字指的是資料集項目(題目)的版本,不是資料集設定的版本:只有整批匯入或同步項目成功才會加一,讀取一律只讀最新那一版。逐筆新增或生成的題目不會讓它加一,所以一份有題目的資料集也可能一直是 0——這個數字不代表題庫是空的。

資料集沒有「驗證」功能

資料集詳細頁不提供「驗證憑證/測試連線」按鈕——它不連外部系統。它的用途是當作評估的題庫,效果見下方「使用效果」。

評估設定頁

點詳細頁右上角的「開始評估」按鈕進入評估設定頁(網址結尾是 /evaluation)。畫面分成兩邊:左邊是「執行設定」卡片,設定「要用什麼來跑這批題目」;右邊是資料集項目清單,也就是題庫本身。左邊卡片右上角的收合鈕可以把它收起來,讓題庫佔滿整個畫面。

資料集評估設定頁,左側為「執行設定」卡片(變數、執行器類型、大型語言模型、系統提示詞、使用者提示詞),右側為資料集項目清單

上圖是一份還沒有任何題目的資料集:右側清單顯示「找不到更多結果。」,工具列上需要有資料才能用的按鈕(刪除、匯出)也是灰的。整頁的流程是:先在左側設定「用什麼跑」→ 在右側填入題目 → 按頁面右上角(資料集名稱那一列的右端)的「開始執行與評分」啟動。注意那顆鈕不在執行設定卡片的右上角——卡片右上角是收合鈕。

左側「執行設定」卡片的完整欄位、評分器設定與結果怎麼看,都在資料集評估 這一頁往下只說明右側的題庫怎麼管理。

右側的資料集項目清單

這一節講的都是「開始評估」按鈕進去後的那一頁——按那顆鈕只是開設定頁,不會直接開跑評估,可以放心按。

右側就是題庫。上方是「搜尋資料集項目 ID」搜尋框,右邊一排圖示鈕是這份題庫的操作;表格每一列是一筆題目。點任一列會在表格右側打開這一筆的「詳情窗格」:標題是資料集項目 ID,內容由上而下是「輸入欄位」「輸出欄位」「執行輸出」(跟著題目本身的順序:先看題目,再看標準答案,最後才是這次跑出來的結果),長內容不再受表格欄寬截斷;窗格和項目表格把右側題庫區對半分(不是整個畫面對半分——左邊還有「執行設定」卡片),中間的分隔線可左右拖曳、位置會被記住,右上角標題列還有 「執行」(等同下方單筆試跑)、 選單(「詳細資料」「編輯」「刪除」——「詳細資料」會把這一筆的資訊頁另開分頁)與 「關閉」:

資料集項目的詳情窗格,標題是項目 ID 與執行、更多、關閉三顆圖示鈕,內容依序是輸入欄位(role、question)、輸出欄位(expected_action、expected_answer)、執行輸出

欄位 內容
輸入欄位 這筆題目的輸入內容,欄名就是資料集定義的輸入欄位(例如 question)。滑鼠移到欄名上會顯示該欄位的「描述」。
輸出欄位 這筆題目的預期輸出(標準答案),欄名定義的輸出欄位(例如 expected_answer)。
執行輸出 跑完評估後才會填入,放的是受測 LLM/Agent 這次實際的回答,供和「輸出欄位」對照。尚未跑過時顯示 -重新整理或離開這一頁後也會退回 -,要留存請用匯出

工具列的圖示鈕(沒有項目時,需要選取或需要有資料的按鈕會呈灰色停用;灰掉時滑過去只會看到按鈕名稱、不會說明為什麼不能按,原因一律是「沒勾選任何項目」或「沒有資料」):

按鈕 作用
重新整理 重新載入資料集項目清單。
刪除 刪除勾選的資料集項目;未勾選任何項目時停用。一次最多 100 筆——勾超過 100 筆同樣會停用,滑過顯示「一次最多能處理 100 筆項目。」。按下後會先跳出確認對話框(標題「刪除資料集項目」),列出即將刪除的項目 ID,確認後才真的刪除。
將資料集項目匯出至儲存庫 把項目匯出成檔案存到儲存庫,見下方匯出資料集項目至儲存庫。沒有項目時停用。
編輯資料集項目欄位 開啟選單,可「新增欄位」「刪除欄位」「編輯欄位」——也就是在這裡改這份資料集的輸入/輸出欄位定義,不必回到資料集編輯表單。「編輯欄位」對話框把所有欄位攤成一張只有「名稱」「描述」的清單,不分輸入/輸出;要確認某個欄位屬於哪一類,回詳細頁的「一般」頁籤看兩張表格。
(紫色) 開啟選單,用來填入題目,見下方填入題目
表格最右緣的展開鈕,把清單推成寬版檢視方便看長內容;題庫是空的時候也在。

這份清單的「每頁筆數」最多只到 100

清單底部的「每頁筆數:」只提供 10、20、50、100 四個選項,沒有其他清單常見的 200。原因是資料集項目的新增、刪除都是「一次最多 100 筆」,把每頁筆數壓在 100 以內,才能讓「全選這一頁」永遠是個做得到的操作。題庫超過 100 筆時就用翻頁分批處理。

填入題目:新增、生成或從儲存庫取代

點右側工具列紫色的 鈕會展開一個選單,三個選項:

資料集項目的「+」選單,三個選項:新增資料集項目、以儲存庫內容取代目前資料集項目、生成資料集項目

選項 作用
新增資料集項目 開對話框逐筆手動填入這一筆的輸入欄位與輸出欄位內容,見下方新增資料集項目
以儲存庫內容取代目前資料集項目 儲存庫 (Storage) 選一個先前匯出(或自行準備)的檔案,整批取代目前的項目,見下方以儲存庫內容取代目前資料集項目
生成資料集項目 請大型語言模型依指示自動產生題目,見下方生成資料集項目

一次最多 100 筆

平台處理資料集項目時,一次請求最多 100 筆。所以「新增資料集項目」對話框最多只能排 100 列(滿 100 列後底部的「+」會變灰,滑過顯示「一次最多能處理 100 筆項目。」),批次刪除也一樣。題目更多時就分幾次送,或改用下方的以儲存庫內容取代目前資料集項目整批匯入(那條路走的是背景同步,不受 100 筆限制)。

新增資料集項目

逐筆手動輸入題目。對話框中央是一張表格,欄名就是這份資料集的輸入與輸出欄位(下圖為 questionexpected_answer);剛開啟時表格是空的,按底部中央紫色的「+」一列一列加上去,一次可以排到 100 列,最後按右上角「儲存」把整批送出。

「新增資料集項目」對話框,表格有 question 與 expected_answer 兩欄、已填兩列,每列右側有編輯與刪除圖示,底部中央是紫色「+」

元素 作用
(表格底部中央、紫色) 新增一列,開啟填寫內容的對話框(見下方填寫單筆項目的內容)。已經排到 100 列時停用,滑過顯示「一次最多能處理 100 筆項目。」。
重新打開這一列的填寫對話框,修改內容。
把這一列從表格移除。還沒按「儲存」,所以不會動到題庫。
每列最左側的把手 拖曳調整列的順序。
表格底部的換頁與「每頁筆數:」 這張表格自己也會分頁,預設一頁 10 列。排到第 11 列之後就要翻頁才看得到,不是列不見了。列數還不到一頁時,對話框底部不會出現這排控制項,找不到是正常的。
放棄 關掉對話框,整批放棄,什麼都不會存進題庫。
儲存 把表格裡的所有列一次送出,成功後題庫立刻多出這些題目。

填寫單筆項目的內容

按「+」或 後開啟的對話框,會依這份資料集的欄位定義,一個欄位一個輸入框(欄位標籤就是資料集定義的欄位名):

填寫單筆資料集項目的對話框,question 與 expected_answer 各一個帶行號的編輯器

欄位 必填 預設 說明
(每個輸入欄位/輸出欄位各一個) 空白 這一筆題目在該欄位的內容。可以直接寫純文字(例如一個問題、一段標準答案),也可以填 JSON 值(數字、truefalse、陣列、物件)——需要比對結構化結果時很有用。輸入框帶行號,右上角工具列的說明見通用介面元件 — 編輯器工具列

填完按「儲存」回到上一層表格(這一步還沒寫進題庫)。按「放棄」是丟掉這一列,但會先跳出一個「放棄修改/你所做的修改將不會被保存。」的確認框:按「放棄」才真的丟掉,按「取消」是回到剛才那一列繼續編輯。

有幾筆沒存成功時:重試對話框

按「儲存」後,如果有部分列沒能寫入,平台不會只丟一句錯誤,而是跳出一個對話框,沒存成功的那幾列會原封不動保留,可以直接重試:

「資料集項目未儲存成功」對話框,內文為「2 筆資料集項目未儲存成功:」,表格第一欄是「錯誤原因」,後面是 question 與 expected_answer 兩欄,右下角有「取消」與「再次儲存」

元素 說明
標題 一筆都沒存成功時是「資料集項目未儲存成功」;有部分已經存進去時是「部分資料集項目未儲存成功」,此時上方會多一行「成功儲存 N 筆資料集項目!」標示已經進去幾筆(這個數字是累計的,按過幾次「再次儲存」都會一起算)。
「{N} 筆資料集項目未儲存成功:」 這次有幾列沒存成功。
錯誤原因 表格第一欄,每列沒存成功的原因。文字過長會截斷,按左邊的 展開看全文( 收合)。
資料欄位 錯誤原因之後,依序是這份資料集的各個欄位,內容就是剛才輸入的那幾列,方便核對。同樣可用展開鈕看完整內容。
取消 關掉對話框。
再次儲存 把表格裡剩下的這幾列重新送一次。若這次全部成功,對話框會自動關閉、題目出現在清單上;若還有失敗,對話框會留下仍未成功的那幾列,可再試。

關掉這個對話框,那幾筆就要重新輸入

這個對話框不會因為點旁邊空白處而關閉——它是刻意設計成必須自己決定的。但只要按了「取消」(或關掉它),沒存成功的那幾列就永久消失了,平台不會留稿,只能回到「新增資料集項目」重新輸入一次。所以看到這個對話框時,先按「再次儲存」試一次;真的要放棄,也請先把還需要的內容複製下來。

為什麼會存不進去?

這裡的失敗不是欄位格式檢查——格式有問題會在按「儲存」時就被擋下來,不會走到這個對話框。可能的原因有兩類:一是寫入當下暫時不順(例如短時間內大量寫入),這種按「再次儲存」通常就成功了;二是某一列的內容太大寫不進去,這種重試不會變好,要先回去把那一列的內容縮短。若反覆按「再次儲存」都停在同樣幾列,請把「錯誤原因」的文字提供給系統管理者協助查看。

以儲存庫內容取代目前資料集項目

已經有一份整理好的題庫檔案(例如先前匯出的檔案,或自己用 Excel 整理後另存的檔案)時,用這條路一次匯入。它是「取代」不是「附加」:送出前會先跳出「取代現有的資料集項目」確認對話框(內文「上傳的檔案將取代目前的資料集項目。請確認是否要繼續。」),按「確認」後目前的項目會全部被檔案內容換掉。

欄位 必填 預設 說明
儲存庫 (無) 檔案放在哪個儲存庫 (Storage)。點欄位會另開一個選取對話框,要點該列最左邊的選鈕再按「儲存」(點名稱會離開這個表單)。選定後才會出現下面的欄位。
檔案 (無) 儲存庫裡的檔案。點欄位會開一個兩層的檔案瀏覽器:先看到資料夾,要點資料夾名稱鑽進去才看到檔案,再點該列最左邊的選鈕、按「儲存」。只支援 JSONL 與 CSV,平台是看檔案的內容類型判斷的,不符的列會停用並顯示「僅支援 CSV, JSONL 檔案。」。選好後右側「檔案預覽」會顯示這個檔案的內容與欄位,未選檔案時顯示「選取檔案後,可在此預覽。」。
輸入欄位 表格。從檔案裡的欄位挑出哪些要當輸入欄位,每筆有「名稱」與「描述」。
輸出欄位 表格。同上,挑出哪些欄位是預期輸出
僅儲存選定欄位 關閉 開關。開啟後,檔案裡沒被選進「輸入欄位」「輸出欄位」的其他欄位就不會存進題庫;關閉則整列照原樣收進來。

這條路會改掉資料集的欄位定義

在「輸入欄位」「輸出欄位」表格裡挑的欄位,會一併覆寫這份資料集本身的欄位定義——不只是這次匯入的資料長相。既有的評估設定、評分指示裡引用的欄位名如果因此消失,那些引用就會失效。拿一個既有題庫做匯入前,先確認欄位名和原本一致。

整份檔案清單都選不動時,是內容類型的問題

這個挑選器是看檔案的內容類型(不是副檔名)判斷格式的:內容類型不是 CSV 或 JSONL 的檔案一律停用,滑過去顯示「僅支援 CSV, JSONL 檔案。」。所以副檔名明明是 .csv.jsonl 卻選不動是有可能的,那不是你操作錯誤——問題在那個檔案存進儲存庫時被標成什麼內容類型。整份清單都選不動時,請換一個確定是以 CSV/JSONL 內容類型上傳的檔案,或改用逐筆新增生成;必要時請系統管理者確認儲存庫那邊的內容類型。

匯入是在背景執行的,跑完後才會顯示結果;若有部分列沒匯入成功,會跳出一個對話框標示這次有幾筆沒成功。匯入期間請留在這一頁——離開頁面平台就不再追蹤這次的進度,會看不到結果(實際匯入仍會在背景跑完)。

生成資料集項目

沒有現成題庫時,讓大型語言模型依指示直接產生一批題目。對話框的欄位:

「生成資料集項目」對話框,含生成指令、附件與範例兩張表格、執行大型語言模型、生成數量滑桿與「儲存此次設定」開關,右上角有重設、放棄、產生

欄位 必填 預設 說明
生成指令 空白 告訴模型要生成什麼樣的題目(例如「針對退換貨政策產生常見客服問題與標準答案」)。模型會同時參考各欄位的「描述」。
附件 表格(欄位為「名稱」「儲存庫」),用中央的紫色 逐筆新增。可指定儲存庫裡的檔案當生成依據,讓題目貼近實際文件。
範例 表格,欄名就是這份資料集的輸入/輸出欄位(上圖為 questionexpected_answer)。還沒定義任何欄位的資料集,這張表格會是空的,請先回資料集加欄位。填幾筆示範,讓生成結果的風格與格式跟著範例。
執行大型語言模型 平台預設 LLM 負責生成題目的 LLM 資源(與左側受測用的 LLM 各自獨立)。右側的 鈕可覆寫這次的模型參數。
生成數量 10 滑桿,這次要產生幾筆題目,可拉 1 到 30。
儲存此次設定 開啟 開關。開啟時會記住這次的生成設定,下次開啟對話框直接沿用(實測記得住的是「生成指令」;「生成數量」下次會回到預設 10,要幾筆記得重新拉)。

對話框右上角有「重設」(清空回預設)、「放棄」與「產生」。按「放棄」會先跳出「放棄修改/你所做的修改將不會被保存。」的確認框,要再按一次「放棄」才會關掉——就算一個欄位都沒動也一樣會問(匯出對話框也是這個行為)。按「產生」後模型要跑一會兒(實測生成 2 筆約 20 秒,期間沒有明顯進度提示),跑完會跳出「選擇資料集項目」對話框,提示「請勾選要新增到資料集的資料集項目:」並列出這次生成的內容——勾選要留下的那幾筆,再按「新增」才會真的存進題庫(每列最右邊的展開鈕可以看完整內容,左邊那個是勾選框,表頭那個是全選;右上角「放棄」則整批不要)。預設一筆都沒有勾,而「新增」在零勾選時照樣按得下去——什麼都沒勾就按,題庫不會有任何變化,很容易誤以為生成失敗。這一步等於也是在存檔,所以同樣可能跳出重試對話框

單筆試跑

題庫填好、左側「執行設定」卡片也設定好之後,可以先挑一筆試跑,確認提示詞寫對了再跑整批:

  1. 把滑鼠移到右側清單中要跑的那一列上。
  2. 該列右側會多出 「執行」(這顆是滑鼠移過去才出現的,要按的就是它)與 選單(「詳細資料」「編輯」「刪除」,單筆題目要改或要刪就從這裡)。點「執行」。(點列上其他地方是開詳情窗格——窗格標題列也有同一顆「執行」,在窗格裡按效果相同。)
  3. 平台會用左側「執行設定」目前的設定跑這一筆:「使用者提示詞」裡的 {{ 欄位名 }} 會換成這一列的實際內容,送給所選的受測對象。欄位名就寫資料集定義的名字,例如題庫的輸入欄位叫 question 時,提示詞可以寫成:

    你是人資助理。請回答以下問題:{{ question }}
    
  4. 執行中該鈕會轉圈、提示文字變成「執行中 ...」;通常幾秒到十幾秒,跑完後同一列的「執行輸出」欄就會填入這次的實際回答,可與旁邊的「輸出欄位」(預期輸出)逐筆對照。

  5. 需要重跑就再按一次;要換模型或改提示詞,就改左側「執行設定」再按。

資料集項目清單(「執行設定」卡片已收合)中第一列被滑鼠移過去的樣子:該列右側浮出三角形的「執行」鈕,旁邊是一直存在的更多選單,最右邊的「執行輸出」欄還是 -

試跑結果不會留著

「執行輸出」只存在目前這個畫面:重新整理、切到別頁再回來,該欄就退回 -,左側「執行設定」也會清空重填。試跑是拿來當場確認提示詞對不對的,不是紀錄;要留下結果請用整批評估(它會存成該次評估的紀錄)或匯出

單筆試跑只會產生輸出,不會打分數

這顆「執行」鈕跑的只有執行階段——它把回答填進「執行輸出」欄,不會經過評分器。要拿到通過率報表,得用頁面右上角的「開始執行與評分」跑整批,見資料集評估

「執行」鈕變灰時:提示「請先完成執行設定中的必填欄位。」

左側「執行設定」還沒填完時,「執行」鈕會停用,滑過顯示「請先完成執行設定中的必填欄位。」。常見情形:「使用者提示詞」空白執行器類型選「Agent」但還沒選 Agent,或選「結構化大型語言模型」但 JSON Schema 還沒定義任何屬性。補齊後就可以按了。

匯出資料集項目至儲存庫

題庫填好、或跑完評估想留存時,可以把資料集項目匯出成檔案存到儲存庫 (Storage)

  1. 在評估設定頁右側資料集項目清單的工具列,點 「將資料集項目匯出至儲存庫」。
  2. 選擇要存到哪個「儲存庫」。點這個欄位會再開一個「儲存庫」對話框(搜尋框+名稱/狀態/最後更新表格),要點該列最左邊的圓形選鈕再按右上角「儲存」才算選好。別點資源「名稱」——那是連結,會離開匯出對話框、跳去該儲存庫的詳細頁,得整個重來。
  3. 視需要選擇「資料夾」(同樣是另一個選取對話框,選法一樣);選了資料夾之後才會出現「檔案名稱」欄位,這時就必須填檔名。
  4. 選擇「格式」(JSONL 或 CSV)。
  5. 點「儲存」開始匯出,完成後會顯示「資料集項目已匯出」對話框。
欄位 必填 預設 說明
儲存庫 (無) 要存放檔案的儲存庫資源。選定後才會出現「資料夾」與「檔案路徑」(「格式」一開始就在畫面上)。
資料夾 (無) 儲存庫裡的目標資料夾;不選則由平台自動決定路徑與檔名(實測會放進儲存庫的 dataset-export/ 資料夾,不是根目錄)。
檔案名稱 是(選了資料夾時) (無) 選了「資料夾」之後才會出現這個欄位,出現後必填。檔名最長 255 字,不可含儲存庫不允許的符號。副檔名會依所選格式自動加上,不用自己打。
格式 JSONL JSONL(每行一筆,適合再餵給程式或其他評估工具)或 CSV(適合用 Excel 開)。

欄位下方的「檔案路徑」會即時顯示這次會寫進去的完整路徑;沒指定資料夾時顯示「將自動產生檔名。」。

匯出完成的對話框會顯示「已成功匯出 N 筆資料集項目至 <路徑>」,並提供兩個按鈕:「下載」直接把檔案存到本機,「開啟儲存庫」在新分頁打開該儲存庫的檔案清單。若檔案已匯出但自動下載失敗,畫面會提示到儲存庫手動下載。

沒有任何項目時匯出鈕是灰的

資料集還沒有任何項目、且沒有套用搜尋或篩選時,匯出鈕會停用——沒有東西可以匯出。先填入或生成項目再匯出。

使用效果

資料集本身不會執行,它的價值在於「拿去評估」。完整走完一輪是五步:

  1. 點詳細頁右上角的「開始評估」按鈕進入評估設定頁
  2. 在右側用紫色 填入題目——逐筆「新增資料集項目」、用「生成資料集項目」請模型自動產生,或「以儲存庫內容取代目前資料集項目」整批匯入。
  3. 在左側「執行設定」卡片指定要受測的大型語言模型、Agent 或工作流程,並寫好「使用者提示詞」(用 {{ 欄位名 }} 代入每筆題目的輸入)。
  4. 先挑一列按 「執行」單筆試跑,確認提示詞寫對了:該列的「執行輸出」會填入實際回答,與「輸出欄位」(預期輸出)並排對照。
  5. 確認沒問題後,按頁面右上角的「開始執行與評分」跑整批並加上評分器,得到通過率報表——見資料集評估

想留存題庫或某一輪的結果,用工具列的 匯出到儲存庫

簡單說:填入「輸入/預期輸出」→ 設定受測對象 → 批次執行與評分 → 看通過率與逐筆評分理由,用來驗證 Agent/工作流程的回答是否符合預期。要把受測對象建好,見大型語言模型(評估設定頁的預設執行器類型就是它)、Agent工作流程

下一步

  • Agent:可用資料集評估其回答品質。
  • 樣板 (Template):搭配資料集設計可重複使用的提示。
  • 工作流程:同樣可用資料集驗證輸出是否符合預期。
  • 資料集評估:設定執行器與評分器、批次跑完整份題庫並看通過率。