資料集¶
這頁的用途¶
資料集 (Dataset) 用來整理一批「輸入 → 預期輸出」的資料,常用於評估 (Evaluation):先定義好哪些是輸入欄位、哪些是輸出欄位,填入測試樣本後,就能拿來檢驗 Agent 或工作流程的回答是否符合預期。也能用平台的生成功能,依欄位描述自動產生範例資料。簡單說:資料集就是一份「測驗題庫」,方便反覆驗證成效。
開始前¶
前置需求
建立資料集本身不需要其他資源,只要規劃好「要哪些輸入欄位、哪些輸出欄位」即可。建立完成後即可進入評估流程。但如果你打算整批匯入題目、或把題庫匯出成檔案,還需要一個儲存庫 (Storage) 資源(見以儲存庫內容取代目前資料集項目與匯出)。
操作步驟¶
-
從左側資源選單進入「資料集」清單頁,點建立入口(空清單時是有文字的建立按鈕;清單已有項目時是右上角無文字的「+」圖示)開啟建立表單。表單由「名稱」「輸入欄位」「輸出欄位」「描述」「標籤」五塊組成,下圖是前四塊都填好、標籤留空的樣子(剛開啟時兩張表格是空的):

-
在「名稱」欄輸入名稱。
-
在「輸入欄位」表格底部中央的紫色「+」鈕新增輸入欄位,於彈出視窗填好欄位的名稱與描述後儲存。這裡取的名字之後要用:評估時的「使用者提示詞」就是用
{{ 欄位名 }}把每一筆資料帶進去,所以請取簡短、好記、不含空白的名字(例如question)。
-
在「輸出欄位」表格用同樣方式逐一新增輸出欄位(預期結果)。
- 視需要在「描述」填寫整個資料集的用途說明。
-
按右上角的「儲存」按鈕完成建立(見步驟 1 圖右上角)。
存檔後畫面會直接跳進這個資料集的評估設定頁(網址結尾是
/evaluation,麵包屑最後一層是「評估」),可以馬上開始填入或生成資料項目。這一頁上不會有「開始評估」鈕——因為已經在那一頁了;那顆鈕在「詳細頁」上,用來從詳細頁跳過來。
資料集有兩個畫面,別走錯
資料集有兩個畫面:詳細頁(一般/依賴資源/被依賴資源/評估四個頁籤)與評估設定頁(網址結尾 /evaluation,就是上面存檔後跳到的那一頁)。
- 從清單點名稱進的是詳細頁。清單上把滑鼠移到那一列,右側還會浮出一顆「開始評估」鈕,它會另開一個分頁直接進評估設定頁。
- 在詳細頁要進評估設定頁,按右上角的「開始評估」鈕。
- 在評估設定頁要回詳細頁,點頁面標題(資料集名稱)右側的 選單、選「詳細資料」(同一個選單還有一項「評估紀錄」,直接開詳細頁的「評估」頁籤)。
完整欄位說明¶
主表單¶

| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 名稱 | 是 | 無 | 資料集的識別名稱。最多 64 個字,不可用 default 開頭。 |
| 輸入欄位 | 否 | 空 | 表格。定義餵給 Agent/工作流程的輸入欄位,每筆有名稱與描述。在表格按「+」用「新增欄位」對話框新增(見下)。 |
| 輸出欄位 | 否 | 空 | 表格。定義預期結果的欄位,每筆有名稱與描述。新增方式同「輸入欄位」。 |
| 描述 | 否 | 無 | 多行文字,說明整個資料集的用途。 |
| 標籤 | 否 | 無 | 分類用的小標,貼上後可在清單頁用「標籤」把同一群資源一次篩出來。填法與數量/長度限制見「標籤」欄位。 |
新增欄位(彈出視窗)¶
在「輸入欄位」或「輸出欄位」表格按「+」時開啟「新增欄位」對話框(對已建欄位按編輯時,同一個對話框標題為「編輯欄位」),用來定義單一欄位:

| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 名稱 | 是 | 無 | 欄位名稱,最多 64 個字,只能用字母、數字和底線(中文可以;空格、連字號 -、句點都不行,填了欄位下方顯示「此欄位只能包含字母、數字和底線」),且不能以數字開頭。另外 executor_output 與 trajectory 是資料集評估的保留名稱,填了會擋在欄位下方顯示「此欄位不得使用資料集評估的保留名稱:"executor_output" 或 "trajectory"」,換個名字即可。 |
| 描述 | 否 | 無 | 多行文字,說明此欄位代表什麼。 |
描述寫清楚,生成品質更好
若之後使用評估設定頁的「生成資料集項目」功能,大型語言模型會參考每個欄位的「描述」來產生範例資料。描述寫得越具體(例如輸入 question 描述為「使用者提出的問題」、輸出 expected_answer 描述為「客服應給出的標準答案」),自動生成的範例就越貼近實際情境。
資料集詳細頁¶
資料集詳細頁上方有四個頁籤(「一般」、「依賴資源」、「被依賴資源」、「評估」),右上角另有「開始評估」按鈕。「評估」頁籤是歷次評估的紀錄清單,說明見資料集評估。下圖為「一般」頁籤,可看到基本資料與當初設定的輸入/輸出欄位:

| 頁籤/區塊 | 內容 |
|---|---|
| 一般 | 資料集的基本資料:ID、名稱、描述、標籤、最新版本、系統資訊、狀態、建立者、更新者、最後更新,以及「輸入欄位」與「輸出欄位」兩張表格(該類欄位一個都沒設時,那一欄直接顯示 -,不會出現一張空表格)。卡片右上角的圖示鈕可編輯()、複製()或刪除()。刪除的確認框裡還有一個「刪除依賴資源」勾選項——不勾就只刪這份資料集,勾了會連它用到的相依資源一起刪,一般情況不要勾。 |
| 依賴資源 | 這個資料集用到的其他資源。 |
| 被依賴資源 | 反過來,有哪些資源用到這個資料集。 |
| 「開始評估」按鈕 | 右上角的紫色按鈕(帶 圖示),點下去進入評估設定頁:在那裡填入或生成題目、設定受測對象,並啟動評估。畫面上另有一個叫「評估」的頁籤(歷次紀錄清單),兩者不同。 |
「最新版本」是什麼?為什麼是 0
這個數字指的是資料集項目(題目)的版本,不是資料集設定的版本:只有整批匯入或同步項目成功才會加一,讀取一律只讀最新那一版。逐筆新增或生成的題目不會讓它加一,所以一份有題目的資料集也可能一直是 0——這個數字不代表題庫是空的。
資料集沒有「驗證」功能
資料集詳細頁不提供「驗證憑證/測試連線」按鈕——它不連外部系統。它的用途是當作評估的題庫,效果見下方「使用效果」。
評估設定頁¶
點詳細頁右上角的「開始評估」按鈕進入評估設定頁(網址結尾是 /evaluation)。畫面分成兩邊:左邊是「執行設定」卡片,設定「要用什麼來跑這批題目」;右邊是資料集項目清單,也就是題庫本身。左邊卡片右上角的收合鈕可以把它收起來,讓題庫佔滿整個畫面。

上圖是一份還沒有任何題目的資料集:右側清單顯示「找不到更多結果。」,工具列上需要有資料才能用的按鈕(刪除、匯出)也是灰的。整頁的流程是:先在左側設定「用什麼跑」→ 在右側填入題目 → 按頁面右上角(資料集名稱那一列的右端)的「開始執行與評分」啟動。注意那顆鈕不在執行設定卡片的右上角——卡片右上角是收合鈕。
左側「執行設定」卡片的完整欄位、評分器設定與結果怎麼看,都在資料集評估。 這一頁往下只說明右側的題庫怎麼管理。
右側的資料集項目清單¶
這一節講的都是「開始評估」按鈕進去後的那一頁——按那顆鈕只是開設定頁,不會直接開跑評估,可以放心按。
右側就是題庫。上方是「搜尋資料集項目 ID」搜尋框,右邊一排圖示鈕是這份題庫的操作;表格每一列是一筆題目。點任一列會在表格右側打開這一筆的「詳情窗格」:標題是資料集項目 ID,內容由上而下是「輸入欄位」「輸出欄位」「執行輸出」(跟著題目本身的順序:先看題目,再看標準答案,最後才是這次跑出來的結果),長內容不再受表格欄寬截斷;窗格和項目表格把右側題庫區對半分(不是整個畫面對半分——左邊還有「執行設定」卡片),中間的分隔線可左右拖曳、位置會被記住,右上角標題列還有 「執行」(等同下方單筆試跑)、 選單(「詳細資料」「編輯」「刪除」——「詳細資料」會把這一筆的資訊頁另開分頁)與 「關閉」:

| 欄位 | 內容 |
|---|---|
| 輸入欄位 | 這筆題目的輸入內容,欄名就是資料集定義的輸入欄位(例如 question)。滑鼠移到欄名上會顯示該欄位的「描述」。 |
| 輸出欄位 | 這筆題目的預期輸出(標準答案),欄名定義的輸出欄位(例如 expected_answer)。 |
| 執行輸出 | 跑完評估後才會填入,放的是受測 LLM/Agent 這次實際的回答,供和「輸出欄位」對照。尚未跑過時顯示 -;重新整理或離開這一頁後也會退回 -,要留存請用匯出。 |
工具列的圖示鈕(沒有項目時,需要選取或需要有資料的按鈕會呈灰色停用;灰掉時滑過去只會看到按鈕名稱、不會說明為什麼不能按,原因一律是「沒勾選任何項目」或「沒有資料」):
| 按鈕 | 作用 |
|---|---|
| 重新整理 | 重新載入資料集項目清單。 |
| 刪除 | 刪除勾選的資料集項目;未勾選任何項目時停用。一次最多 100 筆——勾超過 100 筆同樣會停用,滑過顯示「一次最多能處理 100 筆項目。」。按下後會先跳出確認對話框(標題「刪除資料集項目」),列出即將刪除的項目 ID,確認後才真的刪除。 |
| 將資料集項目匯出至儲存庫 | 把項目匯出成檔案存到儲存庫,見下方匯出資料集項目至儲存庫。沒有項目時停用。 |
| 編輯資料集項目欄位 | 開啟選單,可「新增欄位」「刪除欄位」「編輯欄位」——也就是在這裡改這份資料集的輸入/輸出欄位定義,不必回到資料集編輯表單。「編輯欄位」對話框把所有欄位攤成一張只有「名稱」「描述」的清單,不分輸入/輸出;要確認某個欄位屬於哪一類,回詳細頁的「一般」頁籤看兩張表格。 |
| (紫色) | 開啟選單,用來填入題目,見下方填入題目。 |
| 表格最右緣的展開鈕,把清單推成寬版檢視方便看長內容;題庫是空的時候也在。 |
這份清單的「每頁筆數」最多只到 100
清單底部的「每頁筆數:」只提供 10、20、50、100 四個選項,沒有其他清單常見的 200。原因是資料集項目的新增、刪除都是「一次最多 100 筆」,把每頁筆數壓在 100 以內,才能讓「全選這一頁」永遠是個做得到的操作。題庫超過 100 筆時就用翻頁分批處理。
填入題目:新增、生成或從儲存庫取代¶
點右側工具列紫色的 鈕會展開一個選單,三個選項:

| 選項 | 作用 |
|---|---|
| 新增資料集項目 | 開對話框逐筆手動填入這一筆的輸入欄位與輸出欄位內容,見下方新增資料集項目。 |
| 以儲存庫內容取代目前資料集項目 | 從儲存庫 (Storage) 選一個先前匯出(或自行準備)的檔案,整批取代目前的項目,見下方以儲存庫內容取代目前資料集項目。 |
| 生成資料集項目 | 請大型語言模型依指示自動產生題目,見下方生成資料集項目。 |
一次最多 100 筆
平台處理資料集項目時,一次請求最多 100 筆。所以「新增資料集項目」對話框最多只能排 100 列(滿 100 列後底部的「+」會變灰,滑過顯示「一次最多能處理 100 筆項目。」),批次刪除也一樣。題目更多時就分幾次送,或改用下方的以儲存庫內容取代目前資料集項目整批匯入(那條路走的是背景同步,不受 100 筆限制)。
新增資料集項目¶
逐筆手動輸入題目。對話框中央是一張表格,欄名就是這份資料集的輸入與輸出欄位(下圖為 question 與 expected_answer);剛開啟時表格是空的,按底部中央紫色的「+」一列一列加上去,一次可以排到 100 列,最後按右上角「儲存」把整批送出。

| 元素 | 作用 |
|---|---|
| (表格底部中央、紫色) | 新增一列,開啟填寫內容的對話框(見下方填寫單筆項目的內容)。已經排到 100 列時停用,滑過顯示「一次最多能處理 100 筆項目。」。 |
| 重新打開這一列的填寫對話框,修改內容。 | |
| 把這一列從表格移除。還沒按「儲存」,所以不會動到題庫。 | |
| 每列最左側的把手 | 拖曳調整列的順序。 |
| 表格底部的換頁與「每頁筆數:」 | 這張表格自己也會分頁,預設一頁 10 列。排到第 11 列之後就要翻頁才看得到,不是列不見了。列數還不到一頁時,對話框底部不會出現這排控制項,找不到是正常的。 |
| 放棄 | 關掉對話框,整批放棄,什麼都不會存進題庫。 |
| 儲存 | 把表格裡的所有列一次送出,成功後題庫立刻多出這些題目。 |
填寫單筆項目的內容¶
按「+」或 後開啟的對話框,會依這份資料集的欄位定義,一個欄位一個輸入框(欄位標籤就是資料集定義的欄位名):

| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| (每個輸入欄位/輸出欄位各一個) | 否 | 空白 | 這一筆題目在該欄位的內容。可以直接寫純文字(例如一個問題、一段標準答案),也可以填 JSON 值(數字、true/false、陣列、物件)——需要比對結構化結果時很有用。輸入框帶行號,右上角工具列的說明見通用介面元件 — 編輯器工具列。 |
填完按「儲存」回到上一層表格(這一步還沒寫進題庫)。按「放棄」是丟掉這一列,但會先跳出一個「放棄修改/你所做的修改將不會被保存。」的確認框:按「放棄」才真的丟掉,按「取消」是回到剛才那一列繼續編輯。
有幾筆沒存成功時:重試對話框¶
按「儲存」後,如果有部分列沒能寫入,平台不會只丟一句錯誤,而是跳出一個對話框,沒存成功的那幾列會原封不動保留,可以直接重試:

| 元素 | 說明 |
|---|---|
| 標題 | 一筆都沒存成功時是「資料集項目未儲存成功」;有部分已經存進去時是「部分資料集項目未儲存成功」,此時上方會多一行「成功儲存 N 筆資料集項目!」標示已經進去幾筆(這個數字是累計的,按過幾次「再次儲存」都會一起算)。 |
| 「{N} 筆資料集項目未儲存成功:」 | 這次有幾列沒存成功。 |
| 錯誤原因 | 表格第一欄,每列沒存成功的原因。文字過長會截斷,按左邊的 展開看全文( 收合)。 |
| 資料欄位 | 錯誤原因之後,依序是這份資料集的各個欄位,內容就是剛才輸入的那幾列,方便核對。同樣可用展開鈕看完整內容。 |
| 取消 | 關掉對話框。 |
| 再次儲存 | 把表格裡剩下的這幾列重新送一次。若這次全部成功,對話框會自動關閉、題目出現在清單上;若還有失敗,對話框會留下仍未成功的那幾列,可再試。 |
關掉這個對話框,那幾筆就要重新輸入
這個對話框不會因為點旁邊空白處而關閉——它是刻意設計成必須自己決定的。但只要按了「取消」(或關掉它),沒存成功的那幾列就永久消失了,平台不會留稿,只能回到「新增資料集項目」重新輸入一次。所以看到這個對話框時,先按「再次儲存」試一次;真的要放棄,也請先把還需要的內容複製下來。
為什麼會存不進去?
這裡的失敗不是欄位格式檢查——格式有問題會在按「儲存」時就被擋下來,不會走到這個對話框。可能的原因有兩類:一是寫入當下暫時不順(例如短時間內大量寫入),這種按「再次儲存」通常就成功了;二是某一列的內容太大寫不進去,這種重試不會變好,要先回去把那一列的內容縮短。若反覆按「再次儲存」都停在同樣幾列,請把「錯誤原因」的文字提供給系統管理者協助查看。
以儲存庫內容取代目前資料集項目¶
已經有一份整理好的題庫檔案(例如先前匯出的檔案,或自己用 Excel 整理後另存的檔案)時,用這條路一次匯入。它是「取代」不是「附加」:送出前會先跳出「取代現有的資料集項目」確認對話框(內文「上傳的檔案將取代目前的資料集項目。請確認是否要繼續。」),按「確認」後目前的項目會全部被檔案內容換掉。
| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 儲存庫 | 是 | (無) | 檔案放在哪個儲存庫 (Storage)。點欄位會另開一個選取對話框,要點該列最左邊的選鈕再按「儲存」(點名稱會離開這個表單)。選定後才會出現下面的欄位。 |
| 檔案 | 是 | (無) | 儲存庫裡的檔案。點欄位會開一個兩層的檔案瀏覽器:先看到資料夾,要點資料夾名稱鑽進去才看到檔案,再點該列最左邊的選鈕、按「儲存」。只支援 JSONL 與 CSV,平台是看檔案的內容類型判斷的,不符的列會停用並顯示「僅支援 CSV, JSONL 檔案。」。選好後右側「檔案預覽」會顯示這個檔案的內容與欄位,未選檔案時顯示「選取檔案後,可在此預覽。」。 |
| 輸入欄位 | 是 | 空 | 表格。從檔案裡的欄位挑出哪些要當輸入欄位,每筆有「名稱」與「描述」。 |
| 輸出欄位 | 否 | 空 | 表格。同上,挑出哪些欄位是預期輸出。 |
| 僅儲存選定欄位 | 否 | 關閉 | 開關。開啟後,檔案裡沒被選進「輸入欄位」「輸出欄位」的其他欄位就不會存進題庫;關閉則整列照原樣收進來。 |
這條路會改掉資料集的欄位定義
在「輸入欄位」「輸出欄位」表格裡挑的欄位,會一併覆寫這份資料集本身的欄位定義——不只是這次匯入的資料長相。既有的評估設定、評分指示裡引用的欄位名如果因此消失,那些引用就會失效。拿一個既有題庫做匯入前,先確認欄位名和原本一致。
整份檔案清單都選不動時,是內容類型的問題
這個挑選器是看檔案的內容類型(不是副檔名)判斷格式的:內容類型不是 CSV 或 JSONL 的檔案一律停用,滑過去顯示「僅支援 CSV, JSONL 檔案。」。所以副檔名明明是 .csv/.jsonl 卻選不動是有可能的,那不是你操作錯誤——問題在那個檔案存進儲存庫時被標成什麼內容類型。整份清單都選不動時,請換一個確定是以 CSV/JSONL 內容類型上傳的檔案,或改用逐筆新增與生成;必要時請系統管理者確認儲存庫那邊的內容類型。
匯入是在背景執行的,跑完後才會顯示結果;若有部分列沒匯入成功,會跳出一個對話框標示這次有幾筆沒成功。匯入期間請留在這一頁——離開頁面平台就不再追蹤這次的進度,會看不到結果(實際匯入仍會在背景跑完)。
生成資料集項目¶
沒有現成題庫時,讓大型語言模型依指示直接產生一批題目。對話框的欄位:

| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 生成指令 | 是 | 空白 | 告訴模型要生成什麼樣的題目(例如「針對退換貨政策產生常見客服問題與標準答案」)。模型會同時參考各欄位的「描述」。 |
| 附件 | 否 | 空 | 表格(欄位為「名稱」「儲存庫」),用中央的紫色 逐筆新增。可指定儲存庫裡的檔案當生成依據,讓題目貼近實際文件。 |
| 範例 | 否 | 空 | 表格,欄名就是這份資料集的輸入/輸出欄位(上圖為 question、expected_answer)。還沒定義任何欄位的資料集,這張表格會是空的,請先回資料集加欄位。填幾筆示範,讓生成結果的風格與格式跟著範例。 |
| 執行大型語言模型 | 是 | 平台預設 LLM | 負責生成題目的 LLM 資源(與左側受測用的 LLM 各自獨立)。右側的 鈕可覆寫這次的模型參數。 |
| 生成數量 | 否 | 10 | 滑桿,這次要產生幾筆題目,可拉 1 到 30。 |
| 儲存此次設定 | 否 | 開啟 | 開關。開啟時會記住這次的生成設定,下次開啟對話框直接沿用(實測記得住的是「生成指令」;「生成數量」下次會回到預設 10,要幾筆記得重新拉)。 |
對話框右上角有「重設」(清空回預設)、「放棄」與「產生」。按「放棄」會先跳出「放棄修改/你所做的修改將不會被保存。」的確認框,要再按一次「放棄」才會關掉——就算一個欄位都沒動也一樣會問(匯出對話框也是這個行為)。按「產生」後模型要跑一會兒(實測生成 2 筆約 20 秒,期間沒有明顯進度提示),跑完會跳出「選擇資料集項目」對話框,提示「請勾選要新增到資料集的資料集項目:」並列出這次生成的內容——勾選要留下的那幾筆,再按「新增」才會真的存進題庫(每列最右邊的展開鈕可以看完整內容,左邊那個是勾選框,表頭那個是全選;右上角「放棄」則整批不要)。預設一筆都沒有勾,而「新增」在零勾選時照樣按得下去——什麼都沒勾就按,題庫不會有任何變化,很容易誤以為生成失敗。這一步等於也是在存檔,所以同樣可能跳出重試對話框。
單筆試跑¶
題庫填好、左側「執行設定」卡片也設定好之後,可以先挑一筆試跑,確認提示詞寫對了再跑整批:
- 把滑鼠移到右側清單中要跑的那一列上。
- 該列右側會多出 「執行」(這顆是滑鼠移過去才出現的,要按的就是它)與 選單(「詳細資料」「編輯」「刪除」,單筆題目要改或要刪就從這裡)。點「執行」。(點列上其他地方是開詳情窗格——窗格標題列也有同一顆「執行」,在窗格裡按效果相同。)
-
平台會用左側「執行設定」目前的設定跑這一筆:「使用者提示詞」裡的
{{ 欄位名 }}會換成這一列的實際內容,送給所選的受測對象。欄位名就寫資料集定義的名字,例如題庫的輸入欄位叫question時,提示詞可以寫成:你是人資助理。請回答以下問題:{{ question }} -
執行中該鈕會轉圈、提示文字變成「執行中 ...」;通常幾秒到十幾秒,跑完後同一列的「執行輸出」欄就會填入這次的實際回答,可與旁邊的「輸出欄位」(預期輸出)逐筆對照。
- 需要重跑就再按一次;要換模型或改提示詞,就改左側「執行設定」再按。

試跑結果不會留著
「執行輸出」只存在目前這個畫面:重新整理、切到別頁再回來,該欄就退回 -,左側「執行設定」也會清空重填。試跑是拿來當場確認提示詞對不對的,不是紀錄;要留下結果請用整批評估(它會存成該次評估的紀錄)或匯出。
單筆試跑只會產生輸出,不會打分數
這顆「執行」鈕跑的只有執行階段——它把回答填進「執行輸出」欄,不會經過評分器。要拿到通過率報表,得用頁面右上角的「開始執行與評分」跑整批,見資料集評估。
「執行」鈕變灰時:提示「請先完成執行設定中的必填欄位。」
左側「執行設定」還沒填完時,「執行」鈕會停用,滑過顯示「請先完成執行設定中的必填欄位。」。常見情形:「使用者提示詞」空白、執行器類型選「Agent」但還沒選 Agent,或選「結構化大型語言模型」但 JSON Schema 還沒定義任何屬性。補齊後就可以按了。
匯出資料集項目至儲存庫¶
題庫填好、或跑完評估想留存時,可以把資料集項目匯出成檔案存到儲存庫 (Storage)。
- 在評估設定頁右側資料集項目清單的工具列,點 「將資料集項目匯出至儲存庫」。
- 選擇要存到哪個「儲存庫」。點這個欄位會再開一個「儲存庫」對話框(搜尋框+名稱/狀態/最後更新表格),要點該列最左邊的圓形選鈕再按右上角「儲存」才算選好。別點資源「名稱」——那是連結,會離開匯出對話框、跳去該儲存庫的詳細頁,得整個重來。
- 視需要選擇「資料夾」(同樣是另一個選取對話框,選法一樣);選了資料夾之後才會出現「檔案名稱」欄位,這時就必須填檔名。
- 選擇「格式」(JSONL 或 CSV)。
- 點「儲存」開始匯出,完成後會顯示「資料集項目已匯出」對話框。
| 欄位 | 必填 | 預設 | 說明 |
|---|---|---|---|
| 儲存庫 | 是 | (無) | 要存放檔案的儲存庫資源。選定後才會出現「資料夾」與「檔案路徑」(「格式」一開始就在畫面上)。 |
| 資料夾 | 否 | (無) | 儲存庫裡的目標資料夾;不選則由平台自動決定路徑與檔名(實測會放進儲存庫的 dataset-export/ 資料夾,不是根目錄)。 |
| 檔案名稱 | 是(選了資料夾時) | (無) | 選了「資料夾」之後才會出現這個欄位,出現後必填。檔名最長 255 字,不可含儲存庫不允許的符號。副檔名會依所選格式自動加上,不用自己打。 |
| 格式 | 否 | JSONL | JSONL(每行一筆,適合再餵給程式或其他評估工具)或 CSV(適合用 Excel 開)。 |
欄位下方的「檔案路徑」會即時顯示這次會寫進去的完整路徑;沒指定資料夾時顯示「將自動產生檔名。」。
匯出完成的對話框會顯示「已成功匯出 N 筆資料集項目至 <路徑>」,並提供兩個按鈕:「下載」直接把檔案存到本機,「開啟儲存庫」在新分頁打開該儲存庫的檔案清單。若檔案已匯出但自動下載失敗,畫面會提示到儲存庫手動下載。
沒有任何項目時匯出鈕是灰的
資料集還沒有任何項目、且沒有套用搜尋或篩選時,匯出鈕會停用——沒有東西可以匯出。先填入或生成項目再匯出。
使用效果¶
資料集本身不會執行,它的價值在於「拿去評估」。完整走完一輪是五步:
- 點詳細頁右上角的「開始評估」按鈕進入評估設定頁。
- 在右側用紫色 填入題目——逐筆「新增資料集項目」、用「生成資料集項目」請模型自動產生,或「以儲存庫內容取代目前資料集項目」整批匯入。
- 在左側「執行設定」卡片指定要受測的大型語言模型、Agent 或工作流程,並寫好「使用者提示詞」(用
{{ 欄位名 }}代入每筆題目的輸入)。 - 先挑一列按 「執行」單筆試跑,確認提示詞寫對了:該列的「執行輸出」會填入實際回答,與「輸出欄位」(預期輸出)並排對照。
- 確認沒問題後,按頁面右上角的「開始執行與評分」跑整批並加上評分器,得到通過率報表——見資料集評估。
想留存題庫或某一輪的結果,用工具列的 匯出到儲存庫。
簡單說:填入「輸入/預期輸出」→ 設定受測對象 → 批次執行與評分 → 看通過率與逐筆評分理由,用來驗證 Agent/工作流程的回答是否符合預期。要把受測對象建好,見大型語言模型(評估設定頁的預設執行器類型就是它)、Agent 與工作流程。
下一步¶
- Agent:可用資料集評估其回答品質。
- 樣板 (Template):搭配資料集設計可重複使用的提示。
- 工作流程:同樣可用資料集驗證輸出是否符合預期。
- 資料集評估:設定執行器與評分器、批次跑完整份題庫並看通過率。