Hugging Face AI Sheets 教學:無程式碼建立與擴增資料集
Hugging Face AI Sheets 是一個把「資料集處理」做成試算表介面的開源工具:你可以匯入文字、表格或圖片,替每一欄設定 AI 動作,再把模型輸出整理成新的欄位。它的價值不是讓 AI 自動完成整個機器學習專案,而是把清理、分類、擷取、標註與資料擴增等重複工作變成可反覆試驗的流程。
原本的文章只留下泛用模板,沒有真正教讀者怎麼使用 AI Sheets,也沒有交代模型、推理費用、隱私與人工檢查。這次更新以 Hugging Face 官方部落格、目前的 開源 GitHub README 與產品頁為基礎,補上從小批量測試到匯出資料集的完整路徑。
先給結論:AI Sheets 適合把資料變成「可用欄位」
AI Sheets 的核心概念很簡單:每一列是一筆資料,每一欄是一種資訊,而 AI 動作會讀取既有欄位,產生摘要、標籤、分類、翻譯、結構化欄位或圖片結果。你不必先寫 Python 才能試驗提示詞,但仍要自己決定資料格式、模型、驗收規則與最終用途。
| 你手上的資料 | 可以讓 AI Sheets 做什麼 | 可能輸出的欄位 |
|---|---|---|
| 評論、客服訊息、文章或產品描述 | 摘要、分類、情緒/主題標籤、翻譯、關鍵字擷取 | summary、category、language、keywords |
| CSV、Parquet 或 Hugging Face Dataset | 依既有欄位產生新欄位、合成問答、整理格式 | question、answer、clean_text、quality_note |
| 收據、文件、截圖、圖表或照片 | OCR、描述、物件/類別標註、結構化擷取 | raw_text、merchant、date、amount、caption |
| 文字與圖片提示 | 生成或編輯圖片,建立內容素材的多個版本 | image、variant、alt_text、review_status |
AI Sheets 後來多了什麼?
Hugging Face 在 2025 年 8 月介紹 AI Sheets 時,主打使用開放模型無程式碼建立、豐富與轉換資料集;工具可部署在 Hugging Face Hub,也可以在本機執行。2025 年 10 月的更新再加入視覺支援,讓圖片可以被檢視、分析、擷取資訊、生成與編輯。這代表現在的 AI Sheets 不只是文字試算表,也能處理圖片資料工作流。
官方目前的開源說明還列出幾個重要邊界:預設可透過 Hugging Face Inference Providers 使用開放模型,也可以接符合 OpenAI API 規格的自訂或本地模型;不過文字轉圖片功能目前仍使用 Hugging Face Inference Providers,不能完全改成自訂端點。這些差異會直接影響費用、資料是否離開本機與可重現性。
開始前先準備資料與安全規則
- 先定義輸出欄位:不要只寫「幫我整理資料」,先決定要新增哪些欄位、允許哪些值、空值怎麼表示。
- 保留原始資料:建立一份唯讀副本,讓 AI 產生的欄位和原始欄位分開,之後才能比較與回溯。
- 抽出小樣本:先用 10~50 筆測試提示、模型與輸出格式,確認品質後才跑完整資料集。
- 移除不必要的個資與秘密:不要把 API key、密碼、身分證號、完整客戶紀錄直接貼到雲端推理服務。
- 確認授權:資料集、圖片、模型與輸出可能有不同授權條款;能匯出不代表可以任意公開或拿去訓練商業模型。
實作教學:用 AI Sheets 新增一個 AI 欄位
步驟一:選擇 Hugging Face Space 或本機部署
最快的方式是開啟 AI Sheets Space 試用,不必先安裝專案。若資料不能離開自己的環境,可以依 README 用 Docker 或 pnpm 啟動;本機推理則要準備 Hugging Face token 或自己的模型端點。
步驟二:匯入資料
依資料型態匯入 CSV、Parquet、文字檔、圖片資料夾或 Hub 上的 Dataset。匯入後先檢查欄名、空值、編碼、圖片路徑與列數。若原始資料把多種資訊塞在一個長欄位,先考慮拆成幾個可驗證的欄位,再交給模型處理。
步驟三:在新欄位寫清楚 AI 動作
每個 AI 動作應包含輸入欄位、輸出格式與錯誤處理方式。例如,若 review 欄位是使用者評論,可以要求模型只回傳下列其中一個類別:bug、feature_request、praise、other;並另設 reason 欄位保存簡短理由。這比要求模型一次寫長篇分析更容易檢查。
範例提示:讀取「評論」欄位,將內容分類為 bug、feature_request、praise 或 other。只輸出一個類別;若證據不足,輸出 other,不要猜測。
步驟四:選模型與推理提供者
模型不是越大越好。短摘要或固定分類可以先用速度較快、成本較低的模型;需要圖片 OCR、複雜推理或多語言內容時,再比較視覺模型或更大的模型。AI Sheets 把模型與 prompt 分開,方便用同一批樣本做 A/B 比較;記下模型 ID、提供者、日期與 prompt 版本,之後才知道結果為何改變。
步驟五:只先執行小批量並人工檢查
先檢查 10~50 筆輸出:格式是否一致、分類是否越界、空值是否合理、語言是否自然、圖片擷取的數字是否正確。官方的圖片更新也示範了可以手動修正結果、以 thumbs-up 提供範例,再重新生成其餘資料;這表示人工校正應該是流程的一部分,不是最後才抽查幾筆。
步驟六:匯出與留下資料卡
確認品質後再批次執行,將結果匯出成 CSV 或 Parquet,或上傳到 Hugging Face Hub。建議同時保存資料來源、欄位說明、模型與版本、prompt、抽樣驗證結果、已知錯誤與授權資訊,讓其他人知道這個資料集不是原始真值,而是經過 AI 輔助處理的版本。
五種常見工作流
| 工作流 | 做法 | 驗收重點 |
|---|---|---|
| 文字分類 | 從客服訊息或評論產生固定類別 | 類別集合固定、少數類別不被模型忽略、保留不確定樣本 |
| 結構化擷取 | 從文件、收據或網頁文字抽出日期、金額、公司名 | 數字、日期與幣別逐欄檢查,不能只看自然語言是否通順 |
| 合成問答 | 用既有文件或段落產生 question/answer 欄位 | 答案必須可回指來源,避免模型補出文件沒有的內容 |
| 圖片 OCR 與標註 | 用視覺模型轉錄文字、描述圖片或加上類別 | 小字、表格、手寫內容與敏感資料要人工複核 |
| 圖片生成與編輯 | 由文字欄位生成縮圖、社群素材或多種視覺版本 | 檢查版權、人物肖像、品牌規範與圖片中的錯字 |
成本、模型與本機部署怎麼選?
AI Sheets 可以降低「寫一次性腳本」的門檻,但不保證每次執行都更便宜。雲端 Inference Providers 會依模型、提供者、輸入輸出量與帳戶方案計費;圖片與長文件通常比短文字分類更耗資源。開始前先跑小樣本,記錄每列成本與重試比例,再決定是否擴大。
| 情境 | 較適合的選擇 | 主要取捨 |
|---|---|---|
| 快速試驗、資料不敏感 | Hugging Face Space+Inference Providers | 設定最快,但要接受雲端推理費用、服務限制與資料傳輸 |
| 需固定成本或資料不能外傳 | 本機模型或自有 OpenAI 相容端點 | 控制力較高,但要自行負責硬體、模型下載、更新與監控 |
| 大規模、規則非常固定 | AI Sheets 做原型,再轉成 Datasets/Python/SQL pipeline | 需要工程投入,但更容易做版本、重試、測試與成本控制 |
本機端點需要符合 OpenAI API 規格,README 以 MODEL_ENDPOINT_URL 與 MODEL_ENDPOINT_NAME 指定服務;若使用 Ollama,也要先啟動相容的 API。這讓 AI Sheets 可以接自有模型,但不代表所有功能都能完全離線,尤其目前文字轉圖片仍依賴 Hugging Face 的推理服務。
資料品質與隱私檢查表
- 輸入檢查:確認欄位編碼、語言、空值與重複列;先清掉不該送出的秘密。
- 輸出檢查:用固定測試集檢查格式、數字、否定句、專有名詞與少數語言。
- 來源追蹤:每個合成欄位都保留原文或來源 ID,讓人工可以回到上下文。
- 模型紀錄:保存模型 ID、provider、prompt、執行時間與錯誤率。
- 授權檢查:確認輸入資料、模型、輸出圖片和最後發布位置的授權相容。
- 可重現性:不要只匯出最後的 CSV;把 prompt、範例、人工修正與版本一併保存。
哪些情況不該只用 AI Sheets?
AI Sheets 很適合探索、資料增補與中小型批次工作,但不是資料治理、資料庫或模型訓練本身。若任務需要嚴格的交易一致性、醫療/金融決策、數十億列的可靠重跑、細緻的存取控制或可證明的標註一致率,應把 AI Sheets 當成前期原型,後續改用有測試、版本與審核的 pipeline。AI 產生的欄位也不應直接被當成 ground truth。
常見問題 FAQ
AI Sheets 真的不需要寫程式嗎?
基本的匯入、欄位操作與 prompt 工作流不需要寫程式;但本機部署、token 管理、資料清理、批次排程與品質測試仍可能需要技術能力。無程式碼降低的是開始試驗的門檻,不是免除資料工程責任。
一定要使用 Hugging Face 的模型嗎?
預設路徑是 Hugging Face Hub 與 Inference Providers,也可以接符合 OpenAI API 規格的自訂或本地模型。模型是否可用仍取決於端點、授權、硬體和功能支援。
AI Sheets 會直接訓練我的模型嗎?
它主要是建立、清理、標註、擴增與匯出資料集;完成後仍需用其他訓練工具或平台微調模型。不要把「產生資料」和「訓練模型」當成同一件事。
圖片 OCR 的結果可以直接使用嗎?
不建議。圖片解析會受解析度、手寫、版面、反光與模型能力影響。金額、日期、醫療內容、合約文字與身分資訊都要人工複核,並保留原始圖片作為證據。
結論:先小批量驗證,再把 AI 接進正式流程
Hugging Face AI Sheets 的真正優勢,是把模型、prompt 與資料欄位放在同一個可視化工作流中,讓非工程使用者也能快速試驗資料標註與擴增。它最適合的用法不是「把整份資料丟給 AI 就相信結果」,而是先定義欄位、抽樣、比較模型、人工修正,再匯出一份有來源和版本紀錄的資料集。
如果你只需要一次性整理幾百筆文字或圖片,AI Sheets 可以省下不少原型時間;如果你要長期、大規模、可稽核的資料管線,則應把這次試驗轉成有測試與監控的正式 pipeline。這樣才能同時得到 AI 的速度與資料品質的可控性。
官方參考資料
- Hugging Face:Introducing AI Sheets
- Hugging Face:Unlock the power of images with AI Sheets
- Hugging Face AI Sheets organization page
- GitHub:huggingface/aisheets README
- AI Sheets Space
- Hugging Face Datasets:Create a document dataset















