1 of 42

智慧方案 Intellicon Solutions LLC

AI Agent 與資料清洗

Claudia Chen

2024.12.24

2 of 42

2

    • 為什麼資料清洗對AI至關重要?
    • 資料正規化與標準化
    • 常見資料問題及其對AI影響

綱要

    • 資料清洗的基本流程

3 of 42

3

為什麼資料清洗對AI至關重要?

4 of 42

AI 共 3 本柱:得一可安天下

5 of 42

圖片來源:iKala Sega

6 of 42

    • 2016年成立Scale AI,共同創辦人Alexandr Wang,1997年出生。
    • 幫助OpenAI、NVIDIA、TOYOTA等大型企業做AI數據標記。
    • 2024/05/21由美國創投Accel領投,NVIDIA、亞馬遜和Meta等科技巨頭跟投的F輪募資中,籌集了10億美元(約新台幣320億元),整體估值達到140億美元(約新台幣4,500億元)。
    • Scale AI服務
      • 數據標記
      • 圖像辨識標註
      • 音頻轉文字
      • 圖像轉文字
      • 公共數據搜集
      • 模型訓練

7 of 42

  • Profile :若水國際資訊股份有限公司
  • 成立時間:2007年
  • 資本額:5.9億元
  • 員工人數:80人(不含居家身障工作者)
  • 主要業務:建築資訊模型(BIM)整合服務、Al數據處理服務

8 of 42

針對自動駕駛、自然災害、交通流量、環境、能源等影像進行數據標註。

9 of 42

RAG 與 LLM 的概念流程

10 of 42

  • 是一種將資料檢索與生成式人工智慧結合的技術。它的主要目標是利用檢索過程來提高生成式模型的準確性和一致性。
  • 在 RAG 中,生成式模型(如 GPT)會在生成內容之前先從一個檢索系統中獲取相關的外部資料(例如知識庫、文件庫或網頁資料),然後再基於這些資料來生成更精確的回答或內容。這樣的流程可以避免生成模型依賴於訓練資料中有限的資訊,並提升生成結果的可靠性。

RAG (Retrieval-Augmented Generation) 是什麼?

11 of 42

1.檔案文字提取

文字提取包含了各種來源、檔案格式(word, pdf, 圖片, 影片, 網頁等等)的資料,且不僅僅是擷取文件中的文字,如何保留文件中有意義的表格、圖片與流程圖等等的非文字資訊才是關鍵。

2.文字資訊切檔

大型語言模型都有輸入文字的上限,在過去,為了避免無法提供完整文件內容給大型語言模型的問題我們會將提取出來的檔案文字做切檔。若無此動作,每次呼叫大型語言都提供超長提示詞會導致費用高昂,因此文字資訊切檔仍有其必要性。

3.文字轉向量

文字轉向量是將資料儲存進向量資料庫前的最後一步,不同的 embedding 模型可以依照不同應用任務(文本搜尋、分類、分群等等),最佳化文字轉向量的結果,完整保留文字中的語意資訊。

資料處理的步驟

12 of 42

    • 提高資料準確性:AI 模型依賴大量數據進行訓練,而資料中若含有錯誤、重複或不一致的內容,會導致模型學習到錯誤的模式和資訊。
    • 減少雜訊干擾:在原始資料中往往存在許多不相關或無意義的數據(即“雜訊”),這些資料會讓模型難以捕捉到重要的特徵。
    • 提升資料一致性:清洗過的資料格式統一、結構清晰,這讓模型更易於學習和應用。統一的資料格式還能減少模型處理過程中的錯誤,並提升計算效率。
    • 改善預測精準度:清洗資料後,模型得到的輸入更加準確和相關性強,這會直接提升模型的預測或生成結果的精準度,使得 AI 系統更適合在真實場景中應用。

為什麼資料清洗對AI至關重要?

13 of 42

13

常見資料問題及其對AI影響

14 of 42

1. 資料不完整

  • 問題描述:關鍵資料缺失或無法覆蓋所有需求,導致部分問題無法解答或給出準確的回應。
  • 對 AI 的影響:AI 可能因缺少某些重要資訊而無法提供準確或全面的回答,導致結果不可靠,並且模型可能無法應對特定的查詢。

2. 資料過時

  • 問題描述:知識庫中的資訊未能及時更新,包含舊數據或已經無效的資訊。
  • 對 AI 的影響:AI 會根據過時的資訊進行生成,可能導致錯誤的回答或推薦不再適用的建議。例如,若數據未更新,AI 在回答法規、產品規格或市場趨勢等時會產生偏差。

3. 資料重複

  • 問題描述:同一內容在知識庫中以不同的格式或表述重複出現。
  • 對 AI 的影響:重複資料可能導致 AI 偏向重複的答案,浪費模型資源,並可能使回答顯得冗長或產生不必要的重複。

常見資料問題及其對AI影響

15 of 42

4. 資料不一致

  • 問題描述:知識庫中不同來源或版本的資料內容互相矛盾,例如產品的規格數據在不同地方不一致。
  • 對 AI 的影響:AI 在回答時可能因無法判斷哪個版本正確而給出混淆或錯誤的答案,從而影響用戶的信任度。

5. 資料冗餘

  • 問題描述:知識庫中存在過多不相關或無用的資訊,導致搜尋效率低下。
  • 對 AI 的影響:冗餘資料增加了 AI 的處理負擔,使模型在檢索和生成時容易受到干擾,降低回答的精確性和效率。

6. 資料格式不統一

  • 問題描述:知識庫中的資料使用不同的格式(例如日期格式、數字單位、文本標籤等),缺乏統一性。
  • 對 AI 的影響:格式不統一會影響模型對資料的理解,特別是數據解析和比較,導致模型無法正確使用或識別某些資訊。

常見資料問題及其對AI影響

16 of 42

7. 資料噪聲

  • 問題描述:知識庫中包含大量無用或不相關的資訊(如拼寫錯誤、重複標點、錯誤字詞等)。
  • 對 AI 的影響:噪聲會影響模型的學習效果,可能導致 AI 給出無關或錯誤的回答,並降低整體回應的質量。

8. 資料缺乏上下文

  • 問題描述:知識庫中的資料缺乏必要的上下文或關聯性,導致模型無法理解關鍵概念或具體場景。
  • 對 AI 的影響:AI 在生成回答時可能因缺乏上下文而出錯,給出不適當的建議或回答無法精確回應問題。

9. 多語言資料不精準

  • 問題描述:知識庫包含多語言資料,但翻譯不準確,或不同語言的資料內容不對應。
  • 對 AI 的影響:AI 可能產生語言混淆或翻譯錯誤,無法正確理解或生成多語言回應,特別是在需要多語言支持的應用場景中表現不佳。

常見資料問題及其對AI影響

17 of 42

不標準案例

  • 空值不確定意義
  • 一個欄位有多個名稱
  • 「9月」二字放在零件名稱意義不明
  • A行無標示是規格?型號?

18 of 42

不標準案例

  • AI無法判對各方塊的相對位置意義(順序、補充)

19 of 42

19

資料清洗的

基本流程

20 of 42

2.數據清理

4.數據轉換

5.數據規範化

3.數據減少

檢測和修正資料集中的錯誤(例如缺失值、異常值、重複值、不必要標點符號。)

資料清洗後需要轉換成AI模型可以處理的格式,例如Markdown語法。

建立日後新增/修改數據的規範,以利後續持續訓練AI。

減少資料集的大小可以使資料集更易於管理。

資料預處理的關鍵階段

1.資料蒐集

先確認預期產出結果,再返回去蒐集相關資料。

21 of 42

21

資料正規化與標準化

22 of 42

結構化格式:CSV

  • 適用於: 資料表格、標籤分類、數據分析
  • 範例: 產品報價資料表,可以包括產品名稱、價格、類別等欄位。

AI 的訓練資料建議檔案格式

23 of 42

結構化格式:純文本 (TXT)

  • 適用於: 情緒分析、對話生成或長文本訓練模型。內容可以是多段文字,無需特殊標記。
  • 範例: 行銷文案、產品介紹

AI 的訓練資料建議檔案格式

24 of 42

結構化格式:對話格式 (JSON)

適用於: 對話系統訓練。JSON 格式讓每組對話方便地存為字典型態,包含用戶的問題和 AI 回答。

AI 的訓練資料建議檔案格式

25 of 42

AI 的訓練資料建議檔案格式:Markdown

1. 易於編寫和閱讀

Markdown 是一種輕量級標記語言,語法簡單且易於閱讀,能使撰寫文件的過程更加順暢。即使在純文字編輯器中查看 Markdown 文件,語法也不會影響文檔的可讀性,這對於技術文件和知識庫內容來說尤其重要。

2. 跨平台支持

Markdown 文件可以在多種環境下進行編輯和預覽,例如文字編輯器(如 VS Code、Notepad++)或知識管理工具(如 Notion、Obsidian)。許多協作平台(如 GitHub、Confluence)也都支持 Markdown,在不同平台上更方便地進行內容管理。

3. 格式一致、易於轉換

Markdown 支援基本的文本格式(標題、清單、粗體、連結等),且能保持格式一致。通過轉換工具,Markdown 文件可以很容易地導出為 HTML、PDF、Word 等格式,適合需要不同格式文件的場景。

26 of 42

AI 的訓練資料建議檔案格式:Markdown

4. 支援版本控制

Markdown 文件是純文本格式,便於進行版本控制(如使用 Git)。在知識庫維護中,可以輕鬆追蹤和回溯內容的變更,對於記錄知識更新或多作者協作非常實用。

5. 嵌入程式碼和圖片,適合技術文檔

Markdown 支援程式碼塊和圖片嵌入,使它非常適合技術性內容。知識庫中通常包含程式碼範例、流程圖等視覺化內容,Markdown 能夠簡單且有效地展示這些資訊,方便讀者理解。

6. 兼容 RAG(檢索輔助生成)和 AI 訓練需求

在 RAG 和 AI 訓練中,數據的結構化和易讀性非常重要。Markdown 文件能夠將文本分割為不同層級的段落、標題和標籤,讓 AI 更容易識別知識點和上下文,有助於提高生成內容的準確性和一致性。

27 of 42

使用#符號來建立標題。#的數量代表標題的層級,從1到6級標題不等。

# 一級標題

## 二級標題

### 三級標題

#### 四級標題

##### 五級標題

###### 六級標題

# 療程

## 皮秒雷射

主要可以用於擊退黑色素、治療斑點。

### 皮秒雷射價格

1999/堂

##海神雷射

擁有獨特的「複合式波長雷射」與「3P散熱冷卻技術」。相比單一波長的除毛雷射,海神除毛雷射可透過較少的治療次數,達到更完整的除毛效果。

###海神雷射價格

2999/堂

範例

Markdown文件格式:標題階層

28 of 42

使用![替代文字](圖片URL)來插入圖片。

#照片集

![山海圳地圖](https://g.intellicon.tw/data/MSTW/mstw-map.jpg)

範例

Markdown文件格式:圖片

29 of 42

使用+++、---、*** 或 ___,可讓資料切片擷取完整段落。

範例

# 療程

## 皮秒雷射

主要可以用於擊退黑色素、治療斑點。

### 皮秒雷射價格

1999/堂

***

##海神雷射

擁有獨特的「複合式波長雷射」與「3P散熱冷卻技術」。相比單一波長的除毛雷射,海神除毛雷射可透過較少的治療次數,達到更完整的除毛效果。

###海神雷射價格

2999/堂

Markdown文件格式:分隔線

30 of 42

若想要讓用戶問問題時,能夠精準叫出知識庫的答案,可以用” ”來強調。

索夫波是藝人"郭雪芙"代言的

範例

Markdown文件格式:強調詞

31 of 42

使用 * 或 _ 包住文字表示斜體,雙重 ** 或 __ 表示粗體。

*斜體*_斜體_

**粗體** __粗體__

範例

Markdown文件格式:文字格式

32 of 42

使用 [連結文字](URL) 的格式來插入連結。

[Google](https://www.google.com)

範例

Markdown文件格式:連結

33 of 42

Q

A

智慧方案有什麼服務

利用生成式 AI 與企業知識庫打造專屬「智慧問答系統」。

智慧方案技術優勢

1. 串接最新的 AI 模型

2. 專為企業應用場景量身打造的 AI 提示工程

3. 幫助 AI 連結各領域工具(Function Call)

智慧方案營業時間

全年無休

可以用EXCEL檔儲存,並將Q設成一欄,A設成一欄。

範例

FAQ問答集

34 of 42

1. 資料清洗

  • 去除噪聲:刪除不必要的符號、表情符號和 HTML 標籤等,確保文本乾淨。
  • 拼字與格式校正:檢查拼字錯誤和語法問題,以提高檢索和生成的準確性。
  • 停用詞去除:若資料以非重要的頻繁詞為主(如“的”、“了”等),可以根據需要去除這些詞,但在語境敏感的場景中可能保留效果更好。

2. 資料標準化

  • 轉換文字大小寫:統一將文本轉換為小寫(或視情況決定),減少檢索時的敏感度。
  • 數字正規化:若文本中包含數字,可以將數字轉換成統一的格式,如“1,000”轉換為“1000”。
  • 時間和日期格式化:將日期和時間格式標準化,如“2024/1/1”統一轉為“2024-01-01”。
  • 命名實體標準化:對常用詞或名稱進行統一,如公司名稱、人名等。

3. 分段處理

  • 句子或段落分段:長文可能需要分段,以確保檢索到的片段具有上下文完整性。可以按段落或主題劃分,確保檢索返回時每個段落都自成一體。
  • 小段落分割:對於大文本資料集,可以將資料切成 100-300 字的小段,方便檢索更精確。

資料正規化與標準化

35 of 42

35

示範案例

36 of 42

36

原資料問題

  1. 標題與分類明確化:目前表格中的標題不夠明確,建議根據不同的主題(如「無刀眼袋」、「塑顏針」、「EECP」等)設立清晰的分類標題,方便用戶快速找到所需資訊。
  2. 格式統一與視覺整理:可以將每個主題的內容統一格式化,例如用標題、子標題、條列式或段落區分資訊,使得內容結構更清晰,閱讀起來更容易理解。
  3. 增加關鍵詞標籤:針對每個項目,添加關鍵詞或標籤(tags),例如「治療」、「副作用」、「效果維持」、「費用」等,以便後續能夠快速搜尋特定資訊。

愛爾麗診所智能客服 - 資料清洗前

37 of 42

37

原資料問題

  • 標題與分類清晰化:建議在標題上加入更具體的描述。例如「固力磁治療點」、「EECP體外反搏中心」、「高壓氧療程地點」、「手術現場諮詢服務地點」。
  • 區域排序與標準化:在每個分類下的地點建議按地理區域或字母順序排列,這樣可以更容易瀏覽和查找。例如可以按照北、中、南、東區域的順序排列,或者按行政區劃排序。
  • 資訊補充:每個地點僅列出地名,但缺少詳細資訊。
  • 用詞過於中性:例如「竹北」、「忠孝」、「博愛」,容易造成同一地點因用語差異而出現不同的搜尋結果。

愛爾麗診所智能客服 - 資料清洗前

38 of 42

38

原資料問題

  • 分類標題更具體:目前使用的標題如「貼文留言回覆」或「效果?」略顯籠統。可以將標題具體化,如「客服訊息模板」、「療程效果說明」等,清楚說明各欄位的主題。
  • 條列式整理:對於內容較多的回答,可以考慮使用條列式或分段方式呈現,散落多行會讓AI查找不易。
  • FAQ格式應用:如果此資料用於常見問題解答,可以考慮將每個問題以FAQ形式呈現。例如「私訊開頭問候」,讓AI可以依照不同情境選擇適合的範例。
  • 減少冗長文字:簡化重複的內容,保持回覆簡潔。例如在「音波維持多久?」這部分,可以直接回答核心訊息並提供建議,避免使用不必要的長句。

愛爾麗診所智能客服 - 資料清洗前

39 of 42

39

原資料問題

  • 資訊不結構化:資訊結構應該統一。例如:
    1. 療程簡介
    2. 適用對象
    3. 療程效果
    4. 價格與優惠
    5. 注意事項
  • 應多用條列寫法來標記重點式
  • 資訊冗長與重複:例如優惠活動與療程簡介多次提及同樣的信息。
  • 價格資訊不一致:有些用文字描述,有些用符號(💰)。

愛爾麗診所智能客服 - 資料清洗前

40 of 42

40

愛爾麗診所智能客服 - 資料清洗後

資料整理重點

  1. 檔案改存成txt檔。便於AI閱讀。
  2. 使用#符號來建立標題。#的數量代表標題的層級
    1. ##療程名稱
    2. ###療程功效
    3. ###療程價格
  3. RAG切片分段寫法用「 +++ 」來做分隔。
  4. 冗言贅詞清除,以產品說明書方式撰寫資料,取代原先客服話術。

41 of 42

41

愛爾麗診所智能客服 - 資料清洗後

Q

A

無刀眼袋會痛嗎?

療程是將微小的絕緣電波針深入脂肪細胞,會使用局部麻藥,幾乎沒有痛感喔

無刀眼袋是手術嗎?

無刀眼袋使用絕緣電波針,非手術方式,很適合有眼袋但是真的不敢手術/不想動手術的貴賓,恢復期短、安全性高,是目前首選去除眼袋的推薦療程喔

隱痕切眉手術要多久?

手術時間約1-3小時左右,只需要局部麻醉,且全程都會保持清醒

想要淡斑

可以透過皮秒雷射改善呦

「皮秒雷射」一機多效

.提亮膚色:改善暗沉、膚色不均

.淡化斑點:黑色素、雀斑、曬斑、顴骨斑、肝斑、黑色痘疤等

.改善膚質:改善毛孔、細紋、凹疤

我想了解『皮秒雷射全臉不限發數2111』

💖皮秒雷射(全臉不限發數),體驗價$2111

小編預約送您

杏仁酸-清粉刺+術後修護(活氧美人)

我想了解『燃脂點滴/3次』

💖燃脂點滴3次共$3999

透過燃脂點滴幫助

.燃燒脂肪

.降低疲勞感

.幫助提升代謝

皮下脂肪型/內臟脂肪型都適合

線上預約到院免費贈送【InBody 專業身體組成與肥胖全面分析】,由專業醫師評估您的療程次數達到理想體態

資料整理重點

  • QA問答用EXCEL檔儲存,將Q設成一欄,A設成一欄。
  • 需要制式回覆的另外用QA方式整理。

42 of 42

GPT is only as smart as the users.