1 of 50

1

智能化勞動法律助手:

RAG技術的妙用!

數位科技處 數位應用三部 簡郁庭

2 of 50

2

簡郁庭(yuting chien)

tilly0426@gmail.com

中國信託商業銀行 數位科技處

機器學習 自然語言處理

https://github.com/tilly963963/law_rag_qa

關於我

智能化勞動法律助手:RAG技術的妙用!

3 of 50

3

系統展示

智能化勞動法律助手應用場景

RAG技術的妙用

結語與QA

從 Gen AI 浪潮切入,探討金融業在應用LLM 時所面臨的需求與挑戰,並分享此次報告的專案靈感與目標。

將技術應用於法規資料中,分析其痛點,並提出解決之道與實踐方案。

展示現階段的成果,並通過多個案例來分享我們的經驗。

1.

2.

3.

4.

4 of 50

4

智能化勞動法律助手應用場景

  • Gen AI 浪潮與影響
  • 金融業應用大型語言模型的需求與挑戰
  • 專案目標與技術背景

5 of 50

5

  • ChatGPT 問世以後,生成式 AI (Generative AI)顛覆各行各業,為企業創造出新的產品價值商業模式

  • 超過三分之二的產業受到生成式 AI的影響,其中高科技、金融和醫療產業受到的影響最大。

  • 生成式AI在金融業展現高潛力,適用於客戶經營、銷售、風控等業務場景。

business functions

Industries

Gen AI 浪潮與影響

1

2

3

the economic potential of generative AI the next productivity frontier (mckinsey June 14, 2023)

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

6 of 50

6

金融業應用大型語言模型的需求與挑戰

垂直應用

精準度

隱私保護

智能客服 優化客戶體驗

  • 大型語言模型通常為通用模型,需額外融合金融相關資訊。
  • 微調模型的成本高昂,需高額的計算資源與專業知識。
  • LLM產生的幻覺或錯誤回答可能影響整體功能的可靠性。
  • 考量隱私與敏感資料保護,可能傾向選擇閉源LLM,以保障數據安全私並享有其強大功能。

透過大型語言模型與自然語言處理技術,理解內部人員的金融法規詢問,提供關鍵資訊並即時回應。

藉由大型語言模型協助理解客戶詢問,查找相關資訊,並提供專業人員回應,完成金融諮詢任務。

LLM

業務痛點+需求 = 客製化 AI 解決方案

應用挑戰

生成式AI推動金融創新應用改變客戶互動方式

法規智能問答 提升內部效能

1

2

3

知識歸納

推論規劃

文本生成

建立新的服務與銷售方法

重塑員工工作模式

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

7 of 50

7

資料收集與整理

問題

回答

搜尋結果

智能化勞動法律助手 的 概念構思

支持資料上傳

  • 以法規智能問答為靈感,創造高感度AI服務

痛點與設計方向

建議採用RAG架構,

強化大型語言模型在勞動法律知識問答的應用

專案構想

整合勞動法律知識

精確回應

法律問題

提供可靠的

法規來源

單獨依賴LLM難以準確回答

法規閱讀

&理解難度高

  1. 艱澀的專業術語
  2. 複雜的法律條文結構
    • 多個條件和例外情況
  3. 勞動法規範籌廣泛
    • 工時、休假、工資、勞動安全
  4. 法規資訊零散,需輔以其他法規解釋
  5. 法規持續修訂

結合大型語言模型與自然語言處理技術,並以勞動法律知識為基礎打造問答系統。

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

8 of 50

8

資料收集與整理

問題

回答

搜尋結果

智能化勞動法律助手 的 概念構思

支持資料更新

  • 以法規智能問答為靈感,創造高感度AI服務

痛點與設計方向

專案構想

整合勞動法律知識

精確回應

法律問題

提供可靠的

法規來源

法規閱讀

&理解難度高

  1. 艱澀的專業術語
  2. 複雜的法律條文結構
    • 多個條件和例外情況
  3. 勞動法規範籌廣泛
    • 工時、休假、工資、勞動安全
  4. 法規資訊零散,需輔以其他法規解釋
  5. 法規持續修訂

結合大型語言模型與自然語言處理技術,並以勞動法律知識為基礎打造問答系統。

建議採用RAG架構,

強化大型語言模型在勞動法律知識問答的應用

單獨依賴LLM難以準確回答

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

9 of 50

9

RAG 如同通過 Open Book 回答問題

Retrieval-Augmented Generation

  • 由 Patrick Lewis 等人於 2020 年提出
  • 通過檢索外部資料,生成符合問題需求的答案,提升大型語言模型的回答質量和準確性

考試中使用開卷答題的方式來彌補知識的不足

  • 融入領域知識
  • 減少幻覺
  • 提高LLM回答精準性

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

10 of 50

10

RAG 如同通過 Open Book 回答問題

在 ChatGPT 問世之前,RAG 是如何 Generate ?

    • 將資訊嵌入預先定義好的模板或規則來構建答案
    • 生成模型

1990s

2013

2018

2022

n-gram

初步生成能力

達到輔助功能

統計語言模型

神經語言模型

預訓練語言模型

大語言模型

RNN-LM, Word2Vec

克服數據稀疏

捕捉語意之間的關聯

ELMO. BERT,GPT-1/2

有效捕捉上下文特徵

遷移學習應用於更複雜的任務

GPT-3/4,ChatGPT,

Claude

上下文理解、生成能力大幅提升,處理更廣泛工作

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

11 of 50

11

ChatGPT 加速 RAG 的發展

Transformer 架構

透過提示和推理來生成答案

大量LLM模型釋出

Fine-tuning

融⼊額外知識

RAG演化樹

Retrieval-Augmaented Generation for Large Language Models: A Survey(Yunfan Gao , 2024)

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

12 of 50

12

Retrieval

Generate

Prompt Engineering

LLM Model

Chunking

Embedding Transformation

Document Loader

Vector Database

Embedding Transformation

Query

Output

Document

Similarity Search

基礎的 RAG 架構

Data Preparation

2

3

1

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

13 of 50

13

Retrieval

Generate

Prompt Engineering

LLM Model

Chunking

Embedding Transformation

Document Loader

Vector Database

Embedding Transformation

Query

Output

Document

Similarity Search

三階段的 重要性 與 探討議題

Data Preparation

大型語言模型將檢索資訊轉化為流暢答案

高質量資料使模型更精確地找到相關內容,生成可信答案

為什麼文本需要Chunking?

    • 模型輸入長度限制
    • 提高檢索、生成結果
          • 較小的區塊可聚焦於特定知識點,更適合回答具體問題。;較大的區塊適合處理需要上下文連貫的文件,避免打斷連貫性
          • 切分大小與數量影響 Prompt 能夠放入的資訊量

基礎的 RAG 架構

檢索結果為 LLM 提供知識,決定了生成時參考的資訊是否正確且相關。

1

2

3

  • 詞嵌入模型挑選
  • 檢索方法(混合搜索、父文檔搜索)
  • 檢索前、後處理
  • LLM 模型挑選 / prompt 優化

14 of 50

14

RAG技術的妙用

    • 法規資料的RAG架構

15 of 50

15

Pre-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

(法規文本切割策略)

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Vector Database

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Similarity Search

Optimization Function

法規資料的 RAG 架構

Post-Retrieval Processing

Small2Big

聚焦檢索範圍

提高命中率

調整檢索結果

提高大型語言模型的答案生成品質

提高資料品質,以利後續查找與生成

2

3

1

16 of 50

16

Post-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Silarity Searchim

Post-Retrieval Processing

Small2Big

Data Preparation:高質量資料使模型更精確地找到相關內容,生成可信答案

  • 探索法規資料
  • 探討切割方法的局限 & 客製化切割策略

Vector Database

1

17 of 50

17

法規資料特性

資料來源

全國法規資料庫網站-勞動類別

探索法規資料

法規文本篇幅較長,高達4000字

結構具有章、節、條等層次性

資料複雜且具有層次與規則性

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

18 of 50

18

僅使用單一方法無法有效處理複雜結構文本,需依據不同需求靈活選擇適合的方式。

常見切割策略

說明

固定長度切割

  • 適合結構簡單、字數多的文件,ex:書籍、長篇文章
  • 容易造成語句不連貫

滑動窗口切割

  • 適合需要保持上下文連續性的文件,ex:對話、故事
  • 容易出現段落不完整或重疊的情況

基於段落的切割

  • 段落分隔明確的文本,ex:報告
  • 可能導致單段內容過長

基於主題的切割

  • 按特定主題分類的文件、語意完整,ex:新聞、參考書
  • 方法依賴主題識別算法,實現成本高

探索法規文本切割方法:現有切割方法具有局限性

方法 1:一般的切割策略

  • 錯誤切分導致語意不完整,影響檢索準確性與生成品質

方法 2:現有框架切割

根據預設方法切分,難以精確處理法規中的細節,無法適應法規層次結構

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

19 of 50

19

探索法規文本切割方法:建立客製化切割策略

  1. 根據法規的結構(如章、節)進行切塊
  2. 保留切割過程中遺失的關鍵訊息(例如章名稱)

Step 2 固定長度切割

Step 1 章節結構分割

  1. 將過長的章節區塊細化分割成上限1000 字的知識點
  2. 保留切割可能遺失的關鍵資訊(例如節名稱)

區塊1

區塊2

. . . . . .

知識點1

知識點2

  • 保留語意完整性
  • 提升搜尋的效度

方法 3:法規文本切割策略

結構字數雙重角度實現法規文本的精細化分割

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

20 of 50

20

探索法規文本切割方法:建立客製化切割策略

Step 2 固定長度切割

Step 1 章節結構分割

區塊1

區塊2

. . . . . .

結構字數雙重角度實現法規文本的精細化分割

方法 3:法規文本切割策略

  1. 將過長的章節區塊細化分割成上限1000 字的知識點
  2. 保留切割可能遺失的關鍵資訊
  1. 根據法規的結構(如章、節)進行切塊
  2. 保留切割過程中遺失的關鍵訊息

此章有兩小節,依照節切成兩個區塊

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

21 of 50

21

探索法規文本切割方法:建立客製化切割策略

  1. 根據法規的結構(如章、節)進行切塊
  2. 保留切割過程中遺失的關鍵訊息

Step 2 固定長度切割

Step 1 章節結構分割

區塊1

區塊2

. . . . . .

結構字數雙重角度實現法規文本的精細化分割

方法 3:法規文本切割策略

  1. 將過長的章節區塊細化分割成上限1000 字的知識點
  2. 保留切割可能遺失的關鍵資訊

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

22 of 50

22

探索法規文本切割方法:建立客製化切割策略

  1. 根據法規的結構(如章、節)進行切塊
  2. 保留切割過程中遺失的關鍵訊息

Step 2 固定長度切割

Step 1 章節結構分割

區塊1

區塊2

. . . . . .

結構字數雙重角度實現法規文本的精細化分割

方法 3:法規文本切割策略

知識點1

知識點2

針對過長的章節,

依照字數進行二次切塊

  1. 將過長的章節區塊細化分割成上限1000 字的知識點
  2. 保留切割可能遺失的關鍵資訊

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

23 of 50

23

探索法規文本切割方法:建立客製化切割策略

  1. 根據法規的結構(如章、節)進行切塊
  2. 保留切割過程中遺失的關鍵訊息

Step 2 固定長度切割

Step 1 章節結構分割

區塊1

區塊2

. . . . . .

結構字數雙重角度實現法規文本的精細化分割

方法 3:法規文本切割策略

知識點1

知識點2

  1. 將過長的章節區塊細化分割成上限1000 字的知識點
  2. 保留切割可能遺失的關鍵資訊

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

24 of 50

24

方法

步驟

優點

缺點

法規文本切割策略

  1. 章節結構分割
  2. 固定長度切割
  • 能保留資料結構,確保知識點完整性
  • 長度切割提升處理效率
  • 需要了解資料結構,實作複雜
  • 專屬解決方案,無法應用到其他業務中

現有框架分割

依賴內建方法

  • 方便快速

通常依賴內建方法進行切割,直接使用無法達到預期的效果

以常見方式切割

固定長度/滑動窗口/段落/結構/主題的切割

  • 方便快速

使用單一方法切割無法精細處理特資訊,造成資訊遺漏

探索法規文本切割方法:三種切割方式的差異

法規文本切割策略能夠提升後續檢索的精準度,同時確保生成階段的語意完整性

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Data Preparation

25 of 50

25

Post-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Vector Database

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Similarity Search

Post-Retrieval Processing

Small2Big

2

Retrieval:檢索的精準度決定了系統能否從海量資料中找到與使用者問題相關的內容,影響生成時參考的資訊是否正確且相關。

  • 挑選合適的詞嵌入模型
  • 測試模型在問答集中的表現

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

26 of 50

26

MTEB Chinese leaderboard(簡體), FlagEmbedding Leaderboard

Embedding

model

Max

input token

vectoer

成熟度

Price

text-embedding-3-large

8191

(3072)

$0.13 / 1M tokens

text-embedding-3-small

8191

(1536)

$0.02 / 1M tokens

Embedding

model

Max

input token

8191

multilingual-e5-large

512

Cost

Implementation

Model Training,

Data Access

Quality Control

Updates & Maintenance

Open-source

lower-cost or free

slower

Open data access, customizable training

Varies by project and community

Community-driven

Closed-source

Higher cost, often with subscription fees

easy

Limited data access, pre-trained models

Company-driven

Company-driven

開源/閉源

模型選擇

挑選詞嵌入模型 關鍵因子與取捨

檢索精準度是問答系統成功的關鍵

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

27 of 50

27

  • 勞動部網站中搜集56題FAQ
  • 涵蓋工資、請假、性別平等工作、職災補償等議題

測試集Query-Source

答案為單一知識點組成

題目為指定法條問答

答案由多知識點組成

勞動基準法第84條之1規定為何?

請假程序的相關規定?雇主要求勞工請事病假均須提出證明文件,有違法嗎?

題型以複雜度分類

1. 勞工請假規則第10條規定:「勞工請假應於事前親自以口頭或書面敘明請假理由......

3. 另勞工請生理假,參酌性別平等工作法施行細則第13條規定...應無須檢附相關證明文件。

42

9

5

依勞動基準法第84條之1規定,經核定公告之工作者,得由勞雇...之限制。

勞工請事、病假是否有天數限制

勞工請假規則第4條及第7條規定,勞工因....

蒐集準則

  • 答案中需要有明確的法條來源

Q

A

*答案參考兩條法規,但在切割後屬於同一個區塊章節,檢索到一個知識點為正確

*需要檢索多個知識點才能回答正確

*檢索到該法規所屬的知識點為正確

挑選詞嵌入模型 檢索能力測試

從題型的複雜度來評估模型的精準度和表現

* 問題通常較具體,符合實際應用

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

28 of 50

28

Number of Hits

Mrr

text-embedding-3-large

text-embedding-3-small

text-embedding-3-large

text-embedding-3-small

題目為指定法條問答(9)

9

8

0.917

0.90

答案為單一知識點組成(42)

36

35

0.75

0.744

答案由多知識點節組成(5)

1題命中所有知識點,3題命中部分知識點

1題命中所有知識點,2題命中部分知識點

-

-

Number of Hits

Mrr

multilingual-e5-large

multilingual-e5-large

題目為指定法條問答(9)

8

8

0.768

0.791

答案為單一知識點組成(42)

35

34

0.719

0.72

答案由知識點章節組成(5)

3題命中部分知識點

2題命中部分知識點

-

-

挑選詞嵌入模型:分析 不同題型複雜度表現

  • 評測方法使用命中數量、平均倒數排名(Mean Reciprocal Rank)
  • 開源模型 BAAI/bge-m3 表現優秀
  • text-embedding-3-large 表現最佳,後續由此嵌入模型進行實驗

*命中率代表模型能成功檢索到正確答案的次數

*Mrr為模型排序答案正確位置的能力

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

29 of 50

29

Pre-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Vector Database

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Similarity Search

Post-Retrieval Processing

Small2Big

Pre-Retrieval Processing:聚焦檢索範圍,降低查找難度,提高搜尋精準度

  • Select Law Label
  • Law NER

2

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

30 of 50

30

法規標籤系統,定位搜索範圍

1

檢索前處理:聚焦檢索範圍,降低查找難度

Step 1 :提取問題中的法規名稱

Step 2:判斷其法規標籤

Step 3:執行標籤系統

法規NER技術+法規標籤系統:從小範圍中檢索

勞動基準法 、勞動基準法實施細則 、…

勞動基準法

高效檢索

範例

陷阱題目

3

步驟改善

2

勞動基準法實施細則

縮小檢索範圍、加速搜尋、提升命中度10%

Step 1

Step3

勞動基準法 、勞動基準法實施細則 、…

透過篩選標籤,縮小搜索範圍

系統介面

設計靈感

Q

勞動基準法實施細則第14條

A

系統只在該標籤中進行檢索

答案 題目指定法條,

檢索容易錯誤

Step 2

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

31 of 50

31

Post-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Vector Database

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Similarity Search

Post-Retrieval Processing

Small2Big

Post-Retrieval Processing:優化檢索結果

,提高大型語言模型的答案生成品質

- Small2Big 維持語意完整性

2

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

32 of 50

32

加班費沒發怎麼辦?

檢索後處理 : Small2Big 維持語意完整性

  • 概念:小塊找大塊
  • 將檢索區塊擴展回完整章節,以提高LLM生成內容的準確性與完整性。
  • 避免語意不連貫或法規參照

Small2Big

知識點

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Retrieval

33 of 50

33

Post-Retrieval Processing

Retrieval

Generate

Select Law Label

Law NER

Prompt Engineering

Select LLM Model

Law Chunking

Document Classifers

Embedding Transformation

Document Loader

Law Label

Data Preparation

Vector Database

Select Embedding Model

&

Transformation

Query

Output

Document

全國法規

資料庫網站

Silarity Searchim

Post-Retrieval Processing

Small2Big

Generate:生成答案的準確性、完整性、流暢性是影響使用者滿意度的核心要素

  • Select LLM Model
  • Prompt Engineering

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

34 of 50

34

挑選語言模型:開源與閉源模型的性能比較

HuggingFace

LLM Leaderboard v2 2024.7.26

Open / Close LLMs 2024.7

  • 閉源 整體表現優於 開源
  • 開源:Llama(Meta), qwen2(阿里巴巴)
  • 閉源:GPT-4o、Gemini 1.5 Flash

調整評估基準後的榜單,

提高榜單可靠性和公平性

參考網站:https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

35 of 50

35

挑選語言模型:開源與閉源模型的性能比較

模型

時間

公司

模型大小

輸入長度

輸入價格(1M)

輸出價格(1M)

說明

GPT-4o

2024. 5

OpenAI

-

128,000 

$5

$15

卓越的語言理解、生成、多模態處理和推理能力,有廣泛的知識,適用於多種場景和領域。

Gemini 1.5 Flash

2024. 5

Google

-

128,000 

$0.15

$0.6

卓越的語言理解,適合長文本處理和多模態推理,擅長資料分析。

2024.4

林彥廷團隊

70b(141GB)

8000

-

-

基於llama3以繁中英語資料庫進行微調,微調知識涵蓋台灣法律、製造、醫療和電子領域。

2024

聯發科

研發小組

7b(15GB)

8000

-

-

基於Mistral所訓練的中英雙語模型,擅長結構化數據處理。

Qwen2-72b

2024

阿里巴巴

72b(41GB)

128,000  

-

-

支援27種語言,擅長長文本生成、邏輯推理與代碼生成。

參考網站:https://context.ai/compare/gpt-4o/llama3-70b-instruct-v1

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

36 of 50

36

Prompt (System Role)

你的任務是根據法規知識庫資料與使用者問題提供“答案”和“法規來源”,“答案”是指法規知識庫中與問題最相關的法條內容;“法規來源”是指其對應的法規名稱、法規章節、完整法條。

法規知識庫的資料是由數個與問題相關的法規知識點組成,當中的法規知識點是依照相關性排序,與問題越相關的知識點排在越前面。以n個法規知識點為例,格式如下:

```

***排序第1名相關的法規知識點***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

***排序第2名相關的法規知識點***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

***排序第3名相關的法規知識點***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

...

***排序第n名相關的法規章節***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

```

問題:<question>

注意事項:

1. 根據法規知識庫資料與問題提供“答案”和“法規來源”,“答案”是指法規知識庫中與問題最相關的法條內容;“法規來源”是指其對應的法規名稱、法規章節、完整法條。

2. “答案”與“法規來源”不允許編造。如果無法從法規知識庫資料得到答案,請回答“無法得知答案,請您重新提問”。

3. 回答請使用繁體中文

Prompt (User Role)

以下是法規知識庫的資料,法規知識庫的資料是由數個與問題相關的法規知識點組成,當中的法規知識點是依照相關性排序,與問題越相關的知識點排在越前面:

```

***排序第1名相關的法規知識點***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

...

***排序第n名相關的法規章節***

法規來源:

-法規名稱:<法規名稱> / 法規章節:<法規章節>

法條內容:

<法條>:<text>

```

問題:<question>

說明User Role所遵循的格式

指令(輸出內容、LLM無法回答時的處理、語言限制)

任務描述

檢索的知識點

實際問題

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

37 of 50

37

挑選語言模型:透過2個面向評測模型

Rule Base

Model Base

答案正確性

Answer correctness

答案相似性

Answer semantic similarity

評分模型

  • 答案 與 真實答案 相比的準確性
  • 分數越高表示生成的答案與基本事實之間的一致性越高
  • 答案 與 真實答案 之間的語義相似性的評估。
  • 透過向量衡量語義的接近程度
  • GPT-4作為監督模型,評估模型答案 與 真實答案 相比的得分

同詞嵌入模型評測(勞動部常見問答集,共56題)

模型評測

參考依據

測試資料

LLM 生成結果的評估相對困難,具有主觀性和複雜度

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

38 of 50

38

挑選語言模型:評測結果

gpt-4o

system role

我會給你兩段文本,一段是正確答案,另一段是模型生成,請你評分模型生成的文本,以0~100分計算, 分數越高,代表模型生成的文本與正確答案越相似,請考量語意、覆蓋率等。 請回傳分數及你判斷的原因。

user role

正確答案:

{ans}

模生產生:pred}

Answer correctness

Answer similarity

gpt-4o

Gemini 1.5 Flash

Llama3-

Taiwan-70b

qwen2-70b

gpt-4o

Gemini 1.5 Flash

Llama3-

Taiwan-70b

qwen2-70b

題目為指定法條問答

0.982

0.979

0.907

0.912

0.93

0.931

0.926

0.929

答案為單一知識點組成

0.985

0.954

0.93

0.89

0.94

0.929

0.923

0.92

答案由多知識點組成

0.836

0.823

0.806

0.792

0.945

0.91

0.824

0.812

GPT-4評測得分

gpt-4o

Gemini 1.5 Flash

Llama3-

Taiwan-70b

qwen2-70b

題目為指定法條問答

95

97

92

88

答案為單一知識點組成

92

91

88

79

答案由多知識點組成

73

71

69

66

題目指定法條->各模型準確度都很高

答案由多知識點組成->所有表現都不理想

題型

開源模型 Llama3-Taiwan 表現優異

GPT-4o 兩種評估方法表現最佳

模型

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

39 of 50

39

閉源模型(gpt-4o)

開源模型(Llama-3-Taiwan-70B)

LLM

回答

正確答案

我要開辦公司,需不需要依勞動基準法第70條規定報核工作規則

案例

  • 勞動部常見問答集

題目為指定法條問答

正確提供答案與法規來源

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

40 of 50

40

閉源模型(gpt-4o)

開源模型(Llama-3-Taiwan-70B)

LLM

回答

正確答案

喪假規定為何?

  • 勞動基準法常見問答集

答案為單一知識點組成

正確提供答案與法規來源

案例

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

41 of 50

41

閉源模型(gpt-4o)

開源模型(Llama-3-Taiwan-70B)

LLM

回答

正確答案

勞工請事、病假是否有天數限制?

多條法規

正確提供答案與參考的兩條法規

案例

答案為單一知識點組成

  • 勞動基準法常見問答集

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

42 of 50

42

閉源模型(gpt-4o)

開源模型(Llama-3-Taiwan-70B)

LLM

回答

正確答案

答案由多知識點組成

勞工依法辦理離職,公司可否扣留當月份工資

僅正確回答部分答案

無法回答

案例

  • 勞動基準法常見問答集

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate

43 of 50

43

系統展示

44 of 50

44

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Q:請婚假會被扣全勤獎金嗎?如果因為扣發全勤獎因導致工資低於基本工資有違法嗎?

45 of 50

45

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Q:現在基本薪資是多少

46 of 50

46

結語與QA時間

47 of 50

47

  • 構建領域知識的檢索資料庫,並採用法規文本切割策略,強化數據檢索時的能力。

  • 挑選中文大型語言模型,測試答案表現。
  • 優化Prompt,使LLM更精準解析法律文本,同時提供答案與參考來源

結語 與 QA

高 知識結合性

  • 適用於領域知識問答場景。

高 實用性

  • RAG 結合閉源模型的應用,兼顧資料安全與模型表現。
  • 利用LLM整合法規知識,提供高質量且符合法律語境的回應。

高 可靠性

  • 以相關的法規知識輔助LLM生成答案,漸少幻覺、無中生有。

Retrieval

Generate

Data Preparation

結合 RAG技術 勞動法律知識,並運用 多項優化策略,打造智能化勞動法律助手。

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

48 of 50

48

感謝大家的聆聽!

49 of 50

50 of 50

50

案例 - Bad Case

gpt-4o

無法回答不在資料庫中的答案

需求與挑戰

RAG技術的妙用

系統展示

建議與QA

Generate