1 of 12

TrustGuard AI

Kiểm tra trước khi hành động — dựa trên bằng chứng

FINAL

Security Triage cho phishing, scam và giả mạo có kiểm soát

Nhóm thực hiện: G04 – T068

Đoàn Nhật Bình – 2A202602018

Lê Trung Hiếu – 2A202601917

Bùi Duy Hải – 2A202601878

Vũ Minh Đức – 2A202602006

Mentor:Lưu Trọng Hiếu

TrustGuard AI

01 / 14

2 of 12

Bối cảnh

Người dùng cần một lớp kiểm tra trước khi chuyển tiền, đăng nhập hoặc cung cấp thông tin

Tin nhắn và URL đáng ngờ thường thúc giục hành động ngay

Các yêu cầu phổ biến: đăng nhập, gửi OTP, cung cấp thông tin, chuyển tiền

Khó kiểm tra nhanh danh tính, liên kết và dấu hiệu lừa đảo

Hậu quả có thể là mất tài khoản, dữ liệu hoặc tiền

TrustGuard AI

02 / 14

3 of 12

Bài toán

Bài toán trung tâm mà TrustGuard AI giải quyết

“Biến một tình huống đáng ngờ, thiếu cấu trúc thành kết luận rủi ro có bằng chứng và hướng dẫn hành động an toàn.”

1

Xác định phạm vi

2

Thu thập evidence

3

Phân loại risk

4

Đưa ra khuyến nghị

TrustGuard AI

03 / 14

4 of 12

Phạm vi sản phẩm

Security Triage v4 cho phishing, scam, giả mạo và hành động nhạy cảm

Trong phạm vi

Ngoài phạm vi

Phishing và đánh cắp credential/OTP

Giả mạo thương hiệu

Financial / recruitment / promotion scam

URL investigation có consent

Report, appeal và Security Admin review

General fact-check

Deepfake detection

Malware sandbox

Tư vấn đầu tư

AI tự thực hiện quyết định quản trị

TrustGuard AI

04 / 14

5 of 12

Giải pháp tổng thể

Một pipeline v4: từ input của người dùng đến phản hồi có căn cứ và human review

Người dùng / Chrome Extension

Scope Gate

Structured Context

Investigation

Trust & Official Verification

Typed Evidence

Deterministic Risk v1–v7

Grounded Response

Persistence & Human Review

Consent-aware

TrustGuard AI

05 / 14

6 of 12

Điểm khác biệt: TrustGuard AI

Bổ sung Security Triage theo tình huống, bên cạnh tra cứu và cảnh báo URL

Khía cạnh

Chongluadao.vn

TrustGuard AI

Đối tượng kiểm tra

URL/IP/điện thoại/email; blocklist

Tin nhắn + URL + hành động nhạy cảm

Quan hệ với tổ chức

Tra cứu công khai không công bố xác minh exact resource/action endorsement

Official-link verification có provenance, giới hạn theo exact resource/action

Khuyến nghị hành động

Cảnh báo/chặn website có rủi ro

Hướng dẫn theo case: không chuyển tiền/OTP, xác minh kênh chính thức

Governance

Report và blocklist cộng đồng/chuyên gia

Consent, owner scope, audit và human review

TrustGuard AI

06 / 14

7 of 12

Điều tra có kiểm soát

Chỉ chạy nguồn tín hiệu được policy cho phép và có consent theo request

Local URL rules

Approved blacklist

DNS + guarded redirect

IANA RDAP / BKNS cho .vn

URL reputation

Official-link verification

Brand registry

Whitelist

Kiểm soát an toàn

Account-scoped consent

SSRF + redirect validation

Deadline và call budget

Provider lỗi không đồng nghĩa SAFE

Owner scope + audit

TrustGuard AI

07 / 14

8 of 12

Evidence và Risk Engine

Từ tín hiệu bảo mật đến kết luận rủi ro có thể giải thích

Security signals

Typed evidence

Deterministic policy

Risk level

Sáu mức độ rủi ro (risk level)

SAFE

LOW_RISK

SUSPICIOUS

HIGH_RISK

MALICIOUS

INSUFFICIENT_EVIDENCE

AI không trực tiếp đặt risk hoặc score

Provider no-hit / error không đồng nghĩa SAFE

Tín hiệu yếu đơn lẻ không đủ tạo MALICIOUS

Mọi kết luận liên kết với evidence

TrustGuard AI

08 / 14

9 of 12

Vai trò của AI

AI hỗ trợ hiểu và diễn giải; policy và con người vẫn là ranh giới quyết định

AI được phép

AI không được phép

Hiểu ngôn ngữ tự nhiên với span grounding

Bổ sung structured context an toàn

Ưu tiên candidate đang runnable

Viết giải thích dễ hiểu

Đề xuất cho admin

Đặt risk hoặc score

Chọn consent

Chọn network target ngoài policy

Bịa evidence

Tự thực hiện admin action

TrustGuard AI

09 / 14

10 of 12

Kết quả Evaluation

Agent: gpt-4o-mini-2024-07-18 • Judge: gpt-5.6-luna

Task Completion

Đủ cấu trúc và hướng dẫn cần thiết

82.5%

Tool Correctness

Không vi phạm required/forbidden tool policy

100%

Contextual Precision

Context/evidence liên quan còn chưa tối ưu

68.5%

Faithfulness

Không tạo evidence/action ngoài payload

100%

Latency / task

End-to-end p95

18.35s

Cost / task

Chi phí mỗi investigation

$0.0011

0% unsafe escape • 95% decision accuracy — safety tốt, nhưng agent còn quá thận trọng

Safety gate mạnh: không có unsafe case bị ALLOW

Trade-off: unnecessary-block-rate 100% cần calibration

TrustGuard AI

12 / 14

11 of 12

Rủi ro và biện pháp giảm thiểu

Các rủi ro chính được nhận diện và cách kiểm soát

Rủi ro

Ảnh hưởng

Giảm thiểu

False positive

Chặn nhầm hành động hợp lệ

Whitelist, appeal, reviewed evidence

False negative

Bỏ sót scam

Memory, campaign detection, không lạm dụng SAFE

Provider outage

Thiếu evidence

Fallback và INSUFFICIENT_EVIDENCE

AI hallucination

Giải thích sai

Grounding validation

Prompt injection

Thao túng model

Untrusted context và allowlisted tools

Dữ liệu nhạy cảm

Vi phạm riêng tư

Redaction, retention, encryption

TrustGuard AI

13 / 14

12 of 12

“TrustGuard AI không thay thế chuyên gia bảo mật; hệ thống giúp người dùng ra quyết định an toàn hơn bằng evidence, deterministic policy và human review.”

Khả thi

Có nền tảng mở rộng production

Phát triển an toàn, giải thích được, có con người kiểm soát

TrustGuard AI

14 / 14