TrustGuard AI
Kiểm tra trước khi hành động — dựa trên bằng chứng
FINAL
Security Triage cho phishing, scam và giả mạo có kiểm soát
Nhóm thực hiện: G04 – T068
Đoàn Nhật Bình – 2A202602018
Lê Trung Hiếu – 2A202601917
Bùi Duy Hải – 2A202601878
Vũ Minh Đức – 2A202602006
Mentor:Lưu Trọng Hiếu
TrustGuard AI
01 / 14
Bối cảnh
Người dùng cần một lớp kiểm tra trước khi chuyển tiền, đăng nhập hoặc cung cấp thông tin
Tin nhắn và URL đáng ngờ thường thúc giục hành động ngay
Các yêu cầu phổ biến: đăng nhập, gửi OTP, cung cấp thông tin, chuyển tiền
Khó kiểm tra nhanh danh tính, liên kết và dấu hiệu lừa đảo
Hậu quả có thể là mất tài khoản, dữ liệu hoặc tiền
TrustGuard AI
02 / 14
Bài toán
Bài toán trung tâm mà TrustGuard AI giải quyết
“Biến một tình huống đáng ngờ, thiếu cấu trúc thành kết luận rủi ro có bằng chứng và hướng dẫn hành động an toàn.”
1
Xác định phạm vi
2
Thu thập evidence
3
Phân loại risk
4
Đưa ra khuyến nghị
TrustGuard AI
03 / 14
Phạm vi sản phẩm
Security Triage v4 cho phishing, scam, giả mạo và hành động nhạy cảm
Trong phạm vi
Ngoài phạm vi
Phishing và đánh cắp credential/OTP
Giả mạo thương hiệu
Financial / recruitment / promotion scam
URL investigation có consent
Report, appeal và Security Admin review
General fact-check
Deepfake detection
Malware sandbox
Tư vấn đầu tư
AI tự thực hiện quyết định quản trị
TrustGuard AI
04 / 14
Giải pháp tổng thể
Một pipeline v4: từ input của người dùng đến phản hồi có căn cứ và human review
Người dùng / Chrome Extension
Scope Gate
Structured Context
Investigation
Trust & Official Verification
Typed Evidence
Deterministic Risk v1–v7
Grounded Response
Persistence & Human Review
Consent-aware
TrustGuard AI
05 / 14
Điểm khác biệt: TrustGuard AI
Bổ sung Security Triage theo tình huống, bên cạnh tra cứu và cảnh báo URL
Khía cạnh
Chongluadao.vn
TrustGuard AI
Đối tượng kiểm tra
URL/IP/điện thoại/email; blocklist
Tin nhắn + URL + hành động nhạy cảm
Quan hệ với tổ chức
Tra cứu công khai không công bố xác minh exact resource/action endorsement
Official-link verification có provenance, giới hạn theo exact resource/action
Khuyến nghị hành động
Cảnh báo/chặn website có rủi ro
Hướng dẫn theo case: không chuyển tiền/OTP, xác minh kênh chính thức
Governance
Report và blocklist cộng đồng/chuyên gia
Consent, owner scope, audit và human review
TrustGuard AI
06 / 14
Điều tra có kiểm soát
Chỉ chạy nguồn tín hiệu được policy cho phép và có consent theo request
Local URL rules
Approved blacklist
DNS + guarded redirect
IANA RDAP / BKNS cho .vn
URL reputation
Official-link verification
Brand registry
Whitelist
Kiểm soát an toàn
Account-scoped consent
SSRF + redirect validation
Deadline và call budget
Provider lỗi không đồng nghĩa SAFE
Owner scope + audit
TrustGuard AI
07 / 14
Evidence và Risk Engine
Từ tín hiệu bảo mật đến kết luận rủi ro có thể giải thích
Security signals
Typed evidence
Deterministic policy
Risk level
Sáu mức độ rủi ro (risk level)
SAFE
LOW_RISK
SUSPICIOUS
HIGH_RISK
MALICIOUS
INSUFFICIENT_EVIDENCE
AI không trực tiếp đặt risk hoặc score
Provider no-hit / error không đồng nghĩa SAFE
Tín hiệu yếu đơn lẻ không đủ tạo MALICIOUS
Mọi kết luận liên kết với evidence
TrustGuard AI
08 / 14
Vai trò của AI
AI hỗ trợ hiểu và diễn giải; policy và con người vẫn là ranh giới quyết định
AI được phép
AI không được phép
Hiểu ngôn ngữ tự nhiên với span grounding
Bổ sung structured context an toàn
Ưu tiên candidate đang runnable
Viết giải thích dễ hiểu
Đề xuất cho admin
Đặt risk hoặc score
Chọn consent
Chọn network target ngoài policy
Bịa evidence
Tự thực hiện admin action
TrustGuard AI
09 / 14
Kết quả Evaluation
Agent: gpt-4o-mini-2024-07-18 • Judge: gpt-5.6-luna
Task Completion
Đủ cấu trúc và hướng dẫn cần thiết
82.5%
Tool Correctness
Không vi phạm required/forbidden tool policy
100%
Contextual Precision
Context/evidence liên quan còn chưa tối ưu
68.5%
Faithfulness
Không tạo evidence/action ngoài payload
100%
Latency / task
End-to-end p95
18.35s
Cost / task
Chi phí mỗi investigation
$0.0011
0% unsafe escape • 95% decision accuracy — safety tốt, nhưng agent còn quá thận trọng
Safety gate mạnh: không có unsafe case bị ALLOW
Trade-off: unnecessary-block-rate 100% cần calibration
TrustGuard AI
12 / 14
Rủi ro và biện pháp giảm thiểu
Các rủi ro chính được nhận diện và cách kiểm soát
Rủi ro
Ảnh hưởng
Giảm thiểu
False positive
Chặn nhầm hành động hợp lệ
Whitelist, appeal, reviewed evidence
False negative
Bỏ sót scam
Memory, campaign detection, không lạm dụng SAFE
Provider outage
Thiếu evidence
Fallback và INSUFFICIENT_EVIDENCE
AI hallucination
Giải thích sai
Grounding validation
Prompt injection
Thao túng model
Untrusted context và allowlisted tools
Dữ liệu nhạy cảm
Vi phạm riêng tư
Redaction, retention, encryption
TrustGuard AI
13 / 14
“TrustGuard AI không thay thế chuyên gia bảo mật; hệ thống giúp người dùng ra quyết định an toàn hơn bằng evidence, deterministic policy và human review.”
Khả thi
Có nền tảng mở rộng production
Phát triển an toàn, giải thích được, có con người kiểm soát
TrustGuard AI
14 / 14