IndoorSceneAI
AI Scene Understanding
for Mobile Robots
Hệ thống AI hỗ trợ robot di động hiểu cảnh quan và cảnh báo rủi ro trong môi trường trong nhà
C2-App-137
Camera Input
AI Analysis
Risk Assessment
Scene Logs
Giới Thiệu Bài Toán
Robot dùng camera quan sát môi trường,
nhưng dữ liệu thô chưa đủ để hiểu nhanh tình huống.
Robot đang nhìn thấy gì?
Có vật cản hoặc người gần đường đi không?
Mức độ nguy hiểm: An toàn / Cảnh báo / Nguy hiểm?
Vì sao robot nên dừng, giảm tốc, hay tiếp tục?
OBSTACLE
90%
PERSON
85%
⚠ RISK LEVEL: DANGER
Camera view với bounding box phát hiện vật thể
Người Dùng & Pain Points
OPERATOR
Theo dõi robot theo thời gian thực
Xem cảnh báo và mức rủi ro
Hỏi AI về tình huống hiện tại
Xem lại scene log lịch sử
ADMIN
Quản lý tài khoản người dùng
Cấu hình risk rules
Theo dõi trạng thái hệ thống
PAIN POINTS
⚠
Camera chỉ cung cấp hình ảnh thô — khó hiểu ngữ cảnh nhanh
⚠
Cần cảnh báo có giải thích, không chỉ báo nguy hiểm chung chung
⚠
Cần lưu lịch sử phân tích để truy vết và kiểm tra sau
⚠
Model AI nặng, khó deploy trực tiếp trên VPS thông thường
Phương Pháp Tiếp Cận
Input
Ảnh/Video từ Robot
▶
Backend
Nhận & xử lý dữ liệu
▶
AI Core
Phân tích scene
▶
Risk
Đánh giá rủi ro
▶
Dashboard
Hiển thị kết quả
Ý Tưởng Chính
Dùng AI để hiểu cảnh thay vì chỉ hiển thị camera thô
Kết hợp scene understanding với risk assessment
AI Core theo 3D-R1 style — mở rộng sang multi-view/depth/3D
MVP dùng mock reasoner để demo end-to-end ổn định
Demo Workflow & Kiến Trúc
LUỒNG SỬ DỤNG
1
Đăng nhập & xem Dashboard
2
Upload ảnh/video từ robot
3
Bấm Analyze — AI xử lý
4
Xem kết quả & hỏi AI thêm
5
Xem lại lịch sử Scene Logs
KIẾN TRÚC HỆ THỐNG
React
Frontend
→
FastAPI
Backend
→
MongoDB
↓
AI Core
Mock
Reasoner
External AI
Endpoint
Qwen2.5-VL
3D-R1
🐳 Docker + Docker Compose để đóng gói deploy
Frontend ↔ Backend ↔ MongoDB · Backend → AI Core
Công Nghệ & Kết Quả Đánh Giá
CÔNG NGHỆ SỬ DỤNG
React + Vite + TS
FastAPI + JWT + RBAC
MongoDB + Motor
Qwen2.5-VL / 3D-R1
Docker + Compose
LATENCY
Mock Analyze API
~5 ms
Mock Ask API
~3 ms
Login API
~30 ms
List Scene Logs
~10 ms
Runpod GPU (tunnel)
~8–15 giây
Local CPU inference
~3–10 phút
Model:
Qwen2.5-VL-3B-Instruct + LoRA adapter
Risk Accuracy:
~72% (SQA3D test set)
CHI PHÍ ƯỚC TÍNH
Chi phí MVP thấp nhất (VPS nhỏ)
~$6 / tháng
Runpod GPU + VPS (tunnel inference)
~$16 / tháng
Bottleneck: GPU inference chỉ xử lý giới hạn request đồng thời — Runpod GPU phù hợp demo, không phải production.
Ưu Điểm & Nhược Điểm
✓ ƯU ĐIỂM
Luồng demo end-to-end ổn định từ frontend đến backend
Chi phí MVP thấp — chỉ ~$6/tháng với VPS nhỏ
Fallback mock reasoner khi model thật chưa sẵn sàng
Auth, RBAC, input validation và logging đầy đủ
Kiến trúc tách AI endpoint — dễ thay model / deploy GPU riêng
✗ NHƯỢC ĐIỂM
Model thật nặng — không phù hợp chạy trực tiếp trên VPS nhỏ
Runpod GPU chưa ổn định như production GPU service
Throughput thấp — Runpod GPU chỉ xử lý tốt 1 request cùng lúc
Video chưa xử lý keyframe / multi-view chuyên sâu
Hướng Phát Triển
Phase 1
MVP Demo
Demo end-to-end ổn định
Mock reasoner cho AI
Auth + roles hoạt động
Phase 2
GPU AI Service
Deploy model lên GPU endpoint
Tách keyframe từ video
Multi-view / depth support
Cloud storage cho media
Phase 3
Production
Đo Latency / Cost / Accuracy
Monitoring & Logging
Security hardening
Optimize Docker deploy
Hệ thống web giúp người vận hành robot phân tích ảnh/video bằng AI — nhận diện vật thể, đánh giá rủi ro, giải thích và lưu scene log.