1 of 8

IndoorSceneAI

AI Scene Understanding

for Mobile Robots

Hệ thống AI hỗ trợ robot di động hiểu cảnh quan và cảnh báo rủi ro trong môi trường trong nhà

C2-App-137

Camera Input

AI Analysis

Risk Assessment

Scene Logs

2 of 8

Giới Thiệu Bài Toán

Robot dùng camera quan sát môi trường,

nhưng dữ liệu thô chưa đủ để hiểu nhanh tình huống.

Robot đang nhìn thấy gì?

Có vật cản hoặc người gần đường đi không?

Mức độ nguy hiểm: An toàn / Cảnh báo / Nguy hiểm?

Vì sao robot nên dừng, giảm tốc, hay tiếp tục?

OBSTACLE

90%

PERSON

85%

⚠ RISK LEVEL: DANGER

Camera view với bounding box phát hiện vật thể

3 of 8

Người Dùng & Pain Points

OPERATOR

Theo dõi robot theo thời gian thực

Xem cảnh báo và mức rủi ro

Hỏi AI về tình huống hiện tại

Xem lại scene log lịch sử

ADMIN

Quản lý tài khoản người dùng

Cấu hình risk rules

Theo dõi trạng thái hệ thống

PAIN POINTS

Camera chỉ cung cấp hình ảnh thô — khó hiểu ngữ cảnh nhanh

Cần cảnh báo có giải thích, không chỉ báo nguy hiểm chung chung

Cần lưu lịch sử phân tích để truy vết và kiểm tra sau

Model AI nặng, khó deploy trực tiếp trên VPS thông thường

4 of 8

Phương Pháp Tiếp Cận

Input

Ảnh/Video từ Robot

Backend

Nhận & xử lý dữ liệu

AI Core

Phân tích scene

Risk

Đánh giá rủi ro

Dashboard

Hiển thị kết quả

Ý Tưởng Chính

Dùng AI để hiểu cảnh thay vì chỉ hiển thị camera thô

Kết hợp scene understanding với risk assessment

AI Core theo 3D-R1 style — mở rộng sang multi-view/depth/3D

MVP dùng mock reasoner để demo end-to-end ổn định

5 of 8

Demo Workflow & Kiến Trúc

LUỒNG SỬ DỤNG

1

Đăng nhập & xem Dashboard

2

Upload ảnh/video từ robot

3

Bấm Analyze — AI xử lý

4

Xem kết quả & hỏi AI thêm

5

Xem lại lịch sử Scene Logs

KIẾN TRÚC HỆ THỐNG

React

Frontend

FastAPI

Backend

MongoDB

AI Core

Mock

Reasoner

External AI

Endpoint

Qwen2.5-VL

3D-R1

🐳 Docker + Docker Compose để đóng gói deploy

Frontend ↔ Backend ↔ MongoDB · Backend → AI Core

6 of 8

Công Nghệ & Kết Quả Đánh Giá

CÔNG NGHỆ SỬ DỤNG

React + Vite + TS

FastAPI + JWT + RBAC

MongoDB + Motor

Qwen2.5-VL / 3D-R1

Docker + Compose

LATENCY

Mock Analyze API

~5 ms

Mock Ask API

~3 ms

Login API

~30 ms

List Scene Logs

~10 ms

Runpod GPU (tunnel)

~8–15 giây

Local CPU inference

~3–10 phút

Model:

Qwen2.5-VL-3B-Instruct + LoRA adapter

Risk Accuracy:

~72% (SQA3D test set)

CHI PHÍ ƯỚC TÍNH

Chi phí MVP thấp nhất (VPS nhỏ)

~$6 / tháng

Runpod GPU + VPS (tunnel inference)

~$16 / tháng

Bottleneck: GPU inference chỉ xử lý giới hạn request đồng thời — Runpod GPU phù hợp demo, không phải production.

7 of 8

Ưu Điểm & Nhược Điểm

✓ ƯU ĐIỂM

Luồng demo end-to-end ổn định từ frontend đến backend

Chi phí MVP thấp — chỉ ~$6/tháng với VPS nhỏ

Fallback mock reasoner khi model thật chưa sẵn sàng

Auth, RBAC, input validation và logging đầy đủ

Kiến trúc tách AI endpoint — dễ thay model / deploy GPU riêng

✗ NHƯỢC ĐIỂM

Model thật nặng — không phù hợp chạy trực tiếp trên VPS nhỏ

Runpod GPU chưa ổn định như production GPU service

Throughput thấp — Runpod GPU chỉ xử lý tốt 1 request cùng lúc

Video chưa xử lý keyframe / multi-view chuyên sâu

8 of 8

Hướng Phát Triển

Phase 1

MVP Demo

Demo end-to-end ổn định

Mock reasoner cho AI

Auth + roles hoạt động

Phase 2

GPU AI Service

Deploy model lên GPU endpoint

Tách keyframe từ video

Multi-view / depth support

Cloud storage cho media

Phase 3

Production

Đo Latency / Cost / Accuracy

Monitoring & Logging

Security hardening

Optimize Docker deploy

Hệ thống web giúp người vận hành robot phân tích ảnh/video bằng AI — nhận diện vật thể, đánh giá rủi ro, giải thích và lưu scene log.