GPT-6 Astra cho thấy vai trò của mô hình nền trong robot đang thay đổi
Theo kết quả mà nhóm RPent công bố, GPT-6 Astra đạt 92,63% trên LIBERO-Pro khi được kết hợp với RPent, cao hơn mức 82,4% của cấu hình sử dụng Opus-4.7 trong cùng hệ thống.
Ở bài kiểm tra RoboCasa365 Target50, cấu hình RPent/GPT-6 Astra đạt 59,2%, trong khi RPent/GPT-5.5 đạt 57,1%.
Điểm đáng chú ý ở đây không đơn giản là GPT-6 Astra đạt điểm cao hơn một mô hình khác. Điều quan trọng hơn là mô hình ngôn ngữ không trực tiếp gánh toàn bộ nhiệm vụ điều khiển robot.
RPent phân chia công việc thành nhiều tầng. Agentic Planner sử dụng foundation model để hiểu mục tiêu, Memory để truy xuất kinh nghiệm và Tool Library để lựa chọn năng lực phù hợp. Các Action Primitive sau đó kết nối với VLA, WAM hoặc những kỹ năng được lập trình để thực hiện thao tác.
Hệ thống được chia thành bốn lớp chính:
- User Layer: giao diện CLI hoặc Web Dashboard để người dùng giao nhiệm vụ và theo dõi quá trình thực hiện.
- Intelligence Layer: lập kế hoạch, bộ nhớ và điều phối công cụ.
- Interface Layer: chuyển quyết định của AI thành lệnh mà robot hoặc môi trường mô phỏng có thể thực hiện.
- Environment Layer: kết nối với robot thật hoặc simulator.
RPent hiện hỗ trợ các môi trường như LIBERO-Pro, LIBERO, RoboCasa, RoboTwin và RoboDojo, cùng một số thiết bị như Franka, robot Franka hai tay, YAM và SO101.
Kiến trúc này cũng nhằm giải quyết một vấn đề quan trọng của robot: mỗi thiết bị thường có giao diện điều khiển khác nhau. Nếu mỗi robot phải xây dựng một AI agent riêng, việc mở rộng hệ thống sẽ rất khó.
RPent thay vào đó tạo ra lớp giao diện chung để tách quyết định của AI khỏi phần cứng thực thi. Về nguyên tắc, một agent có thể sử dụng cùng logic để làm việc với nhiều robot khác nhau nếu chúng cung cấp các giao diện cần thiết.
Đây cũng là lý do nhóm phát triển so sánh hướng tiếp cận này với cách các agent trong thế giới số sử dụng công cụ thông qua những giao thức như MCP. Khi bước vào thế giới vật lý, “công cụ” không còn chỉ là trình duyệt, cơ sở dữ liệu hay terminal mà có thể là camera, cánh tay robot, cảm biến hoặc cả một hệ thống mô phỏng.
RPent vì thế không cố biến một mô hình AI thành “bộ não toàn năng” điều khiển trực tiếp mọi chuyển động. Thay vào đó, hệ thống chia nhỏ năng lực và để từng thành phần đảm nhiệm phần việc phù hợp.
Nếu hướng đi này tiếp tục phát triển, sự thay đổi quan trọng của robot có thể không chỉ đến từ việc VLA ngày càng giỏi hơn, mà còn từ cách các mô hình nền, mô hình chuyên biệt, bộ nhớ và phần cứng được kết nối thành một agent có khả năng học hỏi và tái sử dụng kinh nghiệm.
Từ Codex và Claude Code trong thế giới số đến RPent trong thế giới vật lý, mô hình agent đang dần chuyển từ việc gọi công cụ kỹ thuật số sang gọi và điều khiển năng lực vật lý.