Google vừa ra mắt mô hình ngôn ngữ Gemma 4 cùng ứng dụng AI Edge Gallery, cho phép người dùng điện thoại thông minh chạy trí tuệ nhân tạo trực tiếp trên thiết bị mà không cần kết nối mạng. Sự thay đổi này giúp xử lý dữ liệu ngoại tuyến an toàn hơn, thay thế cho phương pháp dùng máy chủ đám mây vốn đòi hỏi đường truyền ổn định và tiềm ẩn rủi ro bảo mật. Qua sử dụng thực tế trên ba phân khúc điện thoại gồm Motorola Moto G86 Power, Xiaomi Redmi Note 15 Pro+ và OPPO Find X8 Pro, sức mạnh phần cứng đã chứng minh vai trò quyết định đến tốc độ hoàn thành tác vụ tính toán.
AI cục bộ và AI đám mây có gì khác biệt?
Các công cụ AI đám mây phổ biến như ChatGPT hay Gemini chủ yếu hoạt động dựa trên một đường truyền kết nối Internet ổn định và liên tục. Trong trường hợp này, chiếc điện thoại của người dùng chỉ đơn thuần đóng vai trò như một màn hình hiển thị nội dung kết quả. Ngay sau khi nhập chuỗi câu lệnh, hệ thống máy chủ từ xa sẽ tiếp nhận, phân tích và trả phản hồi về máy.

Mặc dù sở hữu tốc độ phản hồi nhanh, việc sử dụng máy chủ đám mây bắt buộc người dùng phải luôn có kết nối mạng và tiềm ẩn nguy cơ rò rỉ thông tin dữ liệu nhạy cảm. Trái lại, đối với hình thức AI cục bộ, toàn bộ dữ liệu cốt lõi của mô hình sẽ được tải trực tiếp vào bộ nhớ trong. Khi tiếp nhận câu lệnh, vi xử lý sẽ tự động phân tích thuật toán một cách độc lập. Tốc độ phản hồi nhanh hay chậm sẽ phụ thuộc hoàn toàn vào hệ thống linh kiện.
Sự ra mắt của dòng mô hình ngôn ngữ Gemma 4 từ Google đã mở ra hướng đi mới, giúp việc chạy AI ngoại tuyến trên thiết bị di động trở nên khả thi hơn bao giờ hết. Tuy nhiên, sự chênh lệch về hiệu năng thuần giữa các vi xử lý vẫn là yếu tố mang tính quyết định. Dung lượng RAM và băng thông truyền tải đóng vai trò quan trọng đối với tính ổn định khi vận hành thuật toán.
Thiết lập bài thử nghiệm với ứng dụng Google AI Edge Gallery
Nhằm đảm bảo tính khách quan cho toàn bộ quá trình so sánh, các thao tác đều được thực hiện trực tiếp thông qua ứng dụng Google AI Edge Gallery. Cả ba thiết bị gồm Motorola Moto G86 Power, Xiaomi Redmi Note 15 Pro+ và OPPO Find X8 Pro đều cài đặt chung mô hình ngôn ngữ Gemma-4-E2B-it. Tính năng Thinking cũng được kích hoạt để đánh giá khả năng suy luận logic chuyên sâu.

Điểm nổi bật của ứng dụng Google AI Edge Gallery là cho phép người dùng linh hoạt lựa chọn giữa GPU hoặc CPU để xử lý tác vụ. Các biểu đồ bên dưới thể hiện kết quả trung bình sau ba lần chạy thử độc lập, nhằm hạn chế tối đa sai số ngẫu nhiên.

Dữ liệu thu thập cho thấy sự phân hóa rõ ràng về thời gian hoàn thành tác vụ giữa các phân khúc. OPPO Find X8 Pro thể hiện hiệu năng thuần vượt trội nhờ vi xử lý tiên tiến. Băng thông RAM LPDDR5X thế hệ mới giúp quá trình nạp dữ liệu diễn ra liền mạch, không bị khựng lag. Nhờ phần cứng mạnh, OPPO Find X8 Pro chỉ mất 2 phút để giải quyết câu hỏi logic phức tạp nhất qua GPU. Đây là kết quả vô cùng ấn tượng khi đặt cạnh các thiết bị ở phân khúc thấp hơn. Ở chiều ngược lại, Xiaomi Redmi Note 15 Pro+ gây bất ngờ khi mất tới 27 phút để hoàn thành câu hỏi logic bằng GPU. Con số này chênh lệch lớn so với mốc 6 phút trên Motorola Moto G86 Power, một thiết bị thuộc phân khúc thấp hơn.

Nguyên nhân có thể do phần cứng của Xiaomi Redmi Note 15 Pro+ chưa được tối ưu để chạy được AI cục bộ. Đây là lý do khiến một chiếc máy tầm trung lại cho thời gian xử lý chậm hơn đáng kể so với thiết bị giá rẻ trong cùng bài thử nghiệm. Tốc độ mặc dù được cải thiện khi Xiaomi Redmi Note 15 Pro+ chuyển sang chạy bằng CPU nhưng kết quả này vẫn chậm hơn 2 đối thủ còn lại.

Khi gánh khối lượng công việc quá lớn, mô hình Gemma 4 trên Xiaomi Redmi Note 15 Pro+ thường có xu hướng bỏ dở tác vụ khi chạy quá lâu. Khác với sự ổn định của OPPO Find X8 Pro, chiếc máy tầm trung này đã gặp tình trạng giật lag khi cuộn trang, thậm chí treo ứng dụng trong vài trường hợp.

Đối với Motorola Moto G86 Power, quá trình thử nghiệm bộc lộ rõ những điểm yếu vật lý không thể khắc phục. Xuyên suốt bài kiểm tra, máy duy trì mức nhiệt khá mát và phản hồi nhanh nhẹn với câu lệnh đơn giản. Tuy nhiên, dung lượng RAM khiêm tốn trên chiếc máy nhanh chóng trở thành rào cản lớn khi xử lý các tác vụ khó. Ngay từ khâu thiết lập ban đầu, ứng dụng đã chủ động cảnh báo người dùng nên chuyển sang mô hình nhẹ hơn nhằm tránh gây quá tải cho thiết bị.

Khi cố ép thiết bị chạy lệnh tính toán nặng, Motorola Moto G86 Power lập tức mất khả năng duy trì hoạt động. Đỉnh điểm là khi máy tự động crash ứng dụng quá trình thử nghiệm. Điều này cho thấy khoảng cách rõ ràng về hiệu năng so với một mẫu máy cao cấp như OPPO Find X8 Pro.
So sánh tốc độ với ChatGPT
Khi tiến hành kiểm tra chéo với ChatGPT, chatbot này chỉ mất khoảng 5 giây để xử lý câu lệnh đơn giản và khoảng 32 giây cho câu hỏi logic phức tạp. Dù sở hữu hiệu năng mạnh, OPPO Find X8 Pro vẫn khó so bì trực tiếp với năng lực xử lý của các hệ thống máy chủ đắt tiền. Tuy nhiên, ưu thế lớn nhất của AI cục bộ là khả năng hoạt động ngoại tuyến, đảm bảo tính riêng tư dữ liệu ở mức cao.

Nhờ cơ chế vận hành độc lập, người dùng có thể nhờ AI tóm tắt tài liệu mật hoặc phân tích sổ sách tài chính ngay cả khi không có kết nối mạng. Điều này giúp loại bỏ mọi rủi ro rò rỉ thông tin cá nhân, vốn là vấn đề mà các chatbot đám mây không thể đảm bảo. Bên cạnh bảo mật, AI cục bộ còn mang lại trải nghiệm hoàn toàn miễn phí. Trái ngược với dịch vụ chatbot đám mây đang ngày càng hạn chế tính năng với các tài khoản miễn phí.
Tổng kết
Việc đưa AI cục bộ lên thiết bị di động đã mở ra cách xử lý dữ liệu ngoại tuyến vừa an toàn, vừa tiết kiệm. Tuy nhiên, để có trải nghiệm mượt mà, người dùng cần sở hữu thiết bị có phần cứng đủ mạnh. Với các máy có hiệu năng yếu, giải pháp phù hợp nhất là ưu tiên những mô hình AI nhỏ gọn hơn như Gemma 3.


