Lập trình viên chạy được mô hình ngôn ngữ trên vi điều khiển ESP32 giá dưới 10 USD View Larger Image LLM không còn là đặc quyền của máy chủ hay smartphoneViệc chạy mô hình ngôn ngữ cục bộ trên laptop hoặc điện thoại thông minh vào năm 2026 đã trở nên khá phổ biến, nhưng một nhà phát triển có biệt danh SlvDev vừa đẩy giới hạn này đi xa hơn nhiều: đưa một mô hình ngôn ngữ nhỏ lên vi điều khiển ESP32-S3, dòng chip thường chỉ dùng cho cảm biến từ xa, thiết bị IoT (Internet of Things – mạng lưới thiết bị kết nối internet) và các hệ thống nhúng. Theo tài liệu được chia sẻ trên GitHub và xuất hiện trên kênh YouTube Better Stack, hệ thống này có thể tạo ra gần 10 token mỗi giây. Token là đơn vị văn bản nhỏ mà mô hình AI xử lý, có thể là một từ, một phần của từ hoặc ký tự tùy cách mã hóa. Thách thức lớn nhất là bộ nhớ cực kỳ hạn chếĐiểm đáng chú ý nằm ở chỗ ESP32-S3 là phần cứng rất khiêm tốn. Con chip này chỉ có khoảng 520 KB SRAM, tức bộ nhớ truy cập ngẫu nhiên tốc độ cao tích hợp trên chip, cùng 8 MB PSRAM, một dạng RAM ngoài dung lượng lớn hơn nhưng chậm hơn SRAM. Trong khi đó, các LLM, viết tắt của Large Language Model hay mô hình ngôn ngữ lớn, vốn nổi tiếng ngốn bộ nhớ vì phải lưu trữ trọng số của mô hình. Trọng số là các giá trị số đã được học trong quá trình huấn luyện, quyết định cách mô hình dự đoán và sinh văn bản. Với độ chính xác 16-bit, mô hình TinyStories 28,9 triệu tham số sẽ cần xấp xỉ 60 MB bộ nhớ, vượt xa khả năng của ESP32. TinyStories được nén mạnh để vừa với phần cứng siêu nhỏĐể giải bài toán này, SlvDev không dùng các mô hình khổng lồ mà chọn TinyStories, một mô hình 28,9 triệu tham số do Microsoft Research phát triển. Tham số có thể hiểu là những biến số cốt lõi tạo nên “kiến thức” của mô hình. Tuy vậy, ngay cả TinyStories cũng vẫn quá lớn với một vi điều khiển giá rẻ. Giải pháp đầu tiên là quantization, hay lượng tử hóa, kỹ thuật nén mô hình bằng cách giảm độ chính xác của trọng số từ 16-bit xuống 8-bit hoặc 4-bit. Cách làm này giúp giảm đáng kể dung lượng bộ nhớ cần thiết, đổi lại mô hình có thể mất một phần độ chính xác. Trong thử nghiệm, dung lượng lưu trọng số giảm khoảng 75%, từ gần 60 MB xuống còn 14,9 MB. Mượn kỹ thuật từ Gemma để chuyển trọng số sang bộ nhớ flashNgay cả sau khi lượng tử hóa, mô hình vẫn chưa thể nằm gọn trong bộ nhớ của ESP32-S3. Vì vậy, nhà phát triển tiếp tục áp dụng kỹ thuật per-layer embedding, viết tắt là PLE, vốn được nhắc đến trong họ mô hình Gemma của Google. Về cơ bản, PLE cho phép chuyển phần lớn trọng số của mô hình sang bộ nhớ flash – loại bộ nhớ lưu trữ không mất dữ liệu khi tắt nguồn, thường chậm hơn nhiều so với DRAM hay SRAM nhưng có dung lượng rẻ hơn. Trong trường hợp này, khoảng 25 triệu tham số, tương đương khoảng 12 MB dữ liệu, được đẩy sang flash với mức suy giảm hiệu năng thấp. Cách sắp xếp bộ nhớ thông minh giúp đạt gần 10 token mỗi giâyThông thường, việc đưa trọng số mô hình ra bộ nhớ lưu trữ chậm sẽ khiến tốc độ suy giảm nghiêm trọng, bởi mô hình phải liên tục đọc dữ liệu từ nơi có băng thông thấp hơn nhiều so với RAM. Băng thông là lượng dữ liệu có thể truyền trong một đơn vị thời gian. Tuy nhiên, PLE hoạt động hiệu quả hơn vì những trọng số này không bị truy cập quá thường xuyên. Nhờ đó, thay vì phải ép toàn bộ 14,9 MB vào RAM, hệ thống chỉ cần khoảng 2 MB bộ nhớ hoạt động. Cụ thể, output head – lớp đầu ra quyết định token kế tiếp, embeddings – biểu diễn số học của từ/ngữ, và KV cache – bộ đệm lưu khóa/giá trị để mô hình tăng tốc suy luận tuần tự – được đặt trong PSRAM, còn activations, tức các giá trị trung gian sinh ra khi mô hình tính toán, được giữ trong 520 KB SRAM. Kết quả cuối cùng là tốc độ 9,88 token mỗi giây, nhanh hơn tốc độ đọc trung bình của con người. Đây là màn trình diễn kỹ thuật ấn tượng hơn là công cụ AI thực dụngDù thành tựu này rất đáng nể về mặt kỹ thuật, giới hạn ứng dụng thực tế vẫn còn rõ ràng. TinyStories chủ yếu có thể tạo ra các mẩu truyện ngắn tương đối mạch lạc, nhưng chưa đủ sức trở thành chatbot thực thụ, công cụ sinh mã hay nền tảng cho AI agent. AI agent là hệ thống AI có thể tự thực hiện chuỗi hành động để hoàn thành mục tiêu, chẳng hạn quản lý lịch hoặc xử lý tác vụ nhiều bước. Bài viết nguồn cũng nhắc đến một mô hình khác tên Barista, có thể trả lời câu hỏi nhanh gần gấp đôi, nhưng chỉ trong phạm vi rất hẹp liên quan đến espresso. Xu hướng AI cục bộ vẫn đang mở rộng xuống thiết bị biênDù chưa thực sự hữu ích với người dùng phổ thông, việc một mô hình ngôn ngữ chạy được trên ESP32 cho thấy AI cục bộ đang tiến rất nhanh xuống lớp thiết bị biên, tức edge devices – các thiết bị xử lý dữ liệu gần nơi phát sinh thay vì gửi hết lên đám mây. Nếu có phần cứng mạnh hơn một chút như Raspberry Pi hoặc smartphone, các mô hình hiện nay đã thực dụng hơn nhiều. Chẳng hạn, Google Gemma 4-E2B-it, một mô hình thị giác-ngôn ngữ với 5,1 tỷ tham số, cũng tận dụng lượng tử hóa và PLE để giảm mức tiêu thụ bộ nhớ xuống chỉ hơn 1 GB khi dùng trọng số 4-bit, thậm chí có thể xuống khoảng 500 MB nếu nén và offload mạnh tay hơn. Mô hình thị giác-ngôn ngữ là loại AI có thể xử lý cả hình ảnh lẫn văn bản. Ở quy mô đó, người dùng đã có thể vận hành chatbot cục bộ, trợ lý cá nhân trên thiết bị, hoặc giảm phụ thuộc vào các dịch vụ AI đám mây như OpenAI hay Anthropic, dù hiện tượng hallucination – khi AI tự tạo ra thông tin sai nhưng nghe có vẻ hợp lý – vẫn chưa biến mất hoàn toàn. Mini PC – Máy Tính Công Nghiệp IPC AI PC – Máy tính AI Intel F1A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details AI PC – Máy tính AI Intel F2A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details Máy All In One cho văn phòng – PC Gaming – INTEL i5 12450H 8 lõi 12 luồng 15.500.000₫ Thêm vào giỏ hàng Details Máy all in one giá rẻ – PC Gaming – INTEL I5 10500H 6 lõi 12 luồng 13.700.000₫ Thêm vào giỏ hàng Details Máy tính AI – AI PC | Intel I9-12900H + Nvidia RTX3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính AI AMD AM18 | Ryzen 7 8845HS + Radeon 780M 14.500.000₫ Thêm vào giỏ hàng Details Máy tính AI PC M1A | Intel I9-13900H + Nvidia RTX-3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính All In One Optori G40 Pro – PC Gaming – INTEL i5 12450H 14.500.000₫ Thêm vào giỏ hàng Details Màn hình cảm ứng HMI – Panel PC Giải pháp HMI Panel PC chống cháy nổ cho nhà máy sản xuất hiện đại | HazardView HV-17EX-T Details Khi nào cần dùng Panel PC chống cháy nổ thay cho Panel PC công nghiệp thông thường? | HazardView HV-17EX Details Màn hình cảm ứng HMI – Touch Panel PC BE-PX09 15.6 Inch 19.500.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp – Fanless Mini PC Công Nghiệp B8000 10.900.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp màn hình cảm ứng – Touch Panel HMI QY-P8156 15.6 Inch Details So sánh máy tính công nghiệp chống cháy nổ và máy tính công nghiệp tiêu chuẩn | HazardView HV-238EX Details Xu hướng ứng dụng màn hình HMI chống cháy nổ trong nhà máy thông minh | HazardView HV-19EX-R Details Danh mục máy quét mã vạchDÒNG MÁY CÓ DÂYDÒNG MÁY KHÔNG DÂYDÒNG MÁY KIỂM KHO PDADÒNG MÁY FITMOUNT admin2026-08-05T07:08:06+07:00 Related Posts NVMe cập nhật loạt đặc tả: thêm ảo hóa SSD cục bộ, hỗ trợ di chuyển máy ảo và tăng cường bảo mật hậu lượng tử NVMe cập nhật loạt đặc tả: thêm ảo hóa SSD cục bộ, hỗ trợ di chuyển máy ảo và tăng cường bảo mật hậu lượng tử Tháng 8 5th, 2026 Châu Á công nghệ: Meta lỡ tay gỡ video của Thủ tướng Ấn Độ, DeepSeek chuẩn bị tăng giá giờ cao điểm, Australia siết Big Tech Châu Á công nghệ: Meta lỡ tay gỡ video của Thủ tướng Ấn Độ, DeepSeek chuẩn bị tăng giá giờ cao điểm, Australia siết Big Tech Tháng 8 3rd, 2026 Nvidia Vera ra mắt tham vọng lật đổ Intel và AMD ở trung tâm dữ liệu bằng CPU 88 nhân tùy biến cho kỷ nguyên AI Nvidia Vera ra mắt tham vọng lật đổ Intel và AMD ở trung tâm dữ liệu bằng CPU 88 nhân tùy biến cho kỷ nguyên AI Tháng 8 1st, 2026 Vodafone chi 4,3 tỷ bảng thâu tóm hoàn toàn VodafoneThree, siết quyền kiểm soát nhà mạng di động lớn nhất Anh Vodafone chi 4,3 tỷ bảng thâu tóm hoàn toàn VodafoneThree, siết quyền kiểm soát nhà mạng di động lớn nhất Anh Tháng 7 31st, 2026 Anh đề xuất thu phí đặt cọc kết nối điện với trung tâm dữ liệu để chặn dự án “xí chỗ” trên lưới điện Anh đề xuất thu phí đặt cọc kết nối điện với trung tâm dữ liệu để chặn dự án “xí chỗ” trên lưới điện Tháng 7 31st, 2026