AMD thâu tóm startup chip AI Taalas, đặt cược vào chiến lược “khắc mô hình lên silicon” để tăng tốc suy luận View Larger Image AMD muốn phá thế thống trị của Nvidia trong phần cứng AIAMD vừa công bố mua lại Taalas, một startup chip AI có trụ sở tại Toronto, trong nỗ lực mới nhất nhằm cạnh tranh trực diện với Nvidia trên thị trường phần cứng trí tuệ nhân tạo. Điểm khác biệt lớn nhất của Taalas nằm ở cách tăng tốc suy luận AI (inference) — tức giai đoạn mô hình đã được huấn luyện xong và bắt đầu tạo câu trả lời, sinh mã hoặc xử lý yêu cầu thực tế của người dùng. Thay vì dùng kiến trúc GPU truyền thống, Taalas chọn cách đưa trực tiếp trọng số mô hình (model weights, các tham số đã học quyết định cách mô hình phản hồi) vào bên trong silicon, hứa hẹn nâng hiệu năng lên thêm một bậc lớn. MSIC: chip tích hợp dành riêng cho từng mô hình AICông nghệ của Taalas được mô tả như một dạng “model-specific integrated circuit” hay MSIC — mạch tích hợp thiết kế riêng cho một mô hình cụ thể. Khác với GPU thông thường, vốn phải đọc trọng số mô hình từ bộ nhớ băng thông cao HBM (High Bandwidth Memory, loại bộ nhớ cực nhanh thường dùng trong tăng tốc AI), chip của Taalas khắc luôn các trọng số đó vào silicon. Cách tiếp cận này giúp giảm đáng kể độ trễ truy xuất dữ liệu và tăng tốc độ sinh token — token là đơn vị văn bản nhỏ mà mô hình AI tạo ra từng bước khi phản hồi. Nói đơn giản, thay vì phải liên tục “đi lấy dữ liệu” từ bộ nhớ, con chip gần như đã mang sẵn mô hình trong cấu trúc vật lý của nó. Nguyên mẫu đầu tiên cho thấy tốc độ gần 17.000 token mỗi giâyTaalas không chỉ dừng ở ý tưởng. Hồi tháng 2, công ty đã giới thiệu chip thử nghiệm HC1, được sản xuất trên tiến trình 6nm của TSMC — nhà gia công bán dẫn lớn nhất thế giới. Theo các bài thử nghiệm ban đầu, HC1 có thể chạy mô hình Llama 3.1 8B của Meta với tốc độ 16.960 token/giây. Vào thời điểm công bố, mức này được cho là nhanh gấp 48 lần GPU của Nvidia và nhanh hơn 8,5 lần các bộ tăng tốc của Cerebras. Dù Llama 3.1 8B nay đã là một mô hình cũ, chip thử nghiệm này chủ yếu đóng vai trò chứng minh tính khả thi của kiến trúc mới. Bên trong chip Taalas có gì?Taalas vẫn khá kín tiếng về thiết kế chi tiết, nhưng một số thành phần cốt lõi đã được hé lộ. Bộ xử lý của hãng gồm hai vùng chính: “mask-ROM recall fabric” — nơi trọng số mô hình được khắc cố định vào silicon, và “SRAM recall fabric” — nơi lưu KV cache cùng các bộ điều chỉnh tinh chỉnh như adapter. KV cache là vùng nhớ lưu lại các khóa và giá trị trung gian trong mô hình biến đổi (transformer), giúp AI không phải tính lại từ đầu khi sinh từng token tiếp theo. Còn adapter, chẳng hạn LoRA (Low-Rank Adaptation), là một kỹ thuật tinh chỉnh mô hình với chi phí thấp hơn nhiều so với huấn luyện lại toàn bộ. Thế hệ HC2 nhắm tới 20 tỷ tham số mỗi chipMẫu chip HC2 thế hệ hai của Taalas, dự kiến ra mắt trong mùa hè này, được cho là sẽ hỗ trợ tới 20 tỷ tham số trên mỗi chip. Tham số có thể hiểu là số lượng “nút điều chỉnh” bên trong mô hình AI, càng nhiều thì mô hình thường càng mạnh nhưng cũng càng tốn tài nguyên. Con số 20 tỷ có thể chưa gây choáng ngợp trong kỷ nguyên mô hình khổng lồ, nhưng Taalas cho rằng bài toán có thể mở rộng bằng pipeline parallelism — một kỹ thuật chia mô hình thành nhiều phần để chạy trên nhiều bộ tăng tốc song song. Theo phép tính được nêu ra, một mô hình 1.000 tỷ tham số chỉ cần khoảng 50 bộ tăng tốc loại này. AMD có thể ghép Taalas với hệ rack Helios dùng GPU InstinctLợi thế lớn của AMD là hãng không chỉ có chip mà còn có nền tảng hệ thống quy mô rack. Nguồn tin cho thấy AMD có thể kết hợp công nghệ Taalas với các rack Helios dựa trên dòng GPU Instinct. Điều này mở ra một kiến trúc tách rời, hay disaggregated architecture — tức mỗi loại phần cứng đảm nhiệm phần việc phù hợp nhất. Trong mô hình này, GPU Instinct sẽ xử lý prompt processing, tức giai đoạn đọc và hiểu yêu cầu đầu vào vốn đòi hỏi năng lực tính toán linh hoạt cao, còn các bộ tăng tốc dựa trên Taalas sẽ đảm nhận token generation, tức giai đoạn sinh câu trả lời liên tục với tốc độ cao. Một chu kỳ triển khai mới: thử trên GPU, chốt rồi chuyển sang chip chuyên dụngMột kịch bản khác cũng được nhắc tới là AMD có thể áp dụng nhịp triển khai kiểu “tick-tock”: khách hàng trước tiên phát triển, kiểm thử và xác thực mô hình trên GPU Instinct, sau đó khi đã chắc chắn về lựa chọn cuối cùng mới chuyển sang chip Taalas để tối ưu chi phí và hiệu năng suy luận. Đây là hướng đi hợp lý vì GPU vẫn linh hoạt hơn rất nhiều trong giai đoạn thử nghiệm, còn MSIC chỉ thực sự phát huy khi mô hình đã ổn định và được triển khai ở quy mô lớn. Cái giá của tốc độ: gần như bị khóa vào một mô hìnhNhược điểm lớn nhất của cách “khắc mô hình lên silicon” là tính linh hoạt rất thấp. Sau khi chip được sản xuất và triển khai, doanh nghiệp gần như bị gắn chặt với mô hình đó. Những thay đổi lớn hơn mức adapter LoRA thường sẽ buộc phải “re-spin” chip — tức chỉnh sửa và sản xuất lại phiên bản silicon mới, một quy trình tốn thời gian và chi phí. Trong bối cảnh các mô hình AI mới xuất hiện gần như mỗi tháng, đây là rào cản không nhỏ. Nói cách khác, công nghệ của Taalas đặc biệt hấp dẫn với những tổ chức đã xác định rõ mô hình chiến lược và có nhu cầu phục vụ suy luận ở quy mô rất lớn. Taalas cho rằng việc cập nhật chip không quá đau đớn như tưởng tượngDù vậy, startup này lập luận rằng quá trình làm mới chip không đồng nghĩa phải thiết kế lại từ đầu. Theo công ty, khi cần cập nhật cho mô hình mới, chỉ hai lớp kim loại trong cấu trúc chip phải thay đổi. Điều đó có thể giúp giảm đáng kể chi phí và thời gian so với một vòng phát triển bán dẫn hoàn toàn mới. Nếu tuyên bố này đúng trong thực tế sản xuất, đây sẽ là yếu tố then chốt giúp mô hình chip chuyên dụng của Taalas khả thi hơn về mặt thương mại. Khách hàng tiềm năng nhiều khả năng là các hãng mô hình AI lớnCông nghệ này có lẽ sẽ không sớm phổ biến rộng rãi tới mọi doanh nghiệp, mà chủ yếu phù hợp với các nhà phát triển mô hình AI, nhà cung cấp hạ tầng và một số đơn vị chuyên cung cấp dịch vụ suy luận. Taalas từng cho biết việc khắc trọng số mô hình vào silicon có chi phí thấp hơn 100 lần so với huấn luyện một mô hình frontier — tức mô hình AI tiên tiến hàng đầu ở ranh giới công nghệ hiện tại. AMD hiện ở vị thế thuận lợi để chào bán giải pháp này, bởi OpenAI, Anthropic và Meta đều là khách hàng lớn của dòng Instinct. Với mối quan hệ sẵn có, không loại trừ khả năng các mô hình như GPT hay Claude sẽ được triển khai trên tổ hợp phần cứng gồm cả GPU Instinct lẫn chip dựa trên công nghệ Taalas. Tác động có thể vượt xa hạ tầng, chạm tới cách mô hình AI suy nghĩThương vụ này không chỉ là câu chuyện phần cứng. Nó còn có thể ảnh hưởng tới cách các mô hình AI được vận hành và tối ưu chất lượng. Một kỹ thuật đang được dùng để giảm hiện tượng hallucination — tức AI tự tin tạo ra thông tin sai — là test-time scaling. Đây là phương pháp cho phép mô hình “suy nghĩ lâu hơn” trước khi trả lời, đổi thêm thời gian và lượng token tiêu thụ để lấy độ chính xác cao hơn. Vấn đề là cách này khiến chi phí tăng và người dùng phải chờ lâu hơn. Nếu AMD giúp kéo giảm chi phí mỗi token đồng thời tăng tốc đầu ra lên 10 đến 20 lần, các nhà phát triển có thể mạnh dạn kéo dài thời gian suy luận hơn nữa để cải thiện chất lượng phản hồi. Thương vụ dự kiến khép lại trong quý IVAMD chưa công bố giá trị thương vụ, nhưng các nguồn tin cho biết đây là một vụ mua lại thực sự chứ không đơn thuần là “acquihire” — tức mua công ty chủ yếu để lấy đội ngũ nhân sự. Nếu được cơ quan quản lý phê duyệt, giao dịch dự kiến hoàn tất trong quý IV năm nay. Trong bối cảnh cuộc đua AI ngày càng chuyển từ huấn luyện sang suy luận quy mô lớn, bước đi với Taalas cho thấy AMD đang tìm cách chen chân vào phân khúc tăng tốc AI cao cấp, nơi tốc độ, hiệu quả điện năng và chi phí mỗi token có thể quyết định ai là người thắng cuộc. Mini PC – Máy Tính Công Nghiệp IPC AI PC – Máy tính AI Intel F1A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details AI PC – Máy tính AI Intel F2A | Intel Ultra 7 155H 14.500.000₫ Thêm vào giỏ hàng Details Máy All In One cho văn phòng – PC Gaming – INTEL i5 12450H 8 lõi 12 luồng 15.500.000₫ Thêm vào giỏ hàng Details Máy all in one giá rẻ – PC Gaming – INTEL I5 10500H 6 lõi 12 luồng 13.700.000₫ Thêm vào giỏ hàng Details Máy tính AI – AI PC | Intel I9-12900H + Nvidia RTX3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính AI AMD AM18 | Ryzen 7 8845HS + Radeon 780M 14.500.000₫ Thêm vào giỏ hàng Details Máy tính AI PC M1A | Intel I9-13900H + Nvidia RTX-3080 28.500.000₫ Thêm vào giỏ hàng Details Máy tính All In One Optori G40 Pro – PC Gaming – INTEL i5 12450H 14.500.000₫ Thêm vào giỏ hàng Details Màn hình cảm ứng HMI – Panel PC Giải pháp HMI Panel PC chống cháy nổ cho nhà máy sản xuất hiện đại | HazardView HV-17EX-T Details Khi nào cần dùng Panel PC chống cháy nổ thay cho Panel PC công nghiệp thông thường? | HazardView HV-17EX Details Màn hình cảm ứng HMI – Touch Panel PC BE-PX09 15.6 Inch 19.500.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp – Fanless Mini PC Công Nghiệp B8000 10.900.000₫ Thêm vào giỏ hàng Details Máy tính công nghiệp màn hình cảm ứng – Touch Panel HMI QY-P8156 15.6 Inch Details So sánh máy tính công nghiệp chống cháy nổ và máy tính công nghiệp tiêu chuẩn | HazardView HV-238EX Details Xu hướng ứng dụng màn hình HMI chống cháy nổ trong nhà máy thông minh | HazardView HV-19EX-R Details Danh mục máy quét mã vạchDÒNG MÁY CÓ DÂYDÒNG MÁY KHÔNG DÂYDÒNG MÁY KIỂM KHO PDADÒNG MÁY FITMOUNT admin2026-08-07T04:10:50+07:00 Related Posts Lỗ hổng “God mode” trên N-able bị khai thác: Kẻ tấn công đã xâm nhập tới mạng khách hàng, hãng tung bản vá khẩn cấp lần hai Lỗ hổng “God mode” trên N-able bị khai thác: Kẻ tấn công đã xâm nhập tới mạng khách hàng, hãng tung bản vá khẩn cấp lần hai Tháng 8 8th, 2026 Nhà nghiên cứu MIT công bố TONTOU: kỹ thuật vượt qua lớp phòng thủ Spectre trên CPU Intel và AMD bằng ngắt hẹn giờ Nhà nghiên cứu MIT công bố TONTOU: kỹ thuật vượt qua lớp phòng thủ Spectre trên CPU Intel và AMD bằng ngắt hẹn giờ Tháng 8 8th, 2026 Cloudflare: Lưu lượng do máy tạo ra có thể gấp 1.000 lần con người trong 5 năm tới Cloudflare: Lưu lượng do máy tạo ra có thể gấp 1.000 lần con người trong 5 năm tới Tháng 8 7th, 2026 Tin tặc liên quan vụ tống tiền dữ liệu Snowflake nhận tội tại Mỹ sau chiến dịch đánh cắp đám mây quy mô lớn Tin tặc liên quan vụ tống tiền dữ liệu Snowflake nhận tội tại Mỹ sau chiến dịch đánh cắp đám mây quy mô lớn Tháng 8 6th, 2026 HPE kéo dài hiệu lực báo giá phần cứng đến thời điểm xuất xưởng, tín hiệu thị trường linh kiện có thể bớt biến động HPE kéo dài hiệu lực báo giá phần cứng đến thời điểm xuất xưởng, tín hiệu thị trường linh kiện có thể bớt biến động Tháng 8 6th, 2026