Các mô hình ngôn ngữ lớn, giờ đây thực sự đã mọc ra "cánh tay".
Vào thứ Năm tuần này, Anthropic đã công bố ra mắt MCP cho phần cứng: Tiêu Chuẩn Phần Cứng Mô Hình (MHS). Đây là một tiêu chuẩn mới, được thiết kế để giúp tất cả các tác tử thông minh (Agent) AI được điều khiển bởi mô hình lớn có thể thao tác thiết bị vật lý một cách an toàn và nhanh chóng.

Giờ đây, các mô hình lớn như Claude có thể thao tác kính hiển vi, cánh tay robot, máy xử lý chất lỏng, máy laser và các phần cứng khác trong thế giới vật lý giống như sử dụng MCP (Giao thức Ngữ cảnh Mô hình). Bước tiến này được ngành công nghiệp coi là bước quan trọng giúp AI từ thế giới số bước sang thế giới vật lý.
Những người sử dụng tác tử thông minh ít nhiều đều đã nghe nói đến MCP. Đây là một giao thức tiêu chuẩn mở được Anthropic giới thiệu vào tháng 11/2024, nhằm cung cấp một giao diện giao tiếp hai chiều, tiêu chuẩn hóa và an toàn giữa mô hình ngôn ngữ lớn (LLM) với các nguồn dữ liệu bên ngoài, tệp cục bộ, công cụ phát triển và các loại dịch vụ ứng dụng khác nhau.
Định vị cốt lõi của MCP là "cổng kết nối USB-C của lĩnh vực AI", có thể kết nối mô hình lớn với các môi trường phần mềm như GitHub, Slack, hệ thống tệp cục bộ, cơ sở dữ liệu, v.v... Với sự phát triển của công nghệ AI trong những năm gần đây, MCP đã phát triển thành một tiêu chuẩn thực tế không thể thiếu trong toàn bộ hệ sinh thái tác tử thông minh.
Giờ đây cũng chính Anthropic, thông qua MCP cho phần cứng, hy vọng nâng tầm quy chuẩn giao tiếp tiêu chuẩn này lên các phần cứng vật lý, cảm biến, hệ thống nhúng và thiết bị thử nghiệm.
Việc phát triển MHS bắt đầu từ sự hợp tác giữa công ty Anthropic và Viện nghiên cứu Janelia thuộc Viện Y học Howard Hughes (HHMI). Hiện tại, phiên bản xem trước dành cho nghiên cứu đã được mở cho các phòng thí nghiệm nghiên cứu và nhà sản xuất tiên tiến đầu tiên.

Thông thường, các phòng thí nghiệm hoặc nhà máy sản xuất cần vài tuần hoặc thậm chí vài tháng để thiết lập và tích hợp phần cứng. Hầu hết các thiết bị không thể giao tiếp trực tiếp với nhau, do đó cần các chuyên gia xây dựng giải pháp tích hợp tùy chỉnh. MHS có thể rút ngắn công việc tích hợp này xuống còn vài giờ hoặc thậm chí vài phút. Hơn nữa, bằng cách tích hợp AI vào các công cụ này, MHS còn giúp các nhà nghiên cứu và kỹ sư dễ dàng phối hợp các thí nghiệm và quy trình công việc tự chủ, chạy 24/7 hơn. Tác tử thông minh có thể lý luận từng bước trong thí nghiệm, cập nhật tham số theo thời gian thực, và trong một số trường hợp, có thể phục hồi từ sự cố phần cứng mà không cần sự can thiệp của con người.
MHS có thể hoạt động với bất kỳ thiết bị nào có giao diện có thể lập trình, nó cũng độc lập với loại mô hình cơ bản, bất kỳ khung tác tử nào cũng có thể sử dụng các giao thức tiêu chuẩn, chẳng hạn như MCP, để truy cập nó.
Ngay cả khi không tính đến độ khó bổ sung của việc tích hợp AI vào hệ thống, việc để nhiều thiết bị trong phòng thí nghiệm hoặc phân xưởng nhà máy giao tiếp với nhau cũng không hề dễ dàng. Mỗi thiết bị thường có giao diện lập trình riêng, và hiện tại vẫn chưa có phương pháp tích hợp tiêu chuẩn hóa. Hơn nữa, sau khi các thiết bị được kết nối, cũng không có phương pháp chung nào để chúng chia sẻ dữ liệu với Agent, và càng không có cách nào để Agent thao tác các thiết bị này một cách an toàn.
Hiện tại, MHS giải quyết những thách thức này bằng cách giới thiệu trình điều khiển tiêu chuẩn hóa: Đây là một phần mềm chuyển đổi giữa hệ điều hành máy tính và thiết bị phần cứng. Trình điều khiển MHS sử dụng một tập hợp các lệnh cơ bản đơn giản, như đọc (ví dụ: lấy nhiệt độ), ghi (ví dụ: đặt nhiệt độ), v.v..., mà bất kỳ thiết bị phần cứng nào cũng có thể hiểu và thực thi. Nó cho phép mỗi thiết bị được phát hiện ở định dạng tiêu chuẩn, từ đó giúp thiết bị và tác tử thông minh có thể phát hiện lẫn nhau và giao tiếp qua mạng mà không cần sử dụng chương trình "dịch" tùy chỉnh giữa chúng.
Trình điều khiển MHS còn giúp tác tử thông minh hiểu, sử dụng các thiết bị chưa từng thấy trước đây, và cung cấp cho nó thông tin về đặc tính máy móc mà chỉ bằng mã code có thể không lấy được (ví dụ: trọng lượng của cánh tay robot, điều này rất quan trọng cho thao tác an toàn). Cho đến nay, những thông tin này chủ yếu được lưu trữ trong sách hướng dẫn giấy, máy tính của người dùng hoặc dưới dạng kiến thức ngầm. Nhưng trình điều khiển MHS chứa các thẻ (tags), cho phép người dùng trực tiếp nhập những thông tin này bằng ngôn ngữ tự nhiên (người dùng có thể tự nhập, hoặc thông qua trò chuyện với tác tử thông minh, để AI hỏi về cài đặt phần cứng của họ).
Sử dụng thông tin trong các thẻ này, trình điều khiển MHS sẽ tự động tạo ra một tệp tham chiếu, chứa thông tin đặc tính chung của thiết bị, ví dụ như nó có thể đo lường gì, có thể điều chỉnh gì và sẽ thực thi những giới hạn an toàn nào. Tệp này cung cấp cho tác tử thông minh mọi thông tin cần thiết để vận hành thiết bị.
Sau khi thiết bị được kết nối và chương trình tác tử thông minh hiểu cách sử dụng từng thiết bị, vẫn cần một phương pháp để kiểm soát các phần cứng này. Đối với MHS, có ba cơ chế như vậy: MCP, giao diện dòng lệnh và tệp mã (API). Chúng phối hợp hoạt động, cho phép người dùng phối hợp nhiều thiết bị chỉ bằng một dòng mã.
Một khi tác tử thông minh có thể kiểm soát thiết bị, nó có thể nhận dữ liệu vận hành từ mỗi thiết bị, và giám sát cũng như hướng dẫn công việc ở cấp độ cao. Tác tử thông minh có thể sắp xếp trình tự các bước thao tác trên các dụng cụ khác nhau, giám sát kết quả, và điều chỉnh tham số dựa trên tình huống thay đổi theo thời gian thực. Khi tác tử thông minh cần thực hiện các tác vụ chạy lâu dài hoặc thao tác thiết bị với tốc độ vượt quá khả năng suy luận trực tuyến của nó, nó có thể kết nối các lệnh trình điều khiển từ một hoặc nhiều thiết bị vào một tệp mã. Bằng cách này, thiết bị có thể tự thực hiện thao tác mà không cần tác tử thông minh phải suy luận ở mỗi bước.
Trong quá trình thử nghiệm MHS, Anthropic phát hiện rằng Claude tương tác với thí nghiệm và phần cứng theo cách đầy khám phá, giống như một nhà khoa học.
Anthropic quan sát thấy Claude điều chỉnh máy laser, và quan sát kết quả qua camera, đánh giá việc điều chỉnh đã di chuyển chùm tia laser như thế nào, sau đó lặp lại quá trình này, cố gắng hiểu trình tự sự kiện xảy ra. Sau đó, Claude đóng gói thông tin đã học được thành một tệp mã, viết một kịch bản xác định, cho phép nó hiệu chỉnh máy laser mà không cần phải suy luận từng bước, từ đó toàn bộ quá trình có thể chạy như một lệnh riêng lẻ.
Trong quá trình phát triển MHS, Anthropic đã chia sẻ công nghệ này với một số phòng thí nghiệm và nhà sản xuất phần cứng trong các lĩnh vực như công nghệ sinh học, robot, máy tính lượng tử, v.v... Trong các dự án ban đầu này, chúng ta có thể thấy MHS rút ngắn thời gian tích hợp thiết bị, tăng tốc độ lặp trong các môi trường thí nghiệm đa dạng, và hỗ trợ vận hành cũng như phát hiện lỗi theo thời gian thực của máy móc.
Các nhà cung cấp phần cứng và các công ty phần mềm đi kèm của họ cũng đã tích hợp hỗ trợ MHS sẵn trong thiết bị, để tác tử thông minh có thể phát hiện và thao tác thiết bị. Ví dụ:
AWS (Amazon Web Services) cung cấp hỗ trợ cho MHS thông qua Strands Robots. Đây là một thư viện dùng để kết nối tác tử thông minh AI với thiết bị vật lý. Trong thời gian xem trước nghiên cứu MHS, AWS sẽ cung cấp cho người tham gia phiên bản phát hành trước riêng tư của gói phần mềm Strands Robots.
Automata đang bổ sung hỗ trợ MHS cho nền tảng tự động hóa phòng thí nghiệm LINQ của họ, để xử lý lỗi thông minh đối với các dụng cụ trong phòng thí nghiệm tự chủ.
Danaher đang tích cực khám phá cách các tính năng được MHS hỗ trợ có thể giúp các dụng cụ thông minh và phòng thí nghiệm tự chủ của họ mở rộng quy mô nghiên cứu và phát triển y sinh.
Doosan Robotics đang sử dụng cánh tay robot của họ để thử nghiệm MHS, bao gồm thực hiện đảm bảo chất lượng tự động và phối hợp nhiệm vụ giữa nhiều robot.
MBF Bioscience đang phát triển trình điều khiển MHS cho ScanImage, phần mềm chạy kính hiển vi quét laser trong hàng trăm phòng thí nghiệm thần kinh học toàn cầu, với mục đích tích hợp tác tử thông minh AI vào phân tích dữ liệu và thí nghiệm thời gian thực.
QIAGEN đang thử nghiệm MHS thông qua bằng chứng khái niệm (proof of concept) trên nền tảng tinh sạch axit nucleic QIAsymphony Connect của họ, để trình diễn cách tác tử thông minh AI có thể giúp phòng thí nghiệm xử lý sự cố dụng cụ nhanh hơn, hướng dẫn người vận hành khôi phục, tăng thời gian hoạt động bình thường của dụng cụ, đồng thời giảm rủi ro cho mẫu sinh học.
Tecan đang bổ sung hỗ trợ MHS cho nền tảng xử lý chất lỏng Fluent của họ, để tác tử thông minh AI có thể trực tiếp phát hiện và thao tác các nền tảng này.
Universal Robots đã được cấp quyền truy cập sớm vào MHS và có kế hoạch thêm hỗ trợ cho MHS trên nền tảng robot của họ.
Trước khi mã nguồn mở, Anthropic còn hy vọng hoàn thiện thêm tiêu chuẩn này.
Là một mô hình ngôn ngữ lớn, Claude học về thế giới vật lý thông qua văn bản và hình ảnh, điều này có nghĩa là khả năng lý luận không gian và vật lý của nó vẫn còn hạn chế, và vẫn cần sự giám sát của chuyên gia. Ví dụ, khi xử lý mẫu protein, các nhà nghiên cứu tại Genentech phải hướng dẫn Claude nhận ra rằng sai số do mẫu sủi bọt là lỗi vật lý, không phải lỗi phần mềm, và chỉ có thể được khắc phục bằng các sửa chữa vật lý tương ứng.
MHS hiện tại vẫn chưa thể tương thích với phần cứng thiếu giao diện lập trình, do đó Anthropic đang hợp tác với các nhà sản xuất thiết bị loại này để tích hợp trình điều khiển MHS vào phần cứng. Nhiều nhà phát triển đã sử dụng Claude Code để thao tác các thiết bị vật lý riêng lẻ. Trong giai đoạn tiếp theo của MHS, Anthropic hy vọng mở rộng tiêu chuẩn này để nó có thể bao phủ nhiều thiết bị hơn mà các nhà phát triển đang sử dụng.
Các tổ chức áp dụng sớm bao gồm Hugging Face (họ đang thêm hỗ trợ MHS vào thư viện robot LeRobot của họ) và Raspberry Pi (sau khi thử nghiệm thành công với trình điều khiển Camera MHS của họ, họ đang kích hoạt tích hợp MHS trên nhiều sản phẩm của mình).
Tài liệu tham khảo:
https://www.anthropic.com/news/model-hardware-standard-research-preview
Bài viết này từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注Agent的机器之心





