# Bài viết Liên quan Tự Tiến Hóa

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Tự Tiến Hóa", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Mô hình lớn có thể viết được thuật toán tối ưu cấp công nghiệp không? MIT đề xuất FrontierOR đặt ra một kỳ thi cho AI

Trong hai năm qua, các LLM đã có bước tiến nhanh chóng trong việc chuyển đổi "ngôn ngữ tự nhiên sang mô hình toán học" và "ngôn ngữ tự nhiên sang mã trình giải". Chúng có thể đọc hiểu vấn đề, viết công thức MIP, gọi các trình giải như Gurobi, cho thấy khả năng mô hình hóa tối ưu ban đầu. Tuy nhiên, điều này vẫn chưa đủ cho các bài toán quy mô công nghiệp thực tế. Thách thức thực sự không nằm ở việc dịch các ràng buộc thành biểu thức toán học, mà là thiết kế các thuật toán có khả năng mở rộng, chính xác và hiệu quả cho các trường hợp quy mô lớn. Ngay cả khi một mô hình MIP hoàn toàn chính xác, việc sử dụng trình giải tổng quát đôi khi không đem lại giải pháp chất lượng cao trong vòng một giờ. Đó là lý do các kỹ sư vận trù học (OR) vẫn cần viết các thuật toán phân rã, sinh cột, Benders, tìm kiếm cục bộ, siêu heuristic và các thuật toán lai. Gần đây, các nhà nghiên cứu từ MIT và các tổ chức khác đã đề xuất FrontierOR: một tiêu chuẩn đánh giá LLM tập trung vào khả năng thiết kế thuật toán tối ưu quy mô lớn. Khác với các benchmark truyền thống chỉ đánh giá "khả năng mô hình hóa" hoặc "khả năng gọi trình giải", FrontierOR tập trung vào việc LLM có thể thiết kế các thuật toán có thể mở rộng, chất lượng cao và hiệu quả cho các cấu trúc vấn đề phức tạp, giống như các nhà nghiên cứu và kỹ sư OR thực thụ. FrontierOR được xây dựng từ 180 bài báo khoa học OR từ năm 1992–2025, chuyển đổi thành các nhiệm vụ tiêu chuẩn với mô tả ngôn ngữ tự nhiên, mô hình toán học, mã tham chiếu, lời giải tham chiếu và bộ kiểm tra tính khả thi. Một tập hợp con 50 nhiệm vụ "Khó" được lựa chọn, nơi Gurobi không thể chứng minh tính tối ưu trong vòng một giờ. Quy trình đánh giá hai giai đoạn: đầu tiên lọc trước trên các ví dụ nhỏ để kiểm tra tính khả thi và chất lượng cơ bản, sau đó đánh giá trên các ví dụ lớn với bốn chỉ số: Tỷ lệ thực thi, Tính khả thi, Chất lượng giải pháp và Hiệu quả Chất lượng-Thời gian (QTE). Kết quả thử nghiệm cho thấy, trong cài đặt one-shot, các mô hình tiên tiến (như GPT-5.3-Codex, Claude Opus 4.6) có tỷ lệ thực thi rất cao (~0.98) nhưng các chỉ số về tính khả thi và chất lượng (đặc biệt là QTE) thấp hơn đáng kể, cho thấy viết mã chạy được không đồng nghĩa với việc giải quyết hiệu quả bài toán. Tập con "Khó" làm nổi bật sự khác biệt về năng lực thuật toán thực sự giữa các mô hình. Phân tích cho thấy các mô hình mạnh hơn có xu hướng sử dụng đa dạng phương pháp hơn (phân rã, heuristic, tìm kiếm cục bộ, phương pháp lai) thay vì chỉ gọi trình giải thuần túy, và điều này tương quan với hiệu suất QTE tốt hơn. Các lỗi của mô hình mạnh cũng chuyển từ sai sót trong mô hình hóa cơ bản sang các vấn đề về chiều sâu và chất lượng của chiến lược tìm kiếm. Đặc biệt, khi áp dụng các khuôn khổ tự tiến hóa trong quá trình kiểm tra (như CORAL, OpenEvolve), hiệu suất của các chương trình do LLM tạo ra được cải thiện đáng kể. QTE trên các nhiệm vụ khó nhất có thể tăng từ 0.15 (one-shot) lên 0.50, cho thấy tiềm năng lớn của việc LLM lặp lại và cải thiện thiết kế thuật toán dựa trên phản hồi. FrontierOR chỉ ra rằng tương lai của LLM trong OR không chỉ dừng lại ở việc tạo mã, mà hướng tới vai trò của một tác nhân thiết kế thuật toán thông minh, có thể hiểu cấu trúc vấn đề, lựa chọn và kết hợp các kỹ thuật, đồng thời tự cải tiến thông qua vòng lặp thử nghiệm và phản hồi, mở ra triển vọng cho các hệ thống hỗ trợ ra quyết định công nghiệp tự động.

marsbit07/10 09:12

Mô hình lớn có thể viết được thuật toán tối ưu cấp công nghiệp không? MIT đề xuất FrontierOR đặt ra một kỳ thi cho AI

marsbit07/10 09:12

Blog mới của Ông Lệ đề xuất "Tiến hóa tự động bắt đầu từ Harness", Thôi Thiên Ý từ DeepSeek chuyển tiếp đồng tình

Cựu Phó chủ tịch phụ trách an ninh tại OpenAI, Weng Li, mới đây đã xuất bản một bài blog với tiêu đề "Harness Engineering for Self-Improvement", thảo luận về con đường thực tế để AI tự phát triển (Recursive Self-Improvement - RSI). Cô đề xuất rằng sự tiến hóa tự động gần đây có thể bắt đầu từ **Harness** - hệ thống thời gian chạy bên ngoài quyết định cách mô hình gọi công cụ, quản lý ngữ cảnh, đọc/ghi tệp, chia nhỏ nhiệm vụ và xác minh kết quả - thay vì trực tiếp sửa đổi trọng số mô hình ngay từ đầu. Bài viết chỉ ra xu hướng tối ưu hóa từng bước: từ **Context Engineering** (như ACE, MCE) để quản lý bộ nhớ, đến **Workflow Design** (như AI Scientist, ADAS) để thiết kế quy trình làm việc, và cuối cùng là **Self-Improving Harness**. Ở cấp độ này, mô hình có thể phân tích điểm yếu của chính harness, đề xuất sửa đổi mã và xác minh chúng thông qua các vòng lặp như Weakness Mining, Harness Proposal và Proposal Validation. Các phương pháp như **Evolutionary Search** và **DGM** (Darwin Gödel Machine) thậm chí cho phép tìm kiếm và tiến hóa harness tự động, mang lại cải thiện hiệu suất đáng kể trên các benchmark như SWE-bench. Nhà nghiên cứu DeepSeek, Cui Tianyi, đồng tình và nhấn mạnh rằng tự phát triển theo hướng harness là một hướng đi đầy hứa hẹn như tự phát triển mô hình. Tuy nhiên, Weng Li cũng chỉ ra những thách thức hiện tại: bộ đánh giá còn yếu và mơ hồ, vấn đề quản lý vòng đời bộ nhớ, kết quả tiêu cực bị bỏ qua, sự thu hẹp đa dạng, reward hacking, và mâu thuẫn giữa thành công ngắn hạn và sức khỏe lâu dài của hệ thống. Cô tin rằng harness và mô hình sẽ củng cố lẫn nhau, và con người vẫn sẽ đóng vai trò giám sát ở cấp độ trừu tượng phù hợp, không bị loại khỏi vòng lặp. Bài blog kết luận rằng harness đang trở thành một biến số quan trọng, vì cùng một mô hình có thể thể hiện khả năng hoàn toàn khác nhau trong các harness khác nhau.

marsbit07/08 10:28

Blog mới của Ông Lệ đề xuất "Tiến hóa tự động bắt đầu từ Harness", Thôi Thiên Ý từ DeepSeek chuyển tiếp đồng tình

marsbit07/08 10:28

Run rẩy đi con người, AI vẫn đang phi nước đại

Con người run rẩy đi, AI vẫn đang tăng tốc. Bài viết tổng hợp từ Hội nghị Trí tuệ Nhân tạo BAAI 2026, nhấn mạnh AI đang tăng tốc mạnh mẽ, không chỉ trong thế giới kỹ thuật số mà còn tiến vào thế giới vật lý. **Scaling Law vẫn tiếp tục, AI tự hoàn thiện:** Dù có lo ngại về việc dữ liệu văn bản chất lượng cao cạn kiệt, nhiều chuyên gia tại hội nghị khẳng định Định luật Mở rộng (Scaling Law) chưa chạm trần, mà đang trở nên đa dạng hơn, tiếp tục thúc đẩy hiệu suất của các mô hình ngôn ngữ lớn (LLM) và đa phương thức. Đồng thời, với sự trưởng thành của AI Coding và tác nhân AI (Agent), xu hướng tự hoàn thiện của AI ngày càng rõ, từ viết code đến tự động cập nhật sản phẩm. **Mô hình Thế giới: Mặt trận then chốt tiếp theo:** Cộng đồng đang tập trung vào việc phát triển Mô hình Thế giới (World Model) để AI hiểu và tương tác với thế giới vật lý. Tuy nhiên, lộ trình công nghệ chưa hội tụ, với nhiều hướng tiếp cận khác nhau (lấy ngôn ngữ, pixel, cấu trúc 3D hoặc biểu diễn hình ảnh làm trung tâm). Các vấn đề như dữ liệu đào tạo (video, mô phỏng hay dữ liệu thực) vẫn cần được giải quyết. Viện Nghiên cứu Trí tuệ Nhân tạo Bắc Kinh (BAAI) dự đoán cần 3-5 năm nữa để mô hình này phát triển và đang nghiên cứu một con đường tích hợp. **Tác nhân AI (Agent): Từ 'Khả dụng' đến 'Dễ dùng':** Agent, cầu nối đưa AI vào cuộc sống, đã có những bước tiến đáng kể, trở nên chủ động và xử lý được các nhiệm vụ phức tạp hơn (như chẩn đoán y tế hỗ trợ, nghiên cứu, ghi chú hội nghị). Để từ "khả dụng" tiến tới "dễ dùng", trọng tâm hiện nay là phát triển "Harness" - khung công nghệ hoặc môi trường bao quanh Agent - nhằm cải thiện khả năng hiểu ý định, thiết kế quy trình, xác minh và phản hồi, nâng cao độ tin cậy và hiệu quả tổng thể. Tóm lại, ngành AI đang trên đà phát triển nhanh chóng với sức mạnh mô hình tiếp tục được mở rộng, cuộc đua chinh phục Mô hình Thế giới đã bắt đầu và các Agent đang dần được hoàn thiện để thực sự hữu ích trong các tình huống thực tế.

marsbit06/13 02:53

Run rẩy đi con người, AI vẫn đang phi nước đại

marsbit06/13 02:53

Lo ngại AI tự tiến hóa, Anthropic định ngừng huấn luyện?

Tháng 6/2026, Anthropic công bố bài viết "When AI builds itself" với dữ liệu nội bộ gây chú ý: hơn 80% mã code được hợp nhất do Claude viết, tốc độ tối ưu code tăng 52 lần, và thời gian AI làm việc độc lập tăng gấp đôi mỗi 4 tháng. Bài viết đưa ra ba viễn cảnh, trong đó kịch bản AI tự cải tiến đệ quy hoàn toàn (RSI) được đánh giá là "có thể xảy ra", và cảnh báo nó "có thể đến nhanh hơn hầu hết các tổ chức chuẩn bị". Động thái này là một phần của chuỗi điều chỉnh tường thuật. Đầu năm 2026, Anthropic sửa đổi chính sách mở rộng có trách nhiệm (RSP), bỏ cam kết tạm dừng đào tạo nếu vượt quá khả năng kiểm soát an toàn. Cùng thời gian, CEO DeepMind Demis Hassabis cũng điều chỉnh dự báo về AGI, thừa nhận sử dụng ngôn ngữ kịch tính như một sự "khiêu khích có chủ đích" để tạo cảm giác cấp bách. Các nhà nghiên cứu độc lập đưa ra cách giải thích khác cho cùng dữ liệu. Một số cho rằng đây là "tự cải tiến hao hụt", không thể lặp lại vô hạn, số khác nhấn mạnh AI hiện chỉ tự động hóa các công việc lặp đi lặp lại chứ không phải sáng tạo đột phá. Bối cảnh của những tín hiệu này trùng khớp với việc Anthropic hoàn thành các vòng gọi vốn lớn, định giá tăng mạnh từ 3500 tỷ lên 9650 tỷ USD trong nửa đầu 2026. Điều này đặt ra câu hỏi về mối liên hệ giữa tường thuật kỹ thuật, áp lực thị trường và trách nhiệm công. Dù vậy, việc nhiều phòng thí nghiệm hàng đầu đồng loạt điều chỉnh giọng điệu cho thấy một sự chuyển hướng trong nhận thức ngành về tốc độ phát triển AI.

marsbit06/05 06:25

Lo ngại AI tự tiến hóa, Anthropic định ngừng huấn luyện?

marsbit06/05 06:25

Bất ngờ! Anthropic kêu gọi toàn ngành ngừng nghiên cứu AI

Bài viết thảo luận về lời kêu gọi tạm dừng nghiên cứu AI từ Anthropic, dựa trên quan sát về khả năng "tự tiến hóa" (recursive self-improvement - RSI) của AI, cụ thể là mô hình Claude. Dữ liệu nội bộ cho thấy Claude đang đẩy nhanh tiến trình phát triển AI: hơn 80% codebase của Anthropic hiện do Claude viết, so với chỉ số ít trước khi Claude Code ra mắt. Năng suất của kỹ sư tăng gấp 8 lần. Quan trọng hơn, chất lượng code của Claude được đánh giá ngang bằng con người và dự kiến vượt trội trong năm nay. Tỷ lệ thành công của Claude trong các nhiệm vụ lập trình phức tạp nhất đã tăng từ 26% lên 76% chỉ trong nửa năm. Anthropic giới thiệu chỉ số "thời gian nhiệm vụ AI có thể hoàn thành độc lập", cho thấy tốc độ tăng trưởng theo cấp số nhân, từ 4 phút (3/2024) lên 16 giờ (hiện tại), với chu kỳ tăng gấp đôi rút ngắn từ 7 tháng xuống 4 tháng. Claude không chỉ viết code mà còn tự động review code, ngăn chặn được khoảng 1/3 lỗi nghiêm trọng. Trong nghiên cứu, Claude đã tối ưu hóa code chạy nhanh hơn 52 lần và tự thiết kế/thực hiện thí nghiệm AI safety, đạt kết quả vượt xa nỗ lực của con người. Bài viết đặt câu hỏi về tương lai khi vai trò con người trong phát triển AI đang thu hẹp lại, chỉ còn lại ưu thế về "khiếu nghiên cứu". Anthropic nêu ba kịch bản có thể xảy ra: (1) Tiến bộ chững lại, (2) AI tiếp tục tăng tốc nhưng con người vẫn kiểm soát, (3) AI đạt đến RSI hoàn toàn, tự thiết kế thế hệ kế tiếp, mang lại lợi ích to lớn hoặc rủi ro mất kiểm soát nếu vấn đề "alignment" thất bại. Do những rủi ro tiềm ẩn này, Anthropic đề xuất một cơ chế có thể xác minh để các phòng lab AI cùng giảm tốc hoặc tạm dừng, nếu đảm bảo không có bên nào "lén lút" phát triển. Lời kêu gọi này trở nên đáng chú ý hơn khi OpenAI cũng gần đây chia sẻ quan sát tương tự về dấu hiệu tự tiến hóa sớm của AI.

marsbit06/05 00:29

Bất ngờ! Anthropic kêu gọi toàn ngành ngừng nghiên cứu AI

marsbit06/05 00:29

Đối tác YC: Làm thế nào để xây dựng một công ty bản địa AI có khả năng tự phát triển

Tóm tắt: Trong bài phát biểu này, Tom Blomfield, Đối tác chung của Y Combinator (YC), thảo luận về việc thiết kế lại công ty cho kỷ nguyên AI. Ông cho rằng các công ty truyền thống vận hành như "quân đoàn La Mã" với cấu trúc phân cấp cứng nhắc, trong khi AI có thể phá vỡ hoàn toàn giả định này. Thay vì chỉ dùng AI như một công cụ nâng cao năng suất (ví dụ: Copilot giúp kỹ sư viết code nhanh hơn 20%), tầm nhìn của ông là xây dựng "công ty bản địa AI" – một hệ thống gồm các vòng lặp AI có khả năng tự đệ quy và cải tiến. Hệ thống này thu thập dữ liệu từ thế giới bên ngoài (email, phiếu hỗ trợ, dữ liệu sản phẩm), đưa ra quyết định thông qua các quy tắc và công cụ, thực thi, rồi tự động học hỏi từ kết quả để tối ưu hóa ngay cả khi không có sự can thiệp của con người. YC đã áp dụng cơ chế này, nơi một agent giám sát tự động phát hiện truy vấn thất bại, tạo công cụ mới, viết code, và triển khai mà không cần con người. Điều này dẫn đến những thay đổi cơ bản trong tổ chức: 1. **"Đốt token, không đốt nhân sự"**: Điểm nghẽn tương lai sẽ là lượng token và chất lượng ngữ cảnh kinh doanh, chứ không phải số lượng nhân viên. 2. **Kết thúc của quản lý cấp trung**: Các chức năng điều phối sẽ được AI đảm nhận. 3. **Vai trò mới của con người**: Con người sẽ trở thành "người đóng góp cá nhân" (IC) và "người chịu trách nhiệm trực tiếp", tập trung vào các tình huống thực tế phức tạp, đầy rủi ro và cần phán đoán đạo đức mà AI chưa thể xử lý. Để xây dựng công ty như vậy, Tom Blomfield đề xuất: * **Ghi lại mọi thứ**: Mọi email, tin nhắn, cuộc họp đều phải được ghi chép để tạo thành "bộ não công ty" mà AI có thể đọc được. * **Tạo ra các sản phẩm tự cải tiến**: Như sổ tay hướng dẫn có thể tự động cập nhật dựa trên dữ liệu mới. * **Xem phần mềm là tạm thời**: Phần mềm nội bộ có thể được tạo ra theo yêu cầu và vứt bỏ; giá trị cốt lõi nằm ở dữ liệu và ngữ cảnh kinh doanh. Câu hỏi cuối cùng ông đặt ra là: Nếu thành lập công ty ngay hôm nay, bạn có thiết kế nó theo mô hình này ngay từ đầu không?

marsbit05/20 06:39

Đối tác YC: Làm thế nào để xây dựng một công ty bản địa AI có khả năng tự phát triển

marsbit05/20 06:39

活动图片