10 paper AI nổi bật nhất trên Hugging Face hôm nay: từ agent tự cải tiến đến benchmark cho “active observers”
Hôm nay mình tổng hợp 10 paper đang được upvote cao nhất trên Hugging Face. Danh sách này khá thú vị vì trải rộng nhiều hướng rất “nóng”: deep research agent, hậu huấn luyện mô hình lớn, embodied visual tracking, knowledge graph cho giáo dục, self-distillation cho vision, diffusion language model, đánh giá spatial cognition, sinh video dài, retrieval vượt khỏi “relevance”, và benchmark cho tác tử quan sát chủ động.
Bài viết này không đi quá sâu vào chi tiết toán học, mà tập trung trả lời 4 câu hỏi cho mỗi paper:
- Bài toán là gì?
- Ý tưởng chính là gì?
- Điểm mới nằm ở đâu?
- Ứng dụng thực tế ra sao?
1) AREX: Towards a Recursively Self-Improving Agent for Deep Research
-
Paper:
2607.21461 - GitHub: https://github.com/VectorSpaceLab/arex-model
- Project: https://vectorspacelab.github.io/arex-model/
Bài toán
Các “deep research agent” hiện nay có thể tìm kiếm, đọc tài liệu, tóm tắt và lập báo cáo, nhưng vẫn có một giới hạn lớn: chúng chưa thực sự tự cải tiến theo vòng lặp. Phần lớn agent chỉ chạy theo pipeline cố định hoặc được tối ưu thủ công.
Ý tưởng
AREX hướng đến một agent có khả năng đệ quy tự cải tiến. Nghĩa là agent không chỉ làm nghiên cứu, mà còn biết đánh giá kết quả của chính mình, tìm điểm yếu, sửa chiến lược, rồi chạy vòng tiếp theo.
Ta có thể hình dung AREX như một “nhà nghiên cứu AI” gồm nhiều vòng:
- lập kế hoạch nghiên cứu,
- truy xuất thông tin,
- tổng hợp,
- tự phản biện,
- tinh chỉnh chiến lược cho lượt sau.
Điểm mới
Điểm mới quan trọng nằm ở từ khóa recursively self-improving. Nhiều hệ agent hiện tại có “reflection”, nhưng reflection thường chỉ là một bước phụ. AREX có vẻ đẩy ý tưởng này thành trung tâm kiến trúc, biến cải tiến lặp thành cơ chế vận hành chính.
Nếu làm tốt, đây là bước tiến từ “agent biết dùng công cụ” sang “agent biết cải thiện cách dùng công cụ”.
Ứng dụng thực tế
- Trợ lý nghiên cứu khoa học
- Phân tích thị trường, pháp lý, tài chính
- Tự động tạo literature review
- Internal knowledge agent cho doanh nghiệp
Đây là một hướng cực kỳ thực dụng, đặc biệt khi nhu cầu “AI analyst” ngày càng lớn.
2) SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
-
Paper:
2607.20145 - GitHub: https://github.com/SLAI-AITP/SLAI-T-Rex
Bài toán
Huấn luyện và hậu huấn luyện các mô hình cực lớn thường phụ thuộc mạnh vào hệ sinh thái GPU phổ biến. Câu hỏi là: liệu có thể thực hiện full-parameter post-training quy mô lớn trên hạ tầng khác, cụ thể là Ascend SuperPOD, một cách ổn định và hiệu quả không?
Ý tưởng
Paper này tập trung vào hạ tầng và quy trình hậu huấn luyện toàn bộ tham số cho họ mô hình DeepSeek-V4 trên Ascend. Đây không chỉ là câu chuyện “port code”, mà còn liên quan đến:
- tối ưu song song hóa,
- ổn định số học,
- thông lượng huấn luyện,
- khả năng mở rộng.
Điểm mới
Điểm mới nằm ở giá trị systems engineering nhiều hơn là thuật toán thuần túy. Trong bối cảnh AI ngày càng phụ thuộc vào compute stack, các kết quả chứng minh khả năng hậu huấn luyện mô hình lớn trên nền tảng thay thế có ý nghĩa chiến lược rất lớn.
Nó cho thấy hệ sinh thái LLM đang dần đa dạng hóa phần cứng, giảm phụ thuộc vào một stack duy nhất.
Ứng dụng thực tế
- Tổ chức muốn fine-tune/post-train mô hình lớn trên hạ tầng nội địa
- Doanh nghiệp xây private LLM stack
- Nghiên cứu tối ưu phân tán cho model training
Đây là paper đáng chú ý nếu bạn quan tâm tới AI infrastructure hơn là chỉ benchmark mô hình.
3) ReferTrack: Referring Then Tracking for Embodied Visual Tracking
-
Paper:
2607.20061 - GitHub: https://github.com/MedlarTea/referTrack
- Project: https://medlartea.github.io/referTrack/
Bài toán
Trong môi trường embodied AI, robot không chỉ cần “track một vật thể”, mà còn phải hiểu những chỉ dẫn kiểu: “hãy theo dõi chiếc cốc màu đỏ trên bàn”. Đây là bài toán kết hợp giữa ngôn ngữ tham chiếu và theo dõi thị giác.
Ý tưởng
ReferTrack đề xuất quy trình hai bước:
- Referring: xác định đúng đối tượng từ mô tả ngôn ngữ.
- Tracking: sau khi đã khóa mục tiêu, theo dõi nó xuyên suốt chuỗi quan sát/hành động.
Cách tách này rất hợp lý vì nó phản ánh cách con người làm: đầu tiên hiểu “đối tượng nào”, sau đó mới “bám theo nó”.
Điểm mới
Điểm mới là gắn chặt bài toán referring expression với embodied tracking, thay vì coi tracking là tác vụ đơn lẻ trên video tĩnh. Điều này giúp mô hình gần hơn với bối cảnh robot thực tế, nơi góc nhìn thay đổi liên tục do agent di chuyển.
Ứng dụng thực tế
- Robot gia đình nhận lệnh bằng ngôn ngữ tự nhiên
- Robot kho vận theo dõi đối tượng mục tiêu
- AR/VR assistant hiểu và bám đối tượng người dùng nhắc tới
Paper này rất đáng chú ý vì nó nằm ở giao điểm giữa vision-language và robotics.
4) K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
-
Paper:
2605.09635 - GitHub: https://github.com/haolpku/K12-Dataset
- Project: https://haolpku.github.io/K12-KGraph-page/
Bài toán
LLM cho giáo dục thường thiếu một cấu trúc tri thức rõ ràng gắn với chương trình học K-12. Nếu không có curriculum-aligned knowledge, mô hình có thể trả lời đúng ngẫu nhiên nhưng lại thiếu khả năng dạy học theo tiến trình.
Ý tưởng
K12-KGraph xây dựng một knowledge graph bám sát chương trình K-12
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.