🔬 Nghiên cứu & Tri thức•Mã nguồn mở•Đang hoạt động

autoresearch

Sandbox tự động hóa nghiên cứu LLM: để AI agent chỉnh train.py, chạy thí nghiệm 5 phút và lặp tối ưu trên một GPU NVIDIA.

#autoresearch
Danh mục
🔬 Nghiên cứu & Tri thức
Giá
Mã nguồn mở
GitHub Stars
⭐ 97,624
Ngôn ngữ
Python
Ngày thêm
2026-05-11
Tóm tắt từ README GitHub
autoresearch One day, frontier AI research used to be done by meat computers in between eating, sleeping, having other fun, and synchronizing once in a while using sound wave interconnect in the ritual of "group meeting". That era is long gone. Research is now entirely the domain of autonomous swarms of AI agents running across compute cluster megastructures in the skies. The agents claim that we are now in the 10,205th generation of the code base, in any case no one could tell if that's right or wrong as the "code" is now a self-modifying binary that has grown beyond human comprehension. This repo is the story of how it all began. -@karpathy, March 2026 . The idea: give an AI agent a small but real LLM training setup and let it experiment autonomously overnight. It modifies the code, trains for 5 minutes, checks if the result improved, keeps or discards, and repeats. You wake up in the morning to a log of experiments and (hopefully) a better model. The training code here is a simplified single-GPU implementation of nanochat. The core idea is that you're not touching any of the Python files like you normally would as a researcher. Instead, you are programming the Markdown files t
Xem thêm từ README.md

Đánh giá chi tiết

Tổng quan

autoresearch là một repo thử nghiệm của Andrej Karpathy về ý tưởng khá thú vị: thay vì nhà nghiên cứu tự sửa từng hyperparameter hay kiến trúc model, ta đưa cho AI agent một bài toán huấn luyện LLM nhỏ nhưng thật, rồi để agent tự chạy vòng lặp thử nghiệm qua đêm.

Cách repo này thiết kế rất gọn. Agent được phép chỉnh một file chính là train.py, sau đó chạy một thí nghiệm huấn luyện cố định 5 phút, đo val_bpb — validation bits per byte — rồi quyết định giữ hay bỏ thay đổi. Con người không trực tiếp chỉnh code training như thường lệ, mà “lập trình tổ chức nghiên cứu” bằng program.md: file hướng dẫn agent nên suy nghĩ, thử nghiệm và ghi log thế nào.

Điểm đáng chú ý không chỉ nằm ở kết quả training, mà ở mô hình workflow. autoresearch biến nghiên cứu ML thành một loop có thể chạy tự động, có metric rõ ràng, phạm vi sửa đổi nhỏ và diff dễ review. Đây là kiểu sandbox rất hợp để quan sát AI coding agent làm research thực nghiệm thay vì chỉ sinh code tĩnh.

Tính năng chính

  • Thiết lập training LLM tối giản dựa trên nanochat, đủ thật để agent có tín hiệu đo lường
  • Agent chỉ chỉnh train.py, giúp phạm vi thay đổi hẹp và dễ kiểm soát
  • Mỗi thí nghiệm chạy đúng 5 phút, tạo baseline so sánh tương đối công bằng trên cùng phần cứng
  • Dùng val_bpb làm metric chính, phù hợp để so sánh các thay đổi về kiến trúc, optimizer và batch size
  • program.md đóng vai trò như “research org code” để con người điều khiển chiến lược agent
  • Thiết kế self-contained, không cần distributed training hay hệ thống experiment tracking phức tạp
  • Có hướng dẫn cho các fork chạy trên Mac, Windows hoặc AMD dù bản chính ưu tiên NVIDIA GPU

Stack kỹ thuật

Repo viết bằng Python, dùng PyTorch và uv để quản lý môi trường. Training target mặc định là single NVIDIA GPU, README cho biết đã test trên H100. Cấu trúc cốt lõi chỉ xoay quanh prepare.py, train.py, program.md và pyproject.toml. License được ghi trong README là MIT.

Điểm mạnh

  • Ý tưởng rất rõ: biến AI agent thành một thực tập sinh nghiên cứu có vòng lặp thử nghiệm, metric và nhật ký
  • Phạm vi repo nhỏ nên dễ đọc, dễ fork và dễ quan sát agent làm gì sau mỗi experiment
  • Fixed 5-minute budget giúp agent tối ưu theo ràng buộc thực tế thay vì chỉ tăng model cho đẹp số
  • Phù hợp để test các agent như Claude Code, Codex CLI hoặc workflow tự động hóa research riêng
  • Có giá trị như một “benchmark sống” cho năng lực coding/research agent, không chỉ là demo training model

Hạn chế

  • Bản chính yêu cầu NVIDIA GPU, thực tế tốt nhất là GPU mạnh; người dùng Mac/CPU phải dựa vào fork hoặc tự chỉnh nhiều
  • Kết quả giữa các máy không so sánh trực tiếp được vì fixed time budget phụ thuộc phần cứng
  • Chưa phải framework experiment tracking hoàn chỉnh; logging, rollback, phân tích kết quả vẫn còn tối giản
  • Agent có thể tối ưu metric ngắn hạn mà không tạo insight nghiên cứu thật nếu program.md không được thiết kế kỹ
  • Đây thiên về playground/research prototype hơn là công cụ production cho team ML lớn

Phù hợp khi nào

Hợp với researcher, ML engineer hoặc builder đang muốn thử mô hình “AI agent tự làm thí nghiệm” trên một bài toán nhỏ, có metric rõ và chi phí compute kiểm soát được. Nếu bạn đang quan tâm đến autonomous research, agentic coding trong ML, hoặc muốn benchmark agent bằng tác vụ thật thay vì toy task, autoresearch là một repo rất đáng mổ xẻ.

autoresearch | Atlas for AI