autoresearch
Sandbox tự động hóa nghiên cứu LLM: để AI agent chỉnh train.py, chạy thí nghiệm 5 phút và lặp tối ưu trên một GPU NVIDIA.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
autoresearch là một repo thử nghiệm của Andrej Karpathy về ý tưởng khá thú vị: thay vì nhà nghiên cứu tự sửa từng hyperparameter hay kiến trúc model, ta đưa cho AI agent một bài toán huấn luyện LLM nhỏ nhưng thật, rồi để agent tự chạy vòng lặp thử nghiệm qua đêm.
Cách repo này thiết kế rất gọn. Agent được phép chỉnh một file chính là train.py, sau đó chạy một thí nghiệm huấn luyện cố định 5 phút, đo val_bpb — validation bits per byte — rồi quyết định giữ hay bỏ thay đổi. Con người không trực tiếp chỉnh code training như thường lệ, mà “lập trình tổ chức nghiên cứu” bằng program.md: file hướng dẫn agent nên suy nghĩ, thử nghiệm và ghi log thế nào.
Điểm đáng chú ý không chỉ nằm ở kết quả training, mà ở mô hình workflow. autoresearch biến nghiên cứu ML thành một loop có thể chạy tự động, có metric rõ ràng, phạm vi sửa đổi nhỏ và diff dễ review. Đây là kiểu sandbox rất hợp để quan sát AI coding agent làm research thực nghiệm thay vì chỉ sinh code tĩnh.
Tính năng chính
- Thiết lập training LLM tối giản dựa trên nanochat, đủ thật để agent có tín hiệu đo lường
- Agent chỉ chỉnh
train.py, giúp phạm vi thay đổi hẹp và dễ kiểm soát - Mỗi thí nghiệm chạy đúng 5 phút, tạo baseline so sánh tương đối công bằng trên cùng phần cứng
- Dùng
val_bpblàm metric chính, phù hợp để so sánh các thay đổi về kiến trúc, optimizer và batch size program.mdđóng vai trò như “research org code” để con người điều khiển chiến lược agent- Thiết kế self-contained, không cần distributed training hay hệ thống experiment tracking phức tạp
- Có hướng dẫn cho các fork chạy trên Mac, Windows hoặc AMD dù bản chính ưu tiên NVIDIA GPU
Stack kỹ thuật
Repo viết bằng Python, dùng PyTorch và uv để quản lý môi trường. Training target mặc định là single NVIDIA GPU, README cho biết đã test trên H100. Cấu trúc cốt lõi chỉ xoay quanh prepare.py, train.py, program.md và pyproject.toml. License được ghi trong README là MIT.
Điểm mạnh
- Ý tưởng rất rõ: biến AI agent thành một thực tập sinh nghiên cứu có vòng lặp thử nghiệm, metric và nhật ký
- Phạm vi repo nhỏ nên dễ đọc, dễ fork và dễ quan sát agent làm gì sau mỗi experiment
- Fixed 5-minute budget giúp agent tối ưu theo ràng buộc thực tế thay vì chỉ tăng model cho đẹp số
- Phù hợp để test các agent như Claude Code, Codex CLI hoặc workflow tự động hóa research riêng
- Có giá trị như một “benchmark sống” cho năng lực coding/research agent, không chỉ là demo training model
Hạn chế
- Bản chính yêu cầu NVIDIA GPU, thực tế tốt nhất là GPU mạnh; người dùng Mac/CPU phải dựa vào fork hoặc tự chỉnh nhiều
- Kết quả giữa các máy không so sánh trực tiếp được vì fixed time budget phụ thuộc phần cứng
- Chưa phải framework experiment tracking hoàn chỉnh; logging, rollback, phân tích kết quả vẫn còn tối giản
- Agent có thể tối ưu metric ngắn hạn mà không tạo insight nghiên cứu thật nếu
program.mdkhông được thiết kế kỹ - Đây thiên về playground/research prototype hơn là công cụ production cho team ML lớn
Phù hợp khi nào
Hợp với researcher, ML engineer hoặc builder đang muốn thử mô hình “AI agent tự làm thí nghiệm” trên một bài toán nhỏ, có metric rõ và chi phí compute kiểm soát được. Nếu bạn đang quan tâm đến autonomous research, agentic coding trong ML, hoặc muốn benchmark agent bằng tác vụ thật thay vì toy task, autoresearch là một repo rất đáng mổ xẻ.