🧩 Framework & Thư việnMã nguồn mởBeta

WASTE

Engine C stream expert weight từ NVMe để chạy mô hình MoE lớn hơn RAM, hiện tập trung vào Kimi K3 và API tương thích OpenAI.

#waste
Danh mục
🧩 Framework & Thư viện
Giá
Mã nguồn mở
GitHub Stars
2,435
Ngôn ngữ
C
License
Apache-2.0
Ngày thêm
2026-08-05
Tóm tắt từ README GitHub
WARP — Weight-Aware Runtime and Paging (formerly WASTE) WARP is an embeddable inference engine written in C, with no third-party runtime dependencies. It keeps the model trunk in memory, streams selected experts directly from disk, and uses the remaining RAM as a bounded expert cache. The project is driven by humans: the ideas, hypotheses, priorities, tests, and decisions are human. The code is written by LLMs. At this scale, that is the only way to iterate on new algorithms and test hypotheses fast enough. The goal is to run huge frontier models such as Kimi K3 on consumer hardware. Today, the complete 2.78-trillion-parameter Kimi K3 runs on a 64 GB MacBook Pro at about 0.6 tokens per second , the 552-billion-parameter DeepSeek-V4.1-Flash at about 3.8 , and the 313-billion-parameter GLM-5.3-Flash — text and images — at about 3.9 . Ultimately we want WARP to execute Kimi K3 locally to improve itself (we are currently using Opus 5 with extra thinking). WARP is intentionally narrow, and it exists to find out how far local inference can be pushed when model weights live mostly on fast storage instead of RAM. This is the full model, not a distilled or pruned version. Its publishe
Xem thêm từ README.md

Đánh giá chi tiết

Tổng quan

WASTE là viết tắt của Weight-Aware Streaming Tensor Engine, một engine inference C tập trung vào model Mixture-of-Experts lớn hơn RAM. Nó giữ trunk trong bộ nhớ, đọc expert được chọn trực tiếp từ NVMe và dùng phần RAM còn lại làm cache có giới hạn. Mục tiêu hiện tại là chạy toàn bộ Kimi K3 2,78 nghìn tỷ tham số trên máy cá nhân.

So với thử nghiệm chỉ tối thiểu hóa RAM, WASTE chọn điểm cân bằng thực dụng hơn: dự án khuyến nghị MacBook Pro 64 GB, container model 982 GB và công bố tốc độ khoảng 0,45–0,62 token/giây. Vẫn chậm, nhưng đủ để nghiên cứu tương tác và nhanh hơn rất nhiều so với cấu hình 8 GB phải stream gần như mọi thứ.

Tính năng chính

  • Engine C11 và library nhúng, không cần BLAS/Python/CUDA khi inference CPU.
  • Expert streaming, read-ahead và cache theo memory budget.
  • Container riêng với quantization 3-bit cho expert và 4/8-bit cho phần nhạy cảm.
  • CLI, session lưu lại, multimodal image input và HTTP server tương thích OpenAI chat completions.
  • Công cụ download/conversion có resume; v0.6.5 thêm chế độ reclaim source shard.
  • Tài liệu chi tiết về format, KDA, backend, correctness gate và kết quả âm tính.

Bằng chứng kiểm thử

Tôi chạy make check trên macOS tại current main. Phần build và hầu hết suite vượt qua: 29 kiểm tra pass, 13 skip do không có model thật hoặc tokenizer, nhưng test server concurrent request thất bại vì hai trong tám kết nối bị reset. Chạy riêng test này vẫn tái hiện lỗi. Vì vậy rating được giữ thận trọng dù CI upstream trên head được GitHub ghi nhận thành công; lỗi có thể phụ thuộc macOS/Python server stack nhưng vẫn là kết quả độc lập cần nêu rõ.

Các test model-free xác nhận kernel, cache, container corruption handling, memory floor, conversion resume và nhiều invariant khác. Tôi không tải gần 1 TB model, nên tốc độ 0,6 token/giây và logits Kimi K3 vẫn là số liệu của dự án.

Hạn chế

Đây không phải “Kimi K3 chạy nhẹ”. Muốn dùng full model cần khoảng 64 GB RAM, gần 1 TB internal NVMe và thêm tới 1,42 TB staging nếu tự chuyển đổi weights. Storage bên ngoài chậm làm throughput giảm mạnh. API/format chưa đóng băng, dự án thừa nhận thay đổi nhanh và có thể bất ổn.

Chế độ --reclaim on xóa shard nguồn sau khi consumer cuối hoàn thành. Nó tắt mặc định và không thể đảo ngược; sau đó muốn verify lại với source phải tải shard lần nữa. Server v0.6.5 cũng nâng default max token từ 512 lên 4096, có thể làm tăng thời gian/chi phí nếu deployment từng dựa vào giới hạn cũ.

Phù hợp khi nào

WASTE phù hợp với kỹ sư inference và người có máy nhiều RAM/NVMe muốn nghiên cứu frontier MoE local. Với chatbot thường ngày, model nhỏ hơn cho tốc độ tốt hơn rất nhiều. Hãy bắt đầu bằng Kimi-Linear 48B container 19 GB trước khi cam kết tải Kimi K3.