LiteRT-LM
Framework inference mã nguồn mở của Google để deploy LLM trên edge devices, hỗ trợ đa nền tảng, tool use, vision và audio.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
LiteRT-LM là framework inference mã nguồn mở của Google để triển khai large language models trực tiếp trên edge devices. Tool này nhắm tới bài toán chạy model trên Android, iOS, Web, desktop và cả thiết bị IoT, với trọng tâm là hiệu năng thực tế và tận dụng GPU, NPU khi có.
Điểm đáng chú ý là LiteRT-LM không chỉ nhắm tới chat text cơ bản, mà còn hỗ trợ multimodal, tool use và nhiều họ model như Gemma, Llama, Phi, Qwen. Nếu đang tìm một nền tảng để đưa LLM on-device vào sản phẩm thật, đây là repo rất đáng để theo dõi.
Tính năng chính
- Tối ưu inference cho edge, hỗ trợ Android, iOS, Web, desktop và Raspberry Pi
- Tận dụng hardware acceleration qua GPU và NPU để tăng hiệu năng chạy model
- Hỗ trợ vision, audio input và function calling cho agentic workflows
- Có CLI để thử nhanh model từ terminal mà không cần viết code ngay từ đầu
- Tài liệu riêng cho Python, C++, Kotlin và roadmap rõ cho các nền tảng khác
Ai nên dùng
Hợp với developer, đội sản phẩm và kỹ sư mobile hoặc edge AI muốn mang LLM lên thiết bị thật thay vì phụ thuộc hoàn toàn vào cloud inference.
Hạn chế
- Đây là framework thiên về deployment và inference, không phải tool all-in-one cho training hay fine-tuning
- Một số API và nền tảng vẫn đang trong giai đoạn phát triển hoặc rollout dần
- Muốn khai thác tốt cần hiểu thêm về model packaging, phần cứng và giới hạn của từng thiết bị