Jev by TypeSafe AI
API mô hình quyết định trả về Choice, Score hoặc xác suất yes/no theo schema cố định, dùng cho phân loại, routing và automation có ngưỡng tin cậy.
Xem thêm từ README.mdThu gọn README.md
Đánh giá chi tiết
Tổng quan
Jev là mô hình quyết định do TypeSafe AI vận hành. Nó không viết đoạn văn như chatbot. Ứng dụng gửi một state dạng text hoặc JSON cùng các câu hỏi có miền đáp án định trước, rồi nhận kết quả để dùng trực tiếp trong code. Ba kiểu câu hỏi chính là Noul cho xác suất yes/no, Choice cho một lựa chọn trong danh sách và Score cho thang điểm có thứ tự.
TypeSafe công bố Jev ngày 15/09/2026 ở trạng thái early access và mở đăng ký rộng hơn vào cuối tháng. Sản phẩm phù hợp với các bước cần phán đoán nhanh như phân loại ticket, chọn tool hoặc sub-agent, chấm mức rủi ro và routing request. Nó không thay thế model tạo nội dung; cách dùng hợp lý là đặt Jev giữa logic xác định và một hành động mà code vẫn kiểm soát.
Kiểu đầu ra và xác suất
Noul trả một số từ 0 đến 1 thể hiện xác suất câu trả lời là “yes”. Choice nhận tối đa 255 lựa chọn, trả nhãn có xác suất cao nhất và toàn bộ phân phối. Score nhận 2–10 mức có thứ tự rồi trả điểm kỳ vọng cùng phân phối xác suất.
Miền đầu ra đóng giúp loại bỏ một nhóm lỗi thường gặp khi parse text từ LLM. Nếu danh sách chỉ có billing, technical và other, Jev không thể tự tạo nhãn thứ tư. Tuy nhiên, điều này chỉ bảo đảm schema, không bảo đảm model chọn đúng. Câu quảng bá “không hallucinate” nên được hiểu theo nghĩa hẹp này.
Confidence của Choice và Score được tính từ chính phân phối xác suất, không phải một lời giải thích độc lập. TypeSafe nói model được huấn luyện để xác suất có calibration: nhóm dự đoán 0,8 sẽ đúng xấp xỉ 80% trong điều kiện phù hợp. Vấn đề là bộ eval chính thức hiện đo mức đồng thuận với nhãn consensus do hai model lớn tạo ra, chưa công bố ECE, Brier score hay reliability curve trên ground truth. Vì vậy mỗi đội vẫn phải đo threshold bằng dữ liệu thật của mình.
Một benchmark cộng đồng nhỏ trên 500 mẫu SMS spam và 500 mẫu Banking77 cho kết quả tốt nhưng không cho thấy lợi thế calibration nhất quán so với baseline giá rẻ. Đây là tín hiệu tham khảo, chưa đủ để kết luận rộng vì chỉ có hai dataset, một cấu hình và đường gọi qua OpenRouter.
SDK, giá và giấy phép
Jev là dịch vụ proprietary. Model weights, runtime và dữ liệu huấn luyện không được công khai. Hai SDK Python và JavaScript/TypeScript mang giấy phép MIT, nhưng chúng chỉ là client gọi API; open-source SDK không làm dịch vụ Jev trở thành mã nguồn mở.
Giá công bố cho Jev 1.13 là 0,042 USD trên một triệu input token, output token miễn phí. Tài liệu nêu context tối đa 64k token cho request và giới hạn 32k cho state cộng câu hỏi dài nhất. Rate limit có thể thay đổi theo tài khoản và thời điểm, nên ứng dụng cần retry/backoff và nên pin model ID thay vì phụ thuộc hoàn toàn vào alias jev-latest.
Trong kiểm tra không dùng API key, Python SDK có 671 test qua, 17 skip và 35 integration test được loại; JavaScript SDK có 189 unit test qua, typecheck sạch, build ESM/CJS/declaration thành công và 10 distribution test qua. Kết quả này xác nhận chất lượng client ở mức source/build, không xác minh latency, billing hoặc độ chính xác của model live.
Dữ liệu và credential
TypeSafe nói request và response của khách hàng không được dùng để train hoặc fine-tune model. Tuy nhiên chính sách mặc định không nêu thời gian lưu cố định; zero-data-retention là lựa chọn enterprise, không phải mặc định cho mọi tài khoản. Trust Center cho biết hạ tầng AWS xử lý và có thể lưu thông tin request tại Hoa Kỳ, còn Modal xử lý prompt trên compute nhưng không lưu.
SDK nhận API key qua tham số hoặc biến môi trường và che header credential trong log. JavaScript còn từ chối chạy trong browser theo mặc định để tránh lộ key, trừ khi developer bật dangerouslyAllowBrowser. Dù key được che, chế độ DEBUG của cả hai SDK có thể ghi đầy đủ request/response body. Không nên bật debug trong production nếu state chứa PII, nội dung khách hàng hoặc bí mật nghiệp vụ.
Điểm mạnh và hạn chế
Điểm mạnh của Jev là hợp đồng API nhỏ, typed và dễ đặt vào pipeline. Code không cần parse câu trả lời tự do, còn phân phối xác suất cho phép đặt vùng “không chắc thì chuyển cho người”. Giá input thấp cũng phù hợp khi cần nhiều quyết định ngắn.
Đổi lại, model còn rất mới, đóng hoàn toàn và phụ thuộc một nhà cung cấp. TypeSafe tự ghi nhận điểm yếu ở số học, đếm, ngày giờ, input dài chứa nhiễu, nội dung adversarial và bias theo thứ tự lựa chọn. Chất lượng chính vẫn ưu tiên tiếng Anh; workload tiếng Việt cần benchmark riêng.
Phù hợp khi nào
Jev đáng thử cho classification, routing, risk scoring hoặc confidence-gated automation khi miền đáp án đã được thiết kế rõ. Hãy bắt đầu bằng tập dữ liệu có nhãn, đo accuracy và calibration, chọn threshold theo chi phí sai lầm, đồng thời luôn có nhánh fallback hoặc human review.
Nếu bài toán cần giải thích dài, tạo nội dung, xử lý ảnh/audio hoặc yêu cầu model chạy hoàn toàn tại chỗ, Jev không phải lựa chọn phù hợp.