Giám khảo Skill · Skill Judge
Gợi ý đánh giá cho người chưa biết chấm Skill
Mô tả
Nhập bất kỳ Skill AI nào cần đánh giá (Skill đã cài đặt, trang marketplace, nội dung SKILL.md hoặc yêu cầu được mô tả bằng lời). Theo nguyên tắc «kiểm thử thực tế thay vì chỉ nghe mô tả», Skill sẽ thiết kế bộ ca kiểm thử tối thiểu gồm 4 ca tích cực, 1 ca tiêu cực và 1 ca mơ hồ để xác minh trực tiếp. Nếu có thể chạy thực tế, hệ thống sẽ chạy ngay; nếu không, toàn bộ quá trình sẽ được đánh dấu 【Đánh giá tĩnh】 và giải thích việc hạ trọng số đánh giá. Kết quả đưa ra thẻ điểm có trọng số theo năm chiều, ưu tiên nêu kết luận: độ tin cậy khi kích hoạt (30%)/hiệu quả thực thi (25%)/hiệu quả chi phí (15%)/độ ổn định và giới hạn (15%)/an toàn và độ đáng tin (15%). Dựa trên điểm tổng, Skill được phân loại theo các ngưỡng: ≥80 giữ lại, 60–80 cải thiện có trọng tâm, <60 làm lại. Báo cáo cũng chỉ ra nguyên nhân của điểm yếu (mô tả/các bước/tự kiểm tra cuối quy trình/độ dài) và đưa ra đề xuất cải thiện theo mức độ ưu tiên. Mặc định, hệ thống cung cấp kết luận nhanh trong một trang; nhập «深评» để nâng cấp thành báo cáo chẩn đoán toàn diện, gồm so sánh độ ổn định qua 3 lần chạy liên tiếp cùng một nhiệm vụ và tra cứu trực tuyến để kiểm chứng nguồn, tác giả cũng như danh tiếng. Kết quả sẽ được tự động lưu trữ trong nhóm «Báo cáo đánh giá Skill». Phù hợp để sàng lọc Skill trên marketplace trước khi cài đặt, kiểm định Skill tự tạo và đánh giá lại Skill đã cài đặt.
Giám khảo Skill · Skill Judge
Gợi ý đánh giá cho người chưa biết chấm Skill
Mô tả
Nhập bất kỳ Skill AI nào cần đánh giá (Skill đã cài đặt, trang marketplace, nội dung SKILL.md hoặc yêu cầu được mô tả bằng lời). Theo nguyên tắc «kiểm thử thực tế thay vì chỉ nghe mô tả», Skill sẽ thiết kế bộ ca kiểm thử tối thiểu gồm 4 ca tích cực, 1 ca tiêu cực và 1 ca mơ hồ để xác minh trực tiếp. Nếu có thể chạy thực tế, hệ thống sẽ chạy ngay; nếu không, toàn bộ quá trình sẽ được đánh dấu 【Đánh giá tĩnh】 và giải thích việc hạ trọng số đánh giá. Kết quả đưa ra thẻ điểm có trọng số theo năm chiều, ưu tiên nêu kết luận: độ tin cậy khi kích hoạt (30%)/hiệu quả thực thi (25%)/hiệu quả chi phí (15%)/độ ổn định và giới hạn (15%)/an toàn và độ đáng tin (15%). Dựa trên điểm tổng, Skill được phân loại theo các ngưỡng: ≥80 giữ lại, 60–80 cải thiện có trọng tâm, <60 làm lại. Báo cáo cũng chỉ ra nguyên nhân của điểm yếu (mô tả/các bước/tự kiểm tra cuối quy trình/độ dài) và đưa ra đề xuất cải thiện theo mức độ ưu tiên. Mặc định, hệ thống cung cấp kết luận nhanh trong một trang; nhập «深评» để nâng cấp thành báo cáo chẩn đoán toàn diện, gồm so sánh độ ổn định qua 3 lần chạy liên tiếp cùng một nhiệm vụ và tra cứu trực tuyến để kiểm chứng nguồn, tác giả cũng như danh tiếng. Kết quả sẽ được tự động lưu trữ trong nhóm «Báo cáo đánh giá Skill». Phù hợp để sàng lọc Skill trên marketplace trước khi cài đặt, kiểm định Skill tự tạo và đánh giá lại Skill đã cài đặt.
Tìm kỹ năng yêu thích tiếp theo của bạn
Khám phá thêm các kỹ năng AI được tuyển chọn cho nghiên cứu, sáng tạo và công việc hằng ngày.