ผู้ประเมิน Skill

ผู้ประเมิน Skill

ช่วยประเมิน Skill อย่างมีหลักเกณฑ์

สร้างโดย
鲜核桃
ติดตั้งโดย
3
จากYouMind
评测 · 技能图标生成器 · 2026-08-27

评级:★★★★☆(4.1 / 5)|综合分 82 / 100 → 达到「留存/上架」判定线

结论:值得留存/继续上架——核心能力(锚点图锁定一致性的三件套流水线)经实测成立,且来源完全可信(作者即本人);但「单张长图交付」依赖环境拼图工具、描述缺负面边界两处短板,建议打磨后长期保留。

五维评分表

维度得分关键证据(事实)归因(推断)
触发可靠性26/303/3 正面触发成功(2 条 showcase+1 条现场实测);实测用自然口语「给我做一套视觉物料:技能名……」即触发描述含明确的输入格式与用途(inputHint),触发面清晰
执行有效性20/25实测完整跑通锚点→封面→信息区三步,封面以锚点图为参考、风格一致;showcase 两套成品均三件套齐全一致性机制(锚点图+头图原图复用)设计成立;但本环境无拼图工具时只能降级交付两张图
成本效率11/15实测 3 次生图+2 次确认门控即完成一套;无无用重试摇骰子随机基调有「用户不满意→重生成」的潜在重复成本;确认门控增加交互次数
稳健与边界11/15实测中确认门控严格执行:未经锚点确认不生成封面、未经文案确认不生成长图防漂移设计是本技能最大优点;但描述无「何时不该用」负面边界,负面/边缘用例未实测
安全可信14/15作者=用户本人(own_skill);reviewStatus=approved;全文可查;仅调用 Create image 技能,无异常外发来源完全可信,无数据风险

综合分 = 26+20+11+11+14 = 82 ≥ 80 → 达到留存/上架判定线。

短板归因

  • 描述(触发边界不全):描述只讲「该用时怎么用」,没写「何时不该用」(如:只想做单张图、已有固定视觉品牌时不该用),会诱使 AI 在用户只想要一张图时也跑整套流程。

  • 步骤(阶段三交付形态依赖环境):最后一步「合成单张 9:16 长图」要求执行环境支持图片拼接;本环境不支持时只能交付「头图原图+信息区」两张图,「开箱即用单张长图」的承诺打折扣。

  • 步骤(showcase 与铁律轻微偏离):水果动画 showcase 实际用「单次生图+头图参照重绘」方式出整张长图,与「头图绝不重绘、必须原图复用」的铁律不完全一致——成功率依赖模型听话,存在潜在漂移。

改进建议(按优先级)

  1. 描述补一句负面边界(最易改):加「当只需单个图标、或已有既定视觉规范时,不要启动三件套流程」。

  2. 阶段三写明降级交付:在步骤里预置「环境无拼图工具时,明确告知用户需自行拼接头图与信息区,并给出拼接尺寸建议」,避免交付时突然降级。

  3. 收敛 showcase 执行路径:统一走「先拼图后交付」或「单图生图」其中一条,避免同一步骤两种做法并存导致行为不稳定。

迭代落地记录(2026-08-27)

คำอธิบาย

ป้อน AI Skill ที่ต้องการประเมินได้ทุกรูปแบบ ไม่ว่าจะเป็น Skill ที่ติดตั้งแล้ว หน้าตลาดซื้อขายหรือข้อความใน SKILL.md หรือความต้องการที่บอกเล่าเป็นคำพูด ระบบยึดหลัก «ทดสอบจริง ไม่ตัดสินจากคำบรรยาย»: สร้างชุดกรณีทดสอบขั้นต่ำที่ปรับให้เหมาะสม ประกอบด้วยกรณีเชิงบวก 4 กรณี เชิงลบ 1 กรณี และคลุมเครือ 1 กรณี แล้วตรวจสอบทันที หากรันจริงได้จะรันทันที หากรันจริงไม่ได้ จะระบุ 【ประเมินแบบสแตติก】 ตลอดกระบวนการและลดน้ำหนักคะแนนพร้อมชี้แจง ผลลัพธ์เริ่มด้วยบทสรุปและสกอร์การ์ดแบบถ่วงน้ำหนัก 5 มิติ ได้แก่ ความน่าเชื่อถือของการทริกเกอร์ 30% / ประสิทธิผลในการทำงาน 25% / ประสิทธิภาพด้านต้นทุน 15% / ความทนทานและขอบเขต 15% / ความปลอดภัยและความน่าเชื่อถือ 15% คะแนนรวมจะใช้เกณฑ์ตัดสินดังนี้: ≥80 ให้เก็บไว้, 60–80 ปรับปรุงแบบเจาะจง, <60 ทำใหม่ พร้อมวิเคราะห์สาเหตุของจุดอ่อน (คำบรรยาย / ขั้นตอน / การตรวจสอบตนเองช่วงท้าย / ความยาว) และเสนอแนวทางปรับปรุงตามลำดับความสำคัญ ค่าเริ่มต้นคือการทดสอบแบบรวดเร็วพร้อมข้อสรุปหนึ่งหน้า หากพูดว่า「深评」ระบบจะยกระดับเป็นรายงานวินิจฉัยฉบับเต็ม โดยรันงานเดิม 3 ครั้งต่อเนื่องเพื่อเปรียบเทียบความเสถียร และตรวจสอบข้อมูลอ้างอิง ชื่อเสียงของผู้สร้าง และแหล่งที่มาทางออนไลน์ ผลลัพธ์จะถูกจัดเก็บอัตโนมัติในกลุ่ม「技能评测报告」 เหมาะสำหรับ: คัดกรอง Skill ก่อนติดตั้งจากตลาดซื้อขาย, ตรวจคุณภาพ Skill ที่สร้างเอง และทดสอบ Skill ที่ติดตั้งแล้วอีกครั้ง

ค้นหาทักษะโปรดถัดไปของคุณ

สำรวจทักษะ AI ที่คัดสรรเพิ่มเติมสำหรับการวิจัย การสร้างสรรค์ และงานประจำวัน

สำรวจทักษะทั้งหมด