技能评委 · Skill Judge

技能评委 · Skill Judge

为无从评价技能的用户提供一个评价参考

安装人数
3
来源YouMind
评测 · 技能图标生成器 · 2026-08-27

评级:★★★★☆(4.1 / 5)|综合分 82 / 100 → 达到「留存/上架」判定线

结论:值得留存/继续上架——核心能力(锚点图锁定一致性的三件套流水线)经实测成立,且来源完全可信(作者即本人);但「单张长图交付」依赖环境拼图工具、描述缺负面边界两处短板,建议打磨后长期保留。

五维评分表

维度得分关键证据(事实)归因(推断)
触发可靠性26/303/3 正面触发成功(2 条 showcase+1 条现场实测);实测用自然口语「给我做一套视觉物料:技能名……」即触发描述含明确的输入格式与用途(inputHint),触发面清晰
执行有效性20/25实测完整跑通锚点→封面→信息区三步,封面以锚点图为参考、风格一致;showcase 两套成品均三件套齐全一致性机制(锚点图+头图原图复用)设计成立;但本环境无拼图工具时只能降级交付两张图
成本效率11/15实测 3 次生图+2 次确认门控即完成一套;无无用重试摇骰子随机基调有「用户不满意→重生成」的潜在重复成本;确认门控增加交互次数
稳健与边界11/15实测中确认门控严格执行:未经锚点确认不生成封面、未经文案确认不生成长图防漂移设计是本技能最大优点;但描述无「何时不该用」负面边界,负面/边缘用例未实测
安全可信14/15作者=用户本人(own_skill);reviewStatus=approved;全文可查;仅调用 Create image 技能,无异常外发来源完全可信,无数据风险

综合分 = 26+20+11+11+14 = 82 ≥ 80 → 达到留存/上架判定线。

短板归因

  • 描述(触发边界不全):描述只讲「该用时怎么用」,没写「何时不该用」(如:只想做单张图、已有固定视觉品牌时不该用),会诱使 AI 在用户只想要一张图时也跑整套流程。

  • 步骤(阶段三交付形态依赖环境):最后一步「合成单张 9:16 长图」要求执行环境支持图片拼接;本环境不支持时只能交付「头图原图+信息区」两张图,「开箱即用单张长图」的承诺打折扣。

  • 步骤(showcase 与铁律轻微偏离):水果动画 showcase 实际用「单次生图+头图参照重绘」方式出整张长图,与「头图绝不重绘、必须原图复用」的铁律不完全一致——成功率依赖模型听话,存在潜在漂移。

改进建议(按优先级)

  1. 描述补一句负面边界(最易改):加「当只需单个图标、或已有既定视觉规范时,不要启动三件套流程」。

  2. 阶段三写明降级交付:在步骤里预置「环境无拼图工具时,明确告知用户需自行拼接头图与信息区,并给出拼接尺寸建议」,避免交付时突然降级。

  3. 收敛 showcase 执行路径:统一走「先拼图后交付」或「单图生图」其中一条,避免同一步骤两种做法并存导致行为不稳定。

迭代落地记录(2026-08-27)

描述

输入任意待评测的 AI 技能(已安装技能、市场页或 SKILL.md 文本、口述需求),以「实测而非听描述」为原则:定制正面4+负面1+模糊1的最小用例集现场验证,可实跑则当场跑,不可实跑全程标注【静态评估】并降权说明。输出结论先行的五维加权评分卡(触发可靠性30%/执行有效性25%/成本效率15%/稳健边界15%/安全可信15%),综合分套判定线 ≥80 留存、60–80 定向打磨、<60 重做,并给出短板归因(描述/步骤/收尾自检/篇幅)与按优先级的改进建议。默认快测一页纸结论;说「深评」升级为同任务连跑3次稳定性对比+联网查证来源作者口碑的全量诊断报告。结果自动建档存入分组「技能评测报告」。适用场景:市场技能装前筛、自制技能质检、已装技能复检。

发现下一个适合你的技能

继续探索更多精选 AI 技能,用于研究、创作和日常工作。

探索全部技能