Оценщик навыков · Skill Judge

Оценщик навыков · Skill Judge

Помогает оценить AI-навыки без догадок

Автор:
鲜核桃
Установили
3
ОтYouMind
评测 · 技能图标生成器 · 2026-08-27

评级:★★★★☆(4.1 / 5)|综合分 82 / 100 → 达到「留存/上架」判定线

结论:值得留存/继续上架——核心能力(锚点图锁定一致性的三件套流水线)经实测成立,且来源完全可信(作者即本人);但「单张长图交付」依赖环境拼图工具、描述缺负面边界两处短板,建议打磨后长期保留。

五维评分表

维度得分关键证据(事实)归因(推断)
触发可靠性26/303/3 正面触发成功(2 条 showcase+1 条现场实测);实测用自然口语「给我做一套视觉物料:技能名……」即触发描述含明确的输入格式与用途(inputHint),触发面清晰
执行有效性20/25实测完整跑通锚点→封面→信息区三步,封面以锚点图为参考、风格一致;showcase 两套成品均三件套齐全一致性机制(锚点图+头图原图复用)设计成立;但本环境无拼图工具时只能降级交付两张图
成本效率11/15实测 3 次生图+2 次确认门控即完成一套;无无用重试摇骰子随机基调有「用户不满意→重生成」的潜在重复成本;确认门控增加交互次数
稳健与边界11/15实测中确认门控严格执行:未经锚点确认不生成封面、未经文案确认不生成长图防漂移设计是本技能最大优点;但描述无「何时不该用」负面边界,负面/边缘用例未实测
安全可信14/15作者=用户本人(own_skill);reviewStatus=approved;全文可查;仅调用 Create image 技能,无异常外发来源完全可信,无数据风险

综合分 = 26+20+11+11+14 = 82 ≥ 80 → 达到留存/上架判定线。

短板归因

  • 描述(触发边界不全):描述只讲「该用时怎么用」,没写「何时不该用」(如:只想做单张图、已有固定视觉品牌时不该用),会诱使 AI 在用户只想要一张图时也跑整套流程。

  • 步骤(阶段三交付形态依赖环境):最后一步「合成单张 9:16 长图」要求执行环境支持图片拼接;本环境不支持时只能交付「头图原图+信息区」两张图,「开箱即用单张长图」的承诺打折扣。

  • 步骤(showcase 与铁律轻微偏离):水果动画 showcase 实际用「单次生图+头图参照重绘」方式出整张长图,与「头图绝不重绘、必须原图复用」的铁律不完全一致——成功率依赖模型听话,存在潜在漂移。

改进建议(按优先级)

  1. 描述补一句负面边界(最易改):加「当只需单个图标、或已有既定视觉规范时,不要启动三件套流程」。

  2. 阶段三写明降级交付:在步骤里预置「环境无拼图工具时,明确告知用户需自行拼接头图与信息区,并给出拼接尺寸建议」,避免交付时突然降级。

  3. 收敛 showcase 执行路径:统一走「先拼图后交付」或「单图生图」其中一条,避免同一步骤两种做法并存导致行为不稳定。

迭代落地记录(2026-08-27)

Описание

Введите любой AI-навык для оценки: установленный навык, страницу в маркете, текст SKILL.md или устное описание задачи. Принцип — «проверять на практике, а не по описанию»: настраивается минимальный набор из 4 позитивных, 1 негативного и 1 неоднозначного сценария, который проверяется в реальных условиях. Если запуск возможен, навык запускается сразу; если нет — весь процесс помечается как 【静态评估】, а результаты получают меньший вес.\n\nНа выходе — взвешенная пятикомпонентная оценочная карта с выводом в начале: надёжность срабатывания (30%), эффективность выполнения (25%), экономичность (15%), устойчивость и граничные случаи (15%), безопасность и достоверность (15%). Итоговая оценка сопоставляется с порогами: ≥80 — оставить, 60–80 — доработать по конкретным направлениям, <60 — переделать. Также указываются причины слабых мест (описание/шаги/финальная самопроверка/объём) и даются приоритетные рекомендации по улучшению.\n\nПо умолчанию создаётся краткий одностраничный вывод. Скажите «глубокая оценка», чтобы получить полный диагностический отчёт: 3 последовательных запуска одной задачи для сравнения стабильности и проверку в интернете источников и репутации автора. Результат автоматически сохраняется в группе «Отчёты об оценке навыков».\n\nПодходит для предварительного отбора навыков в маркете, проверки собственных навыков и повторной оценки уже установленных.

Найди свой следующий любимый скилл

Изучи больше отобранных AI-скиллов для исследований, творчества и повседневной работы.

Изучить все скиллы