Juiz de Skills · Skill Judge

Juiz de Skills · Skill Judge

Uma referência para avaliar Skills

Criado por
鲜核桃
Instalado por
3
DeYouMind
评测 · 技能图标生成器 · 2026-08-27

评级:★★★★☆(4.1 / 5)|综合分 82 / 100 → 达到「留存/上架」判定线

结论:值得留存/继续上架——核心能力(锚点图锁定一致性的三件套流水线)经实测成立,且来源完全可信(作者即本人);但「单张长图交付」依赖环境拼图工具、描述缺负面边界两处短板,建议打磨后长期保留。

五维评分表

维度得分关键证据(事实)归因(推断)
触发可靠性26/303/3 正面触发成功(2 条 showcase+1 条现场实测);实测用自然口语「给我做一套视觉物料:技能名……」即触发描述含明确的输入格式与用途(inputHint),触发面清晰
执行有效性20/25实测完整跑通锚点→封面→信息区三步,封面以锚点图为参考、风格一致;showcase 两套成品均三件套齐全一致性机制(锚点图+头图原图复用)设计成立;但本环境无拼图工具时只能降级交付两张图
成本效率11/15实测 3 次生图+2 次确认门控即完成一套;无无用重试摇骰子随机基调有「用户不满意→重生成」的潜在重复成本;确认门控增加交互次数
稳健与边界11/15实测中确认门控严格执行:未经锚点确认不生成封面、未经文案确认不生成长图防漂移设计是本技能最大优点;但描述无「何时不该用」负面边界,负面/边缘用例未实测
安全可信14/15作者=用户本人(own_skill);reviewStatus=approved;全文可查;仅调用 Create image 技能,无异常外发来源完全可信,无数据风险

综合分 = 26+20+11+11+14 = 82 ≥ 80 → 达到留存/上架判定线。

短板归因

  • 描述(触发边界不全):描述只讲「该用时怎么用」,没写「何时不该用」(如:只想做单张图、已有固定视觉品牌时不该用),会诱使 AI 在用户只想要一张图时也跑整套流程。

  • 步骤(阶段三交付形态依赖环境):最后一步「合成单张 9:16 长图」要求执行环境支持图片拼接;本环境不支持时只能交付「头图原图+信息区」两张图,「开箱即用单张长图」的承诺打折扣。

  • 步骤(showcase 与铁律轻微偏离):水果动画 showcase 实际用「单次生图+头图参照重绘」方式出整张长图,与「头图绝不重绘、必须原图复用」的铁律不完全一致——成功率依赖模型听话,存在潜在漂移。

改进建议(按优先级)

  1. 描述补一句负面边界(最易改):加「当只需单个图标、或已有既定视觉规范时,不要启动三件套流程」。

  2. 阶段三写明降级交付:在步骤里预置「环境无拼图工具时,明确告知用户需自行拼接头图与信息区,并给出拼接尺寸建议」,避免交付时突然降级。

  3. 收敛 showcase 执行路径:统一走「先拼图后交付」或「单图生图」其中一条,避免同一步骤两种做法并存导致行为不稳定。

迭代落地记录(2026-08-27)

Descrição

Insira qualquer Skill de IA que queira avaliar — uma Skill instalada, uma página do marketplace, o texto de SKILL.md ou uma necessidade descrita por você. Seguindo o princípio de “testar na prática, não apenas ouvir a descrição”, a Skill personaliza um conjunto mínimo de casos de uso com 4 cenários positivos, 1 negativo e 1 ambíguo para validação. Quando for possível executar, faz o teste na hora; quando não for, marca todo o processo como 【avaliação estática】 e reduz o peso correspondente na análise. O resultado começa com uma ficha de pontuação ponderada em cinco dimensões: confiabilidade do acionamento (30%), eficácia da execução (25%), eficiência de custos (15%), robustez e limites (15%) e segurança e confiabilidade (15%). A pontuação geral segue estes critérios: ≥80, manter; 60–80, aprimorar de forma direcionada; <60, refazer. Também identifica as causas dos pontos fracos — descrição, etapas, autoverificação final ou extensão — e apresenta sugestões de melhoria por prioridade. Por padrão, entrega uma conclusão rápida em uma página. Diga “深评” para obter um relatório completo de diagnóstico, com comparação de estabilidade após executar a mesma tarefa 3 vezes seguidas e verificação online das fontes, da reputação e do autor. Os resultados são arquivados automaticamente no grupo “Relatórios de avaliação de Skills”. Cenários de uso: triagem de Skills do marketplace antes da instalação, controle de qualidade de Skills próprias e reavaliação de Skills já instaladas.

Encontre sua próxima habilidade favorita

Explore mais habilidades de IA selecionadas para pesquisa, criação e trabalho do dia a dia.

Explorar todas as habilidades