El mes pasado perdí casi todo un viernes por culpa de un skill de Claude Code "battle-tested" que alguien publicó en un Discord. Cuatrocientas estrellas. El README tenía un diagrama. También se tragaba todos los errores de la API que envolvía, así que cuando esa API empezó a devolver 429s, mi agent siguió adelante tranquilamente. Con confianza. Escribiendo basura en una tabla real que tuve que limpiar a mano.
Eso es un skill de relleno. Y detectarlo antes de que toque algo que importa se ha convertido silenciosamente en parte del trabajo. Ahora hay miles de estos, y todos se ven geniales en una captura de pantalla.
Aquí está la lista que repaso antes de confiar en un AI agent skill, un servidor MCP o una regla de Cursor. No es teoría. Es lo que ojalá hubiera verificado antes de ese viernes.
Qué es un skill de relleno en realidad
Un skill de relleno aparenta una competencia que no tiene. Está construido para ser adoptado, no para sobrevivir al contacto con producción. Buen nombre, README con confianza, un gif de demo donde el sol siempre brilla. Luego se derrumba en el segundo en que la realidad deja de ser el camino feliz.
La señal es la brecha entre lo pulido que parece y cuánto daño real ha sufrido. El código que ha corrido en producción un tiempo tiene cicatrices: cláusulas de guardia raras, un comentario que dice "no borres esto, lo aprendí a las malas," un retry que alguien claramente agregó a las 2 a.m. El relleno no tiene nada de eso. Tiene buena redacción.
Lo ves en skills de Claude Code, reglas de Cursor, servidores MCP, plantillas de agents. Cualquiera puede publicar uno en una tarde, y un modelo escribirá felizmente un README convincente para acompañarlo. La oferta se fue vertical. La calidad no se movió.
Cómo evaluar un AI agent skill: el check de 5 puntos
No leo todo de arriba abajo. Busco olores específicos, en este orden.
1. ¿Maneja el camino infeliz? Hago grep para el manejo de errores antes de leer cualquier lógica principal. ¿Sin try/catch, sin ramas de error, sin reintentos, sin timeout? Entonces fue escrito contra un demo y probado contra un demo. Un skill que no puede decirle al modelo "esto falló, aquí está el porqué, para" dejará que tu agent alucine directamente a través del fallo. Ese es el tipo peligroso. No falla. Miente, y lo hace sonando genial.
2. ¿Le dice al modelo cuándo NO actuar? Casi nadie verifica esto. Un buen skill incorpora límites en sus instrucciones: cuándo retirarse, cuándo preguntar primero, qué no debe tocar nunca. El relleno solo describe lo que hace bien. No hay "si no estás seguro, detente." Dale eso a un agent autónomo y le has dado una herramienta eléctrica a algo que no tiene idea de dónde están sus propias manos.
3. ¿Se validan los inputs o simplemente se asumen? Encuentra dónde entran los datos. ¿Se verifica algo? El relleno asume que el modelo siempre devuelve JSON limpio, el archivo siempre existe, el campo siempre está poblado. Producción es exactamente donde ese campo regresa null mientras duermes.
4. ¿Cuál fue el último commit, y qué contenía? Un skill sin tocar durante ocho meses, encima de herramientas que publican cambios breaking cada mes, es un fósil. Lee también lo que los commits realmente dicen. ¿Todo "update README" y ningún "fix edge case"? Nadie lo está ejecutando de verdad. El uso real genera correcciones reales de bugs. El historial de commits te dirá la verdad que el README no dirá.
5. ¿Cuál es el radio de explosión? La pregunta más tonta, el mayor beneficio. ¿Qué puede tocar realmente esto? Un skill que dice formatear tus mensajes de commit pero silenciosamente tiene acceso de escritura a todo el repositorio más egreso de red es una responsabilidad disfrazada de herramienta útil. El alcance debe coincidir con el trabajo. Cuando no coincide, ahí está toda la historia.
La mayoría de esto es rápido. Unos pocos grep y un vistazo al historial de commits detecta la basura obvia antes de que haya invertido tiempo real.
La parte que realmente te cuesta
He aquí la cosa sobre evaluar skills correctamente. La auditoría no es difícil. Es el volumen lo que te agota, y no para.
Nunca estás revisando uno. Estás eligiendo entre nueve que todos dicen hacer el mismo trabajo, y están dispersos. GitHub. Dos Discord diferentes. Un par de listas "awesome-skills" que se volvieron obsoletas en primavera. Un hilo de Reddit. La publicación de blog de alguien. Cada candidato quiere el grep, el olfateo de commits, la verificación de alcance, la pestaña de issues para ver si alguien ya encontró el bug que te preocupa. Cada uno es una nueva pila de pestañas.
Intenté contabilizarlo una vez. Necesitaba un skill decente para una integración MCP. Encontrar los candidatos, abrir cada repositorio, leer las partes sospechosas, revisar los issues, averiguar cuál fork estaba activo y cuál abandonado. Conté alrededor de nueve horas en dos días. Para un solo slot en mi cadena de herramientas.
Y la respuesta se vuelve obsoleta. El skill que elegí era sólido en mayo. ¿Lo sigue siendo? No tengo idea, y nada me lo dice. Las estrellas son un voto de popularidad congelado en el pasado. Los conteos de descargas no saben si la cosa se rompió el martes pasado cuando la API upstream cambió la forma de su respuesta. No hay ninguna señal en ningún lugar de "este empezó a fallar esta semana." Así que haré toda la auditoría de nuevo el próximo trimestre, desde cero.
Cada constructor con quien he hablado sobre esto describe la misma rutina. Ábrelo, hazle grep, entrecierra los ojos ante los commits, espera lo mejor. Solo. Las notas de nadie pasan a nadie más. Cada uno redescubre en privado, un viernes desperdiciado a la vez, que el mismo skill popular silenciosamente se traga sus errores.
La conclusión
La lista funciona. Manejo de errores. Condiciones de parada. Validación de inputs. La verdad en el historial de commits. Radio de explosión. Ejecuta esos y esquivarás la mayoría del desastre. Pégalos encima de tu monitor si quieres.
Pero ejecútalos durante unos meses y el problema real emerge. Buscar no es la parte costosa. La cacería sí lo es, y el hecho de que lo haces solo, cada vez, contra una lista que nadie mantiene actualizada.
Un skill que parece listo para producción y uno que lo es están separados por unos diez minutos de lectura. El problema es que casi nadie tiene diez minutos limpios y un lugar confiable desde donde empezar.
Verifica el radio de explosión primero. Es la pregunta más barata, y es la que me ha salvado cuando ninguna otra lo hizo.
