Ocho ejemplos incluidos en el vídeo del 24 de septiembre de Matthew Berman muestran el modelo Jev de TypeSafe AI en tareas conocidas: limpiar una página web, encontrar un pasaje, ordenar el correo y seleccionar elementos de una interfaz. Las demostraciones son de distintos creadores. Todas asignan al modelo una decisión acotada, mientras la aplicación reúne los datos de entrada y ejecuta el resultado.

Cada clip informa más cuando se distingue la decisión del trabajo que hace el código u otro modelo. El posible error que notaría el usuario importa tanto como la llamada al modelo. Son demostraciones y herramientas iniciales; BIG CHANGE no ha probado de forma independiente su precisión ni su fiabilidad cotidiana.

El gran cambio

  • Qué ha cambiado: Los desarrolladores incorporan decisiones tipadas de IA a interacciones existentes, desde un atajo del navegador hasta una bandeja de entrada. Jev devuelve una opción, puntuación o probabilidad; la aplicación aporta los candidatos y actúa según la respuesta.
  • Por qué importa: La decisión puede tomarse al leer, buscar u ordenar, sin trasladar toda la tarea a un chat. Este diseño también responsabiliza a la aplicación de clasificaciones erróneas, contenido oculto y acciones involuntarias.
  • Qué conviene observar: La evidencia debe ser específica para cada tarea: si la herramienta elige el pasaje correcto, conserva controles esenciales, prioriza bien el correo y gestiona casos inciertos en el uso habitual. Una demostración rápida no basta para resolverlo.

Un limpiador de páginas muestra el reparto del trabajo

La extensión de navegador Unclutter de Kitze es el ejemplo más claro. Su README del proyecto explica que la extensión extrae elementos candidatos y pregunta a Jev cuáles son prescindibles. El código del navegador aplica reglas reversibles para ocultarlos, las guarda por plantilla y las vuelve a aplicar sin otra consulta al modelo. El usuario puede pausar la extensión, mantener un elemento visible o volver a analizar la página. Puede ocultar avisos de cookies, pero no pulsa «Aceptar» ni «Rechazar» por el usuario.

Ese límite tiene consecuencias. Jev puede juzgar que algo es ruido visual; no controla el navegador, no elige el consentimiento ni decide cuánto dura una regla. Una evaluación práctica comprobaría si tras la limpieza siguen disponibles la navegación, los controles de accesibilidad, los avisos de pago y las opciones legítimas de consentimiento. El proyecto ofrece compilaciones del código y configuración con clave propia; su README no presenta un estudio independiente de esos errores en uso real.

El detector web Made with Jev, que aparece en el minuto 3:29 del vídeo de Berman, sigue otro proceso. Según su método, el navegador mide los estilos renderizados; DeepSeek V4 Flash describe capturas de pantalla; Jev evalúa diseño y texto frente a una lista de señales, y DeepSeek redacta el veredicto. El sitio da a anthropic.com una puntuación «slop» del 26 %. Es una puntuación estilística según los propios criterios de la herramienta. No demuestra qué proporción del sitio de Anthropic se escribió con IA, pese a la inferencia de Berman.

La clasificación de información es otro tipo de decisión

La demostración de bandeja de entrada de Jonathan Unikowski propone sustituir el orden cronológico inverso por una clasificación dinámica de importancia. Su publicación dice que la función «llegará» a Avec. No documenta una bandeja desplegada, la definición de importancia ni una medición independiente de mensajes urgentes omitidos. La aplicación aún recupera el correo, presenta el orden y decide si archiva, etiqueta o envía algo; Jev solo prioriza.

La extensión Needle de Shubham Saboo aclara la distinción. Saboo dice que Jev puntúa pasajes según la consulta y la extensión resalta el texto coincidente. Su explicación más extensa dice que Needle no redacta una respuesta: la frase ya está en la página. Una búsqueda rápida puede encontrarla, pero aun así puede ser la incorrecta. Las pruebas necesitan consultas con pasajes correctos conocidos, incluso páginas con afirmaciones similares y contradictorias.

La publicación de recortes de vídeo de Burhan Usman cuenta que encontró fragmentos temáticos en un vídeo de más de 90 minutos. En el fragmento del vídeo en el minuto 8:34, Berman cree que el sistema probablemente usa una transcripción; es una inferencia suya, no una descripción verificada del proceso. La publicación no precisa las entradas ni salidas de Jev. La aplicación aún debe obtener el material original, establecer los límites temporales y producir clips descargables. El tiempo y el coste son el relato de un creador, sin una prueba de precisión ni un desglose del proceso completo.

Qué deja en manos de la aplicación la composición de interfaces

El experimento json-render de Chris Tate compone una interfaz con opciones de la aplicación. La documentación del proyecto sobre Jev lo explica: Jev elige componentes y posiciones; el código compone y valida la especificación, y el renderizador la muestra. Los datos del entorno de pruebas son sintéticos y los controladores se ejecutan cuando interactúa el usuario. La demostración enseña cómo componer una interfaz acotada, no cómo un modelo crea y despliega un sitio web por su cuenta.

Los dos ejemplos creativos exploran decisiones de menor riesgo. El experimento de color de Matt DesLauriers convierte texto en paletas en una demostración visual. El experimento con emojis de Stefan, mostrado en el minuto 9:52, clasifica emojis a partir de texto. En ambos casos, una aplicación muestra opciones visuales. Son ideas de interacción, no pruebas de idoneidad para una marca, cumplimiento de contraste o funcionamiento en distintos idiomas y contextos.

La documentación de TypeSafe explica el parecido entre los ejemplos. Jev evalúa preguntas tipadas de tipo Choice, Score y sí/no con el estado proporcionado. Choice y Score devuelven distribuciones y un valor de confianza que el software puede usar en sus reglas. La empresa recomienda probar los umbrales en la tarea concreta; un campo de confianza no es una medición independiente de precisión.

Los ejemplos respaldan un patrón de diseño: el software puede plantear una pregunta oportuna cuando una regla fija es demasiado rígida. La utilidad diaria de cada herramienta depende de los errores, de lo que muestra u oculta y de si la aplicación permite recuperarse. Son propiedades de todo el flujo de trabajo, no solo de la decisión del modelo.