Inicio/Vida Digital/Evaluador de prompts de IA: trabajo remoto para entrenar modelos
#TrabajoRemoto

Evaluador de prompts de IA: trabajo remoto para entrenar modelos

Trabajo remoto para entrenar IA: qué es evaluar prompts y respuestas de modelos de lenguaje (LLM), en qué se diferencia de ser rater tradicional, qué empresas contratan y cómo detectar estafas.

6 min de lectura

🤖

Desde que ChatGPT se volvió una palabra de uso cotidiano, apareció una categoría entera de trabajos remotos que hace apenas unos años directamente no existía: evaluar prompts y respuestas de modelos de inteligencia artificial. No es lo mismo que el trabajo de rater clásico que evalúa búsquedas o anuncios desde hace más de una década; acá el objetivo es específico y muy actual: ayudar a que los modelos de lenguaje (LLM, por sus siglas en inglés) entiendan mejor el español, respondan de forma más segura y sean más útiles.

A mí me llamó la atención porque combina algo que me gusta —analizar texto con criterio— con estar en la primera fila de una industria que está cambiando todo. Y a diferencia de otros trabajos remotos que piden años de experiencia, este te pide sobre todo criterio, atención al detalle y buen manejo del idioma.

Quiero separar bien esto de la nota anterior sobre ser rater, porque aunque se parecen, no son exactamente lo mismo, y conviene que entiendas la diferencia antes de postularte a cualquier lado.

Mi experiencia

La diferencia principal que noté al meterme en este tipo de tareas es el nivel de razonamiento que piden. En el rating clásico (evaluar si un resultado de búsqueda o un anuncio es relevante) el criterio es bastante binario. Acá, en cambio, te piden comparar dos respuestas de un modelo y decidir cuál es más útil, más precisa, más segura o suena más natural en español — y muchas veces tenés que justificar por qué, con un breve comentario escrito.

Este tipo de trabajo lo conocí más de cerca con SuperAnnotate, en 2024, evaluando y ayudando a mejorar directamente la respuesta a los prompts. Lo que más me sorprendió fueron los prompts en sí mismos: tareas que me mostraron el nivel de detalle real con el que hoy hay que hablarle a una IA para que responda bien.

Ahí aprendí, en el fondo, que evaluar estos modelos es entender cómo tiene que responder el sistema para que a nosotros, como usuarios, nos sirva de verdad lo que nos ofrece — no alcanza con que la respuesta suene bien, tiene que ser útil.

También hay proyectos que piden directamente escribir o romper prompts: intentar que el modelo responda algo que no debería (para detectar fallas de seguridad), o generar ejemplos de conversaciones típicas en español rioplatense para que el modelo aprenda a reconocer nuestra forma de hablar. Es un trabajo que exige mucha más reflexión que simplemente marcar una casilla, y eso también hace que sea un poco más lento por tarea. Al principio cada tarea me llevaba entre 10 y 15 minutos; con la práctica bajé el promedio a unos 8-9 minutos. Buena parte de ese tiempo se va en revisar la información de base, porque muchas tareas tocan temas de los que no tenés por qué saber de entrada —un momento puntual de la historia, código de programación, datos actuales de política exterior— así que primero hay que confirmar que la información sea correcta antes de evaluar nada. El proceso en sí suele tener 3-4 pasos: detectar si la información es correcta (y corregirla si no), validar la estructura de la respuesta, evaluar si se podría construir de otra manera, y confirmar que sea realmente útil para quien pregunta antes de entregar la tarea.

Información práctica

Habilidades que realmente te sirven para este trabajo:

  • Buen nivel de comprensión lectora y de escritura en español (y valorás mucho si además dominás inglés, porque muchas instrucciones y materiales de entrenamiento están en ese idioma).
  • Capacidad de seguir guías de evaluación (rubrics) largas y detalladas sin perder la paciencia — esto es más importante de lo que parece.
  • Pensamiento crítico: no alcanza con decir esto está bien o esto está mal, casi siempre hay que explicar el porqué.
  • Conocimientos generales o de algún área específica (salud, legal, código, matemáticas) suman puntos en proyectos especializados, que suelen pagar mejor que los proyectos generales.

Dónde buscar: las mismas empresas mencionadas en la nota sobre raters (Welocalize, TELUS Digital, RWS, DataForce, OneForma, Micro1, SuperAnnotate) tienen líneas de proyectos específicas de AI data o LLM evaluation. También conviene buscar directamente términos como AI trainer, prompt evaluator o response quality rater en LinkedIn y en los sitios de estas empresas.

Red flags para detectar estafas en este rubro:

  • Te piden pagar por el curso o el material antes de empezar a trabajar.
  • Te contactan por WhatsApp o Telegram de la nada, ofreciéndote una posición sin proceso de selección.
  • Te prometen un ingreso fijo altísimo por poco trabajo, sin mencionar la empresa real para la que estarías trabajando.
  • No podés encontrar información pública sobre la empresa fuera del mensaje que te llegó.

Regla simple: cualquier empresa seria te va a hacer pasar por un proceso de aplicación en su sitio oficial y jamás te va a cobrar por darte trabajo.

Lo bueno

Es un tipo de trabajo remoto intelectualmente más entretenido que el rating tradicional, porque te obliga a pensar y justificar tus decisiones. Suele pagar algo mejor que las tareas de evaluación más básicas, especialmente en proyectos especializados. Y es una manera concreta de entender cómo se entrena la IA desde adentro, lo cual hoy es una habilidad que cada vez más empresas valoran, incluso fuera de este rubro.

Lo difícil

Las guías de evaluación (rubrics) pueden ser largas y confusas al principio, y equivocarte en tareas de calificación puede dejarte afuera del proyecto. El ritmo de trabajo disponible depende completamente de qué proyectos tenga activos la empresa en ese momento, así que no es un ingreso 100% predecible.

Y como está de moda, es también el rubro con más intentos de estafa disfrazados de trabajá para entrenar IA desde tu casa, así que hay que filtrar bien antes de entusiasmarse con cualquier oferta.

Mi recomendación honesta

Si te gusta leer, analizar y tenés paciencia para seguir instrucciones detalladas, este tipo de trabajo puede ser un buen complemento de ingresos mientras armás algo más grande. Mi consejo es que empieces por las empresas conocidas y verificables, que tomes en serio los exámenes de calificación (ahí se juega si vas a tener acceso a proyectos mejor pagos), y que no le creas a nadie que te contacta ofreciéndote trabajo de IA sin pasar por un proceso formal.

Preguntas frecuentes

Recursos y enlaces mencionados

Algunos de estos enlaces son de afiliado: si te registrás o comprás a través de ellos, no pagás más y me ayudás a mantener este blog.

Si te interesa construir una carrera remota más sólida además de estas tareas puntuales, en EspecialistaDigital te acompañamos paso a paso.

Conocé EspecialistaDigital →

Seguí leyendo