1. Inicio
  2. Trabajos
  3. Ingeniero de Evaluación de IA (Python, QA o Seguridad)

Por favor, envíe su CV en inglés e indique su nivel de dominio del inglés.

Mindrift conecta especialistas con oportunidades de IA basadas en proyectos para empresas tecnológicas líderes, centradas en probar, evaluar y mejorar sistemas de IA. La participación es por proyecto, no es un empleo permanente.

Lo que implica esta oportunidad Estamos creando un conjunto de datos para evaluar agentes de codificación de IA: qué tan bien un modelo maneja tareas de desarrollador del mundo real.

Crearás tareas desafiantes y criterios de evaluación dentro de entornos simulados realistas:

  • Construir entornos de desarrollador realistas: una empresa virtual con base de código, infraestructura y contexto (tickets, documentos, conversaciones) que forman un historial de desarrollo creíble
  • Diseñar tareas a partir de estados intermedios de estos entornos: elaborar el prompt, definir qué significa "resuelto" y asegurar que la tarea sea resoluble por un agente de IA
  • Escribir pruebas que verifiquen las soluciones del agente: aceptar todos los enfoques válidos y rechazar los incorrectos, ni demasiado estrictos ni demasiado indulgentes
  • Iterar sobre tareas y pruebas basándose en comentarios de QA: revisar las soluciones del agente, analizar fallos y refinar hasta que la evaluación sea justa y robusta

Lo que NO es

  • No es etiquetado de datos
  • No es ingeniería de prompts
  • No es escribir código desde cero: el agente escribe la mayor parte del código; tú guías y evalúas

Lo que buscamos

  • Más de 5 años en desarrollo de software
  • Pila principal: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis
  • Experiencia en la escritura de pruebas (funcionales, de integración)
  • Dominio del inglés: B2+

Por qué es difícil

Los modelos de vanguardia ya son buenos codificando. Crear una tarea que realmente desafíe a los mejores modelos no es trivial. Necesitas comprender profundamente dónde fallan los modelos y qué escenarios revelan la diferencia entre una solución buena y una mala. Las tareas tienen muchas soluciones válidas: escribir pruebas que acepten todas las soluciones correctas y rechacen las incorrectas es más difícil de lo que parece.

Cómo funciona

Postula → Supera la(s) cualificación(es) → Únete a un proyecto → Completa tareas → Recibe el pago

Compensación

Hasta el equivalente a $40/hora, dependiendo del nivel y el ritmo. Las tareas se estiman en ~20 horas cada una; tú estableces tu propio horario.

Publicado originalmente en Himalayas

Salario

40 - 40 Mensual

Mensual

Trabajo Remoto

En Todo el Mundo

Termómetro Salarial

Basado en 11 posiciones similares en Uruguay

100 6,500
Bajo Prom: USD 2,129 Alto
Por debajo del promedio de mercado

Promedio por skill:

Prompt Engineering USD 2,795 (5)
python USD 1,463 (6)

Estimaciones salariales basadas en posiciones similares en nuestra plataforma. Los salarios reales pueden variar.

Resumen del Trabajo
Trabajo Publicado:
hace 9 horas
Expiración del Trabajo:
en 1 mes
Tipo de Trabajo
Por contrato
Rol del Trabajo
QA / Tester
Educación
Licenciatura
Experiencia
1 año
Total de Vacantes
1
Profesión
Desarrollador de software

Compartir este empleo:

Ubicación

Uruguay


EmpleosTech
Obtené la app de EmpleosTech Acceso rápido a empleos tech, notificaciones y soporte offline