IA física

Investigación en IA encarnada, evaluada al salir del simulador

Cómo se manifiesta la habilidad investigadora cuando una política aprendida tiene que correr sobre hardware que se rompe, y el estándar al que la someterá la primera cohorte. Todo lo que sigue es un borrador público, a propósito.

Qué cuenta como evidencia de habilidad en investigación en IA física

El problema que define al campo es que sus cifras de titular salen baratas. Inflar una tasa de éxito en simulación no cuesta nada — cambiar la distribución de reinicios, ajustar la recompensa, reportar la mejor semilla — y esa misma política sobre hardware real puede no alcanzar ni la décima parte. La evidencia de habilidad investigadora es, por tanto, evidencia sobre la transferencia: qué hizo la política en el sistema físico, en cuántos ensayos, y bajo condiciones que el autor no eligió de antemano.

El número de ensayos y las taxonomías de fallo llevan más señal que las puntuaciones de benchmark. Veinte episodios en robot real con cada fallo clasificado le dicen más a un evaluador que una entrada de ranking sin ninguno, porque la clasificación es donde vive el juicio: si un fallo fue de percepción, de control, de calibración o mecánico es una afirmación que el autor tuvo que ganarse.

La reproducibilidad en esta disciplina es inusualmente difícil e inusualmente informativa. El hardware deriva, la calibración envejece, y una política que funciona en un brazo puede no funcionar en su gemelo. Los investigadores que reportan resultados entre plataformas o entre sesiones — incluidos los que se degradaron — le dan al evaluador justo el artefacto que los incentivos del campo desalientan.

La habilidad más difícil de ver es la contabilidad honesta de seguridad y reinicios. Intervenciones por hora, reinicios excluidos de las cifras, episodios cortados porque algo estaba a punto de romperse: son los detalles que separan una demostración de un resultado, y casi nunca están en el resumen.

La rúbrica de evaluación de IA física, primer borrador

Esta rúbrica lee el trabajo encarnado como un replicador escéptico ve un vídeo de demostración: por lo que ocurrió fuera de cámara, y por cuánto de la afirmación sobrevive al salir del laboratorio donde se hizo.

Contabilidad sim-a-real
Los resultados simulados y los físicos se reportan por separado y de forma comparable, y la brecha de transferencia se enuncia como hallazgo en vez de suavizarse. La aleatorización y el ajuste aplicados para cerrarla se declaran.
Integridad del protocolo de ensayo
Se reportan el número de ensayos, las semillas, los procedimientos de reinicio, las intervenciones humanas y los episodios excluidos. Las condiciones se fijan antes de evaluar y no se seleccionan después, y en cualquier caso se declara la regla de selección.
Caracterización del fallo
Los fallos se clasifican por subsistema y mecanismo en lugar de contarse, y se aporta la evidencia que separa los fallos de percepción de los de control, calibración o hardware.
Generalización entre encarnaciones
Las afirmaciones se acotan a las plataformas y condiciones realmente probadas. La transferencia entre robots, sesiones o entornos se demuestra en lugar de afirmarse, y la degradación se reporta donde la hubo.

Los primeros evaluadores de IA física atacarán este borrador primero — incluso contra sus propias demostraciones y entradas de benchmark.

Qué harán los primeros evaluadores de IA física

Desmontar la rúbrica: dónde penaliza trabajo que legítimamente no puede llegar al hardware, dónde da crédito de más a flotas de robots costosas, dónde una dimensión no puede puntuarse solo con un artículo y un vídeo.

Ejecutar rondas de calibración sobre trabajo público — entradas de benchmarks abiertos, políticas y conjuntos de datos liberados, intentos de reproducción, demostraciones en congresos — puntuando de forma independiente y comparando dispersiones, para que las primeras notas publicadas lleguen con incertidumbre conocida y no con la confianza habitual del campo.

Establecer qué debe reportar una afirmación creíble sobre robot real, y publicarlo como un estándar al que la comunidad pueda someter las entradas — incluidas las propias.

Para quién es esto

La primera cohorte busca investigadores cuyos sistemas tengan que sobrevivir al contacto con el mundo, dondequiera que trabajen:

  • Investigadores de aprendizaje robótico que reportan resultados en hardware real y quieren que se juzgue el reporte en sí.
  • Ingenieros de control y percepción cuyo trabajo de despliegue nunca llega a ser un artículo.
  • Responsables de reproducciones y de benchmarks que ya han intentado reejecutar las afirmaciones de otros.
  • Practicantes de IA encarnada en la industria cuya evidencia son datos de flota y no un puesto en un ranking.

Para quién no es

La autoselección importa más que cualquier filtro que pudiéramos escribir, así que la versión honesta:

  • Quien busque una credencial por sí misma — la etapa inicial produce estándares, no insignias.
  • Quien apoye su evidencia en un vídeo de demostración sin protocolo detrás; esta rúbrica está hecha para preguntar qué omite el vídeo.
  • Quien se incomode con el registro de su precisión de evaluación — el registro de calibración es el punto del diseño.
  • Quien necesite una plataforma de puntuación viva hoy; la mecánica de esta página está en diseño, y el tiempo verbal es deliberado.

Postúlate para evaluar IA física

IA física viene preseleccionada en la solicitud. Enlaza trabajo que podamos leer — una evaluación en robot real, una política o conjunto de datos liberado, un informe de reproducción, un perfil ORCID o repositorio.

VocaidDeep