Ciencias de la computación

Investigación en ciencias de la computación, evaluada por pares

Ningún campo publica más de su evidencia en forma ejecutable. Esta página describe cómo se leerá aquí esa evidencia, y la rúbrica que la cohorte fundadora afilará antes de que se puntúe a nadie.

Qué cuenta como evidencia de competencia en ciencias de la computación

Las ciencias de la computación son el único campo donde el artefacto puede ejecutarse. Código que reproduce la tabla del artículo, benchmarks con líneas de base honestas, una ablación que muestra qué componente sostiene realmente la mejora — son afirmaciones comprobables, y el campo ya normalizó comprobarlas mediante las vías de evaluación de artefactos de sus principales conferencias.

Fuera de los artículos, el mantenimiento sostenido de código abierto es un artefacto de investigación por derecho propio: decisiones de diseño defendidas en público, afirmaciones de rendimiento puestas a prueba por extraños, regresiones asumidas. También lo es un sistema en producción cuyas notas de diseño explican qué se sacrificó y por qué. Ambos son evidencia evaluable, y ninguno aparece en los recuentos de citas.

La destreza más difícil de fingir es la selección de problemas: trabajo dirigido a una pregunta real y no moldeado para encajar en un benchmark existente. Los evaluadores leerán buscándola explícitamente — es donde los investigadores fuertes se separan de los buenos escritores de artículos.

La teoría y los sistemas ganan su evidencia de maneras distintas — una demostración, un artefacto medido —, pero ambos dejan rastros públicos: informes técnicos, tesis, charlas cuyas diapositivas muestran los casos de falla además de las victorias. El trabajo de revisión también cuenta. El servicio en comités de programa, las revisiones de evaluación de artefactos y los intentos públicos de reproducción son muestras directas del juicio que esta comunidad se construyó para medir, y cualquiera puede leerlas.

La rúbrica de evaluación de ciencias de la computación, primer borrador

Las ciencias de la computación ya practican la evaluación de artefactos para artículos individuales; esta rúbrica extiende el hábito del artefacto al investigador detrás de él.

Honestidad de las líneas de base
Las comparaciones usan líneas de base fuertes y ajustadas, y las informan con justicia. Una victoria sobre un espantapájaros se puntúa como lo que es.
Disciplina de ablación
El trabajo aísla qué componente produce la mejora que se afirma, y las ablaciones negativas o neutras se informan en lugar de recortarse.
Calidad del artefacto
El código corre, el entorno está especificado y el resultado principal se reproduce dentro de la tolerancia declarada a partir de lo publicado.
Encuadre del problema
La pregunta importa más allá del benchmark que la mide, y su encuadre no contrabandea la conclusión.

Los evaluadores fundadores en ciencias de la computación correrán este borrador contra repositorios públicos y artefactos publicados antes de usarlo en serio.

Qué harán los evaluadores fundadores de ciencias de la computación

Romper primero la rúbrica con los casos difíciles: un artículo de sistemas sin benchmark, una contribución teórica sin artefacto, un lanzamiento de modelo con pesos pero sin código de entrenamiento.

Correr rondas de calibración con artefactos públicos — repositorios, artículos con código publicado, afirmaciones de benchmark —, puntuando de forma independiente y estudiando los desacuerdos.

Establecer los registros de calibración que ponderarán las evaluaciones de ciencias de la computación cuando la plataforma se abra, para que la exactitud gane influencia antes que la reputación.

Para quién es

La cohorte necesita científicos de la computación que corren el código antes de citar el artículo:

  • Investigadores e ingenieros que reproducen los resultados antes de creerlos.
  • Mantenedores de código abierto cuyo juicio de revisión se afiló con años de pull requests.
  • Investigadores de la industria cuyo trabajo más fuerte se entrega como sistemas e informes internos y no como artículos.
  • Estudiantes de doctorado y postdocs que han servido en comités de evaluación de artefactos y quieren que el hábito importe más ampliamente.

Para quién no es

El otro lado del filtro, dicho con claridad:

  • Quien busca una insignia para sus propios repositorios — la evaluación aquí lee el trabajo de otros.
  • Cazadores de leaderboards; la rúbrica está diseñada para tasar con exactitud el trabajo moldeado al benchmark, y eso corta en ambos sentidos.
  • Quien prefiere que su exactitud de evaluación no quede registrada — la calibración visible es el mecanismo central.
  • Quien necesita una plataforma en vivo este trimestre y no un estándar construido correctamente primero.

Postúlate para evaluar ciencias de la computación

Ciencias de la computación viene preseleccionada en la postulación. Enlaza un repositorio, un perfil de ORCID o Scholar, o un artefacto publicado.

VocaidDeep