Ciência da computação

Pesquisa em ciência da computação, avaliada por pares

Nenhum campo publica mais de sua evidência em forma executável. Esta página descreve como essa evidência será lida aqui, e a rubrica que a coorte fundadora vai afiar antes de alguém ser pontuado.

O que conta como evidência de competência em ciência da computação

Ciência da computação é o campo em que o artefato pode ser executado. Código que reproduz a tabela do artigo, benchmarks com baselines honestas, uma ablação que mostra qual componente de fato carrega o ganho — são alegações checáveis, e o campo já normalizou checá-las por meio das trilhas de avaliação de artefatos em suas principais conferências.

Fora dos artigos, a manutenção sustentada de código aberto é um artefato de pesquisa por direito próprio: decisões de design defendidas em público, alegações de desempenho testadas por estranhos, regressões assumidas. O mesmo vale para um sistema em produção cujas notas de design explicam o que foi trocado e por quê. Ambos são evidência avaliável, e nenhum aparece em contagens de citações.

A competência mais difícil de fingir é a seleção de problemas: trabalho mirado numa pergunta real, não moldado para caber num benchmark existente. Os avaliadores vão ler em busca disso explicitamente — é onde pesquisadores fortes se separam de escritores de artigos fortes.

Teoria e sistemas conquistam sua evidência de formas diferentes — uma prova, um artefato medido —, mas ambos deixam trilhas públicas: relatórios técnicos, teses, palestras cujos slides mostram os casos de falha além das vitórias. Trabalho de revisão também conta. Serviço em comitês de programa, revisões de avaliação de artefatos e tentativas públicas de reprodução são amostras diretas do julgamento que esta comunidade foi construída para medir, e são legíveis por qualquer pessoa.

A rubrica de avaliação de ciência da computação, primeiro rascunho

A ciência da computação já roda avaliação de artefatos para artigos individuais; esta rubrica estende o hábito do artefato para o pesquisador por trás dele.

Honestidade de baselines
As comparações usam baselines fortes e ajustadas, e as relatam com justiça. Uma vitória sobre um espantalho é pontuada como o que é.
Disciplina de ablação
O trabalho isola qual componente produz a melhoria alegada, e ablações negativas ou neutras são relatadas, não aparadas.
Qualidade do artefato
O código roda, o ambiente está especificado e o resultado principal se reproduz dentro da tolerância declarada a partir do que foi liberado.
Enquadramento do problema
A pergunta importa além do benchmark que a mede, e seu enquadramento não contrabandeia a conclusão.

Os avaliadores fundadores de ciência da computação vão rodar este rascunho contra repositórios públicos e artefatos liberados antes de usá-lo para valer.

O que os avaliadores fundadores de ciência da computação farão

Quebrar a rubrica primeiro nos casos difíceis: um artigo de sistemas sem benchmark, uma contribuição teórica sem artefato, um lançamento de modelo com pesos mas sem código de treinamento.

Rodar rodadas de calibração em artefatos públicos — repositórios, artigos com código liberado, alegações de benchmark —, pontuando de forma independente e estudando as divergências.

Estabelecer os registros de calibração que vão ponderar avaliações de ciência da computação quando a plataforma abrir, para que acurácia ganhe influência antes de reputação.

Para quem é

A coorte precisa de cientistas da computação que rodam o código antes de citar o artigo:

  • Pesquisadores e engenheiros que reproduzem resultados antes de acreditar neles.
  • Mantenedores de código aberto cujo julgamento de revisão foi afiado por anos de pull requests.
  • Pesquisadores da indústria cujo trabalho mais forte é entregue como sistemas e relatórios internos, não artigos.
  • Doutorandos e pós-docs que serviram em comitês de avaliação de artefatos e querem que o hábito importe mais amplamente.

Para quem não é

O outro lado do filtro, dito com clareza:

  • Quem busca um selo para os próprios repositórios — a avaliação aqui lê o trabalho dos outros.
  • Caçadores de leaderboard; a rubrica foi desenhada para precificar com exatidão trabalho moldado a benchmark, o que corta dos dois lados.
  • Quem prefere sua acurácia de avaliação sem rastreio — calibração visível é o mecanismo central.
  • Quem precisa de uma plataforma no ar neste trimestre, e não de um padrão construído corretamente primeiro.

Candidate-se para avaliar ciência da computação

Ciência da computação vem pré-selecionada na candidatura. Aponte um repositório, um perfil ORCID ou Scholar, ou um artefato publicado.

VocaidDeep