Ciência da computação
Pesquisa em ciência da computação, avaliada por pares
Nenhum campo publica mais de sua evidência em forma executável. Esta página descreve como essa evidência será lida aqui, e a rubrica que a coorte fundadora vai afiar antes de alguém ser pontuado.
O que conta como evidência de competência em ciência da computação
Ciência da computação é o campo em que o artefato pode ser executado. Código que reproduz a tabela do artigo, benchmarks com baselines honestas, uma ablação que mostra qual componente de fato carrega o ganho — são alegações checáveis, e o campo já normalizou checá-las por meio das trilhas de avaliação de artefatos em suas principais conferências.
Fora dos artigos, a manutenção sustentada de código aberto é um artefato de pesquisa por direito próprio: decisões de design defendidas em público, alegações de desempenho testadas por estranhos, regressões assumidas. O mesmo vale para um sistema em produção cujas notas de design explicam o que foi trocado e por quê. Ambos são evidência avaliável, e nenhum aparece em contagens de citações.
A competência mais difícil de fingir é a seleção de problemas: trabalho mirado numa pergunta real, não moldado para caber num benchmark existente. Os avaliadores vão ler em busca disso explicitamente — é onde pesquisadores fortes se separam de escritores de artigos fortes.
Teoria e sistemas conquistam sua evidência de formas diferentes — uma prova, um artefato medido —, mas ambos deixam trilhas públicas: relatórios técnicos, teses, palestras cujos slides mostram os casos de falha além das vitórias. Trabalho de revisão também conta. Serviço em comitês de programa, revisões de avaliação de artefatos e tentativas públicas de reprodução são amostras diretas do julgamento que esta comunidade foi construída para medir, e são legíveis por qualquer pessoa.
A rubrica de avaliação de ciência da computação, primeiro rascunho
A ciência da computação já roda avaliação de artefatos para artigos individuais; esta rubrica estende o hábito do artefato para o pesquisador por trás dele.
- Honestidade de baselines
- As comparações usam baselines fortes e ajustadas, e as relatam com justiça. Uma vitória sobre um espantalho é pontuada como o que é.
- Disciplina de ablação
- O trabalho isola qual componente produz a melhoria alegada, e ablações negativas ou neutras são relatadas, não aparadas.
- Qualidade do artefato
- O código roda, o ambiente está especificado e o resultado principal se reproduz dentro da tolerância declarada a partir do que foi liberado.
- Enquadramento do problema
- A pergunta importa além do benchmark que a mede, e seu enquadramento não contrabandeia a conclusão.
Os avaliadores fundadores de ciência da computação vão rodar este rascunho contra repositórios públicos e artefatos liberados antes de usá-lo para valer.
O que os avaliadores fundadores de ciência da computação farão
Quebrar a rubrica primeiro nos casos difíceis: um artigo de sistemas sem benchmark, uma contribuição teórica sem artefato, um lançamento de modelo com pesos mas sem código de treinamento.
Rodar rodadas de calibração em artefatos públicos — repositórios, artigos com código liberado, alegações de benchmark —, pontuando de forma independente e estudando as divergências.
Estabelecer os registros de calibração que vão ponderar avaliações de ciência da computação quando a plataforma abrir, para que acurácia ganhe influência antes de reputação.
Para quem é
A coorte precisa de cientistas da computação que rodam o código antes de citar o artigo:
- Pesquisadores e engenheiros que reproduzem resultados antes de acreditar neles.
- Mantenedores de código aberto cujo julgamento de revisão foi afiado por anos de pull requests.
- Pesquisadores da indústria cujo trabalho mais forte é entregue como sistemas e relatórios internos, não artigos.
- Doutorandos e pós-docs que serviram em comitês de avaliação de artefatos e querem que o hábito importe mais amplamente.
Para quem não é
O outro lado do filtro, dito com clareza:
- Quem busca um selo para os próprios repositórios — a avaliação aqui lê o trabalho dos outros.
- Caçadores de leaderboard; a rubrica foi desenhada para precificar com exatidão trabalho moldado a benchmark, o que corta dos dois lados.
- Quem prefere sua acurácia de avaliação sem rastreio — calibração visível é o mecanismo central.
- Quem precisa de uma plataforma no ar neste trimestre, e não de um padrão construído corretamente primeiro.
Candidate-se para avaliar ciência da computação
Ciência da computação vem pré-selecionada na candidatura. Aponte um repositório, um perfil ORCID ou Scholar, ou um artefato publicado.