🛰️ Daily AI Frontier
‹ back to 2026-09-10

Are You Learning Biological Signal or Shortcuts? Auditing and Mitigating Bias in Protein-Protein Interaction Datasets

Research Bioinformatics AI

Ranking

Overall 85
Content 95
Popularity 61

Observed public metrics from 1 member.

Representative image for Are You Learning Biological Signal or Shortcuts? Auditing and Mitigating Bias in Protein-Protein Interaction Datasets

Merged summary

TL;DR - This study systematically audits shortcut learning in protein-protein interaction datasets and finds that common splitting and negative-sampling practices can expose non-biological signals. It introduces an open Nextflow pipeline that uses optimization-based methods to reduce these biases.

  • Random train-test splits create strong shortcuts from interaction-network topology.
  • Even without train-test protein overlap, models can exploit self-interactions, taxonomy, and functional relatedness, with bias prevalence varying by data source.
  • Sampling negatives from high-confidence non-interactors can unintentionally amplify functional-relatedness shortcuts.
  • The pipeline combines similarity-aware, data-preserving splits with bias-minimizing negative sampling, both formulated as integer linear programs.

Sources (1)

Are You Learning Biological Signal or Shortcuts? Auditing and Mitigating Bias in Protein-Protein Interaction Datasets

arXiv q-bio.MN Judith Bernett, Anton Spannagl, Joel Ă…s, Markus List, David B. Blumenthal 2026-09-09 arXiv:2609.10193
Public signals Semantic Scholar citations 1 · Semantic Scholar influential citations 0
Providers: Hugging Face · N/A OpenAlex · N/A Publisher · N/A Semantic Scholar · Citations 1 · Influential citations 0 X · N/A Fetched 2026-09-19 14:15:29.202958 UTC

TL;DR - This study systematically audits shortcut learning in protein-protein interaction datasets and finds that common splitting and negative-sampling practices can expose non-biological signals. It introduces an open Nextflow pipeline that uses optimization-based methods to reduce these biases.

  • Random train-test splits create strong shortcuts from interaction-network topology.
  • Even without train-test protein overlap, models can exploit self-interactions, taxonomy, and functional relatedness, with bias prevalence varying by data source.
  • Sampling negatives from high-confidence non-interactors can unintentionally amplify functional-relatedness shortcuts.
  • The pipeline combines similarity-aware, data-preserving splits with bias-minimizing negative sampling, both formulated as integer linear programs.
item →