Researchers examined how model design, settings and training-data quality affect an AI system’s ability to identify software vulnerabilities in unfamiliar codebases. They created VulGate, a dataset that removes mislabeled and duplicate examples, adds newer vulnerabilities and metadata, includes difficult examples, and provides dedicated test sets.

In experiments comparing several AI model designs, encoder-based models performed better in accuracy and generalization than decoder-based models. The researchers’ model reported a 6.8% improvement in recall on BigVul and performed better than other models on unseen projects.