AI & Computingarticle2026-08-08

Comparing various vision transformer architectures for lung cancer classification

Open access0 citations

Abstract

Abstract This study presents a comprehensive evaluation of vision transformer-based architectures for lung histopathology image classification using the LC25000 dataset. We systematically compare custom-trained transformer models and ImageNet-pretrained architectures, including Broad Vision Transformer, DeiT, Swin Transformer, and ConvNeXt, under a unified experimental protocol. The results demonstrate that pretrained models significantly outperform models trained from scratch, achieving up to 99.7% classification accuracy and consistently higher precision, recall, and F1-scores across all diagnostic categories. Detailed analysis reveals that transfer learning enables more robust capture of tissue-level structural patterns, particularly in distinguishing adenocarcinoma and squamous cell carcinoma. The findings highlight the importance of strong initialization for transformer-based medical imaging models and provide practical insights for selecting architectures in data-limited histopathology applications.

// Source

View paper (DOI)Open access versionOpenAlexDiscover Applied SciencesPublished 2026-08-08

Authors: Sunil Kumar, Megha Jain, Manish Rai

Institutions: Institute of Chartered Financial Analysts of India University, Jaipur, Bansal Institute Of Research Technology & Science