SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification
Summary
SLAPBench, the first benchmark for multimodal large language models (MLLMs) in four-finger SLAP fingerprint verification, has been introduced. Built from NIST SD302b with 7,832 pairs (176 mated, 7,656 non-mated), it evaluates models like InternVL3-8B, Qwen2.5-VL-7B, Qwen3-VL-8B, Gemma-3-12B, and the proprietary Claude Opus 4.8. The benchmark uses zero-shot, task-description, and similarity-scoring prompts. Task-description prompting caused near-100% False Accept Rates for open-source models, while Claude Opus 4.8 resisted collapse, achieving a 20.2% FAR. Similarity scoring prevented collapse, revealing Claude Opus 4.8's AUC of 0.953 and Gemma-3-12B's 0.837. Qwen3-VL-8B achieved a perfect AUC of 1.000, attributed to near-duplicate detection rather than true capability. A fairness probe indicated disparity increases as discrimination weakens.
Key takeaway
For machine learning engineers evaluating MLLMs for biometric verification, your prompting strategy is paramount. Binary prompts can lead to model collapse, so prioritize similarity scoring to accurately assess discrimination capabilities. Be critical of models achieving perfect scores, as this may indicate data artifacts like near-duplicate detection. Always include a fairness probe to identify and mitigate demographic disparities in your MLLM applications.
Key insights
Prompting significantly influences MLLM performance in SLAP fingerprint verification, revealing varied model capabilities and potential data shortcuts.
Principles
- Prompting method dictates MLLM verification behavior.
- Model capability governs discrimination in MLLM verification.
- Fairness disparities grow with weaker discrimination.
Method
SLAPBench evaluates MLLMs for four-finger SLAP fingerprint verification using NIST SD302b, testing zero-shot, task-description, and similarity-scoring prompts to assess collapse and discrimination.
In practice
- Use similarity scoring for robust MLLM fingerprint verification.
- Scrutinize perfect AUC scores for data shortcuts.
- Probe MLLM fairness for demographic disparities.
Topics
- SLAP Fingerprints
- Multimodal LLMs
- Fingerprint Verification
- Benchmarking
- Prompt Engineering
- Model Fairness
- NIST SD302b
Best for: Computer Vision Engineer, Research Scientist, AI Scientist, Machine Learning Engineer, AI Security Engineer
Related on AIssential
See Counsel's argued verdicts on the open AI decisions leaders are weighing →
Editorial summary, takeaway, and curation by AIssential. Original article published by Computer Vision and Pattern Recognition.