MAD-Guard: Controlled Study of Autoregressive Generation versus Direct Decision Interfaces for Closed Multimodal Forensic Tasks
MAD-Guard shows direct decision heads outperform autoregressive decoding for closed multimodal forgery forensics.
MAD-Guard compares autoregressive generation with direct decision heads for closed multimodal forensic tasks on a matched Qwen3-VL-8B backbone, using 2,400 FakeClue samples and LoRA on Huawei Ascend 910C NPUs. A binary direct head reduces latency by 2.60x-7.27x to 53.12 ms and cuts expected calibration error from 0.0845 to 0.0450, with accuracy 93.10% versus 94.90% for AR-SFT. CLM-Head reaches 96.55% binary accuracy and 98.79% seven-class attribution. On 5,000 out-of-sample images it scores 96.44% on GenImage and 97.73% on Chameleon, but FF++ compressed-face ROC-AUC is only 0.5913.