arXiv cs.LGOctober 2, 2026
Towards Fast and Disentangled Counterfactuals for Visual Foundation Models
Excerpt
arXiv:2610.00895v1 Announce Type: new Abstract: Foundation models remain vulnerable to spurious correlations and ``Clever Hans'' strategies. Explainable machine learning can find and remove such strategies for classifiers without metadata. For foundation models, no such option exists yet. We propose Disentangled Diffusion Autoencoders (DiDAE). DiDAE wraps a frozen foundation model in a conditional diffusion decoder. A counterfactual is one closed-form edit along a direction of a disentangled dic