From causal plausibility to causal reliability: evaluating LLMs as calibrated direct causal-edge classifiers
Read the original at arxiv.org→arXiv:2608.23660v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used to provide prior causal knowledge for structural causal discovery, yet whether their direct-edge judgments and...
Original headline: "From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers"
Coverage timeline
- Aug 26, 04:00 UTC arXiv cs.LG lead source From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers