Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character AttacksResearchSep 25, 2026
CinematicVQA: Benchmarking Film-Grammar Reasoning in Large Vision-Language ModelsResearchSep 25, 2026
When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability RoutingResearchSep 25, 2026
RQ-Reg: A Residual-Quantization-Based Framework for Continuous Value Prediction in Recommender SystemsResearchSep 25, 2026
DrGait: Biomechanically Grounded Visual Reasoning for Interpretable Clinical Gait AnalysisResearchSep 25, 2026