ICML 2026 재밌게 본 논문들

beaver.zip·2026년 7월 13일

ICML 2026

목록 보기
2/3

1. AI Safety·Privacy·Jailbreak·Alignment

  1. MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
  2. MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
  3. Jailbreaking Vision-Language Models Through the Visual Modality
  4. Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
  5. Learning Efficient Guardrails for Compliance
  6. More Sail than Ballast: Addressing Harmful Knowledge Leakage in the Expansive Reasoning Space of LRMs
  7. Frontier Models Can Take Actions at Low Probabilities
  8. Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework
  9. Safety Alignment of LMs via Non-cooperative Games
  10. Position: LLM-Safety Evaluations Lack Robustness
  11. Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment
  12. Active Attacks: Red-teaming LLMs via Adaptive Environments
  13. Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
  14. Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
  15. When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
  16. AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs
  17. Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
  18. RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
  19. State-Dependent Safety Failures in Multi-Turn Language Model Interaction
  20. It’s a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
  21. Are Your Agents Upward Deceivers?
  22. Prompt Injection as Role Confusion
  23. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
  24. Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts
  25. Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
  26. OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
  27. Position: ‘AI Alignment’ Encompasses Competing Technical Priorities
  28. From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

2. Interpretability·Mechanistic Analysis·CoT Faithfulness

  1. Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Models
  2. Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
  3. Chain-of-Thought Reasoning in the Wild Is Not Always Faithful
  4. Interpretability Can Be Actionable
  5. Biases in the Blind Spot: Detecting What LLMs Fail to Mention
  6. Do Activation Verbalization Methods Convey Privileged Information?
  7. Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
  8. Causality is Key for Interpretability Claims to Generalise

3. Hallucination·Reliability·Calibration·Citation

  1. Reliable Thinking with Images
  2. Building Reliable Long-Form Generation via Hallucination Rejection Sampling
  3. From Out-of-Distribution Detection to Hallucination Detection: A Geometric View
  4. Guidance: Sentence-Level Citation Enforcement via Prefix-Tail Guidance during LLM Decoding
  5. Confidence is Not Universal: Task-Dependent Calibration and Emergent Behavior in LLMs
  6. Automatic Layer Selection for Hallucination Detection
  7. Hallucination Detection from Structural Reasoning Model
  8. Who Can We Trust? LLM-as-a-Jury for Comparative Assessment

4. Multimodal Understanding·Generation·Evaluation

  1. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning
  2. Semantic Granularity Navigation in Image Editing
  3. ImpText: A Benchmark and Tool-Augmented Framework for Implicit Text Reasoning
  4. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation
  5. PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

5. Agents·Tool Use·Memory·Personalization·Human–AI Interaction

  1. DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
  2. Who’s in Charge? Disempowerment Patterns in Real-World LLM Usage
  3. PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
  4. ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind
  5. Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
  6. Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
  7. Towards a Science of AI Agent Reliability
  8. AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines

6. Reasoning·Generalization·Metacognition·AI Governance

  1. Position: Reasoning is a Learnable Rule-Based Process
  2. Position: Artificial Intelligence Needs Meta Intelligence — the Case for Metacognitive AI
  3. Position: AI Lock-In Is in Progress, and We Must Be Prepared — OpenReview
  4. Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution
  5. Can Large Language Models Generalize Procedures Across Representations?
  6. ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning

7. AI-Generated Content Detection·Multimedia Forensics

  1. Explainable Forensics of Manipulated Segments in Untrimmed Long Videos
  2. Sem-Detect: Semantic Level Detection of AI Generated Peer-Reviews
  3. MusicDET: Zero-Shot AI-Generated Music Detection
profile
AI Safety 일짱이 되겠다.

0개의 댓글