폐관수련
로그인
폐관수련
로그인
ICML 2026 재밌게 본 논문들
beaver.zip
·
2026년 7월 13일
팔로우
0
Paper
ICML 2026
목록 보기
2/3
1. AI Safety·Privacy·Jailbreak·Alignment
MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
Jailbreaking Vision-Language Models Through the Visual Modality
Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
Learning Efficient Guardrails for Compliance
More Sail than Ballast: Addressing Harmful Knowledge Leakage in the Expansive Reasoning Space of LRMs
Frontier Models Can Take Actions at Low Probabilities
Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework
Safety Alignment of LMs via Non-cooperative Games
Position: LLM-Safety Evaluations Lack Robustness
Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment
Active Attacks: Red-teaming LLMs via Adaptive Environments
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
It’s a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
Are Your Agents Upward Deceivers?
Prompt Injection as Role Confusion
Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
Position: ‘AI Alignment’ Encompasses Competing Technical Priorities
From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents
2. Interpretability·Mechanistic Analysis·CoT Faithfulness
Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Models
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
Chain-of-Thought Reasoning in the Wild Is Not Always Faithful
Interpretability Can Be Actionable
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
Do Activation Verbalization Methods Convey Privileged Information?
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
Causality is Key for Interpretability Claims to Generalise
3. Hallucination·Reliability·Calibration·Citation
Reliable Thinking with Images
Building Reliable Long-Form Generation via Hallucination Rejection Sampling
From Out-of-Distribution Detection to Hallucination Detection: A Geometric View
Guidance: Sentence-Level Citation Enforcement via Prefix-Tail Guidance during LLM Decoding
Confidence is Not Universal: Task-Dependent Calibration and Emergent Behavior in LLMs
Automatic Layer Selection for Hallucination Detection
Hallucination Detection from Structural Reasoning Model
Who Can We Trust? LLM-as-a-Jury for Comparative Assessment
4. Multimodal Understanding·Generation·Evaluation
ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning
Semantic Granularity Navigation in Image Editing
ImpText: A Benchmark and Tool-Augmented Framework for Implicit Text Reasoning
Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
5. Agents·Tool Use·Memory·Personalization·Human–AI Interaction
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
Who’s in Charge? Disempowerment Patterns in Real-World LLM Usage
PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
Towards a Science of AI Agent Reliability
AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines
6. Reasoning·Generalization·Metacognition·AI Governance
Position: Reasoning is a Learnable Rule-Based Process
Position: Artificial Intelligence Needs Meta Intelligence — the Case for Metacognitive AI
Position: AI Lock-In Is in Progress, and We Must Be Prepared
— OpenReview
Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution
Can Large Language Models Generalize Procedures Across Representations?
ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning
7. AI-Generated Content Detection·Multimedia Forensics
Explainable Forensics of Manipulated Segments in Untrimmed Long Videos
Sem-Detect: Semantic Level Detection of AI Generated Peer-Reviews
MusicDET: Zero-Shot AI-Generated Music Detection
beaver.zip
AI Safety 일짱이 되겠다.
팔로우
이전 포스트
ICML 2026 후기
다음 포스트
MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
0개의 댓글
댓글 작성