每日论文

快照更新时间: 2026-08-18


2026-08-18
ARXIV

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

Haoran Wang, Chaofan Ma +2

2026-08-18

本文提出 TRACE-Bench,一个基于能力视角的多参考图像生成基准,将任务分解为 Anchoring、Disentangling、Applying 和 Composing 四种原子操作,并构建了约 1600 个评估案例,通过算子对齐的评分和诊断树分析揭示模型的瓶颈在于解耦和属性绑定,而非场景级组合。

ARXIV

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

Lingchen Sun, Rongyuan Wu +7

2026-08-18

PixRestore是一种无需变分自编码器的像素空间扩散变换器,用于统一图像恢复,从零开始训练,避免了预训练文本到图像模型的细节丢失和内容不一致问题,仅用约50M参数和单步推理即可达到最优性能。

ARXIV

Can Unsupervised Methods Outperform Supervised Deep Learning When Ground Truth Is Sparse? A Case Study of Bronchovascular Bundle Segmentation in Low-Dose CT

Anna Mrukwa, Marek Socha +10

2026-08-18

本文提出RONALD方法,通过分割低剂量CT中的支气管血管束(血管和支气管),提高早期肺结节检测的保留率,在多个数据集上几乎达到100%的结节保留。

ARXIV

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

Garima Arya Yadav, Nilay Yilmaz +1

2026-08-18

论文提出“无字基准”(The Unwritten Benchmark),通过要求模型仅从笔划声和手部运动视频推断书写文字,揭示了当前多模态模型在抽象感知推理上的严重不足,人类准确率超80%,而模型不足10%,且多模态融合反致性能下降。

ARXIV

LUNG-KGMM: Knowledge-Guided Multimodal Learning for Lung Cancer Incidence Prediction

Chunlei Yang, Shuyan Li +1

2026-08-18

提出LUNG-KGMM框架,通过整合多模态数据和知识图谱实现1-6年肺癌风险预测,在MIMIC和厦门队列上性能优于现有方法,并验证了跨中心可迁移性。

ARXIV

Incision trajectory tracing for electrosurgical navigation by CNN-based knife contacting frames extraction method

Yu Chun Wang, Kaixu Chen +2

2026-08-18

本文提出利用卷积神经网络(CNN)对电刀和超声刀与组织接触时的热图像进行分类,从中提取接触帧并连接热强度质心,形成动态切口轨迹,以解决手术导航中术前三维模型需实时更新的问题,显著提升了轨迹预测精度。

ARXIV

Test-Time Instance Selection for Improved Whole Slide Image Analysis

Quoc Anh Nguyen, Sunhong Park +1

2026-08-18

本文提出了一种无需训练的、即插即用的测试时实例选择框架(TTIS),用于全切片图像多实例学习。该框架在推理阶段选择紧凑且有代表性的图像块,并结合多视图集成策略,可无缝集成到现有MIL模型中,无需重新训练,在多个基准上提升或匹配了基线性能。

ARXIV

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

Yanyan Zhang, Disheng Liu +7

2026-08-18

CoRe是一种免训练框架,在推理时通过反事实想象和最小重新对齐,恢复冻结的VLA模型,无需失败数据或策略微调。

ARXIV

EMASAM: a Computationally Efficient Sharpness-Aware Minimization via EMA-Guided Perturbations

Tanapat Ratchatorn, Masayuki Tanaka

2026-08-18

本文提出了一种计算高效的指数移动平均锐度感知最小化(EMASAM)方法,通过利用EMA影子模型与主模型的差异定义扰动方向,避免额外梯度计算,在保持泛化性能的同时显著降低计算开销。

ARXIV

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

Rajat Bhattacharjya, Yoomee Jung +5

2026-08-18

本文提出FloodReasonBench基准,用于评估具身洪水响应边缘场景下的视觉语言模型推理分割能力,重点关注资源约束下的精度-延迟-能耗权衡。

ARXIV

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

Ruijie Yang, Yan Zhu +8

2026-08-18

本文提出一种上下文融合框架,无需修改预训练权重即可将冻结的通用视觉语言模型(VLM)专业化为内镜息肉报告系统,通过检索增强和可学习专家令牌实现轻量级适配,在多项指标上超越现有方法。

ARXIV

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

Zihan Ding, Longxu Dou +27

2026-08-18

UI-Mate是一种基础GUI代理,通过环境锚定训练栈和上下文演示学习,解决了训练数据稀缺、提示模糊和执行不可靠的问题,在多个基准上达到新开源最优,并显著提升了长时程任务的可靠性。

ARXIV

US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina

Cheng Zhang, Xingzheng Wu +5

2026-08-18

本文提出了一种超声视觉-语言-动作模型(US-VLA),通过实时超声反馈和语义目标编码实现自动探头操控,在腹部超声扫描中表现出有效性和泛化能力。

ARXIV

DriveCache: Action-Aware Caching for Driving World Model Inference

Jianchun Yang, Jian Liang +6

2026-08-18

DriveCache是一种无需训练的、动作感知的缓存控制器,利用预规划的运动信息在扩散生成过程中动态分配特征重用,并通过因果漂移检查维持生成质量,从而提升驾驶视频生成的效率与保真度平衡。

ARXIV

TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability

Fengji Ma, Hei Victor Cheng +2

2026-08-18

本文通过实证分析发现CLIP零样本对抗鲁棒性中的三个关键问题,并提出文本-图像互感知(TIMA)框架,通过自适应间隔校准和语义一致性保持,显著优于现有方法,在不牺牲泛化能力的前提下提升鲁棒性。

ARXIV

DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT

Xiaotao Hu, Mingkai Jia +4

2026-08-18

DrivingWorld 提出了一种用于自动驾驶的 GPT 风格世界模型,通过时空融合机制实现高保真、长时长的未来视频生成,最长可生成超过 40 秒的连贯视频,性能优于现有方法。

ARXIV

Towards Conditional Feature Alignment for Cross-Domain Counting

Zhuonan Liang, Dongnan Liu +7

2026-08-18

本文提出条件特征对齐(CFA)框架,解决跨域目标计数中因密度组成不同导致的模型退化问题。CFA仅在标签诱导的条件(如前景/背景或密度层级)内对齐特征,而非全局分布对齐,从而保留跨域密度组成变化这一任务相关信息。在无监督域适应源域泛化任务上,CFA在人群与细胞计数中均取得显著性能提升。

ARXIV

Geometrically Constrained and Token-Based Probabilistic Spatial Transformers

Johann Schmidt, Sebastian Stober

2026-08-18

本文提出了一种新型空间变换器网络框架,利用Transformer的全局建模能力对仿射变换进行回归,并分解为可解释基元,在几何约束下防止训练不稳定,通过权重共享实现高效鲁棒分类。

ARXIV

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

Nikos Athanasiou, Ilya A. Petrov +8

2026-08-18

TrustCLIP 通过训练一个投影层,在保持下游任务性能的同时,降低生成式攻击者从特征复原图像的质量,从而防御特征反演带来的隐私风险。

ARXIV

World-in-World: World Models in a Closed-Loop World

Jiahan Zhang, Muqing Jiang +15

2026-08-18

World-in-World平台首次在闭环环境中评估生成式世界模型具身决策的效用,发现视觉质量不保证任务成功,可控性与后训练更重要,且增加推理时计算可提升性能。

ARXIV

Calibration-Free Vehicle Speed Estimation: A Monocular Keypoint-Template Approach

Gaofeng Su, Keya Li +2

2026-08-18

本文提出一种无需标定的框架,从单目视频中可靠估计车辆速度,不依赖道路特征、相机标定或参考物体。该框架使用36关键点车辆模板和帧间更新的单应性矩阵,比较了关键点跟踪和扭曲光流两种策略,在多个数据集上达到较高精度,并支持便携设备用于公民执法。

ARXIV

Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models

Yuanzhi Xu, Qian Gao +5

2026-08-18

本文提出InstaBind-Lite基准,用于检测视觉语言模型在同类别实例间错误绑定属性的盲区,揭示了标准指标无法发现的隐蔽错误。

ARXIV

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

Weiliang Chen, Haowen Sun +41

2026-08-18

本文提出HarnessEval-W,一个用于世界模型评估的代理化流水线,通过分层子代理生成透明的证据树,使评估结果具有可验证的推理链,并在18个模型330个案例上验证了与人类判断的一致性。

ARXIV

Extend the Safety Horizon for Intelligent Transportation Systems through Semantic-Aware Cooperative Perception

Chun-Yeow Yeoh, Chee Keong Tan +2

2026-08-18

本文提出HMS-SCP框架,通过层次化多尺度语义感知和联合信源信道编码,在带宽受限的密集城市环境中实现鲁棒且带宽高效的协同感知,实验表明其在严重衰落和极高压缩比下仍能保持高精度远距离检测,且延迟低于16毫秒。

ARXIV

ARGUS: Attention-Guided Transformers for Scalable Person Identification Using Wi-Fi Telemetry

Nayan Sanjay Bhatia, Pranay Kocheta +2

2026-08-18

Argus 是一种被动 Wi-Fi 感知系统,利用商品信道状态信息(CSI)的统计图谱(statgram)和轻量级 Transformer 实现免设备、无预设动作的人体身份识别,在 154 人大规模数据集上取得高精度,并显著降低计算开销。

ARXIV

A Unified DINOv2-Based Framework for LVEF Estimation, GLS Dysfunction Classification, and Early Cardiotoxicity Prediction

Xiaotong Zhang, Mingyue Cui +2

2026-08-18

该研究提出了一种基于DINOv2的自监督框架,通过低秩适应和时序聚合实现左心室射血分数估计全局纵向应变功能障碍分类早期心脏毒性预测,无需心动周期分割或舒张末期/收缩末期标注,并在LVEF估计任务中引入生理引导的混合视图回归模型以进一步提升精度。

ARXIV

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

Yuhao Huang, Yuanji Zhang +4

2026-08-18

VIFBA框架利用胎儿超声视频预测MRI衍生的侧脑室容积,分类脑室扩张严重程度,并识别其他异常,通过时空预测目标、跨模态对齐和视觉语言模型增强,仅需超声即可实现MRI级评估,性能显著优于现有方法。

ARXIV

Modality-Invariant Coarse-to-Fine Retinal Image Registration

Bo Wen, Nehal Nailesh Mehta +4

2026-08-18

本文提出一种两阶段、模态无关的视网膜图像配准框架,通过通用血管分割驱动稀疏匹配和模态不变光流网络MI-RAFT实现跨模态精细配准,性能优于现有模态依赖方法。

ARXIV

Multi-Channel Feature Fusion and Monte Carlo Dropout for Uncertainty-Aware Diabetic Retinopathy Grading

Saksham Kumar

2026-08-18

本文提出了一种面向医疗级部署的糖尿病视网膜病变五级自动分级管线,整合了病变感知预处理、有序回归不确定性校准和可解释性,在APTOS-2019测试集上取得了91.31%的QWK,并展示了在20%转诊率下自动处理与专家审核的平衡。

ARXIV

Dual-Branch State-Displacement Network for Sea Surface Temperature Super-Resolution

Wankun Chen, Feng Gao +5

2026-08-18

本文提出双分支状态位移网络(DBSD-Net)用于海表温度图像的超分辨率重建,通过小波频率分支和VGGUNet分支分别处理高频细节与多尺度语义特征,并引入结构状态空间模块位移门控模块以增强长程依赖和几何感知能力,在多个公开数据集上优于现有方法。

ARXIV

Underwater Color Restoration with Vanishing Uncertainty

Grigory Solomatov, Derya Akkaynak

2026-08-18

本文探讨了水下颜色复原的理论基础,指出该问题在数学上为严重不适定问题,并确定了在理想化条件下,随着相机空间分辨率提高,不确定性可被限制并收敛至零。

ARXIV

Breaking the Compression Barrier: Cross-Architecture Compression Boundary Learning via Reverse Regrowth

Zhaocen Liu, Satvik Praveen +1

2026-08-18

本文提出BRIDGE框架,将模型压缩重新定义为边界搜索问题,通过先极端稀疏化再选择性逆向再生关键结构,恢复模型性能,有效扩展压缩极限。

ARXIV

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

Kwan Yun, Serin Yoon +4

2026-08-18

AnyTalk 提出了一种无需动画数据即可为任意角色生成3D语音动画的方法,通过微调视频扩散模型生成说话头部视频,并优化得到混合形状参数。

ARXIV

OceanDepths: A Global Dataset of Paired Subsurface and Surface Ocean Observations

Simon Donike, Ruben Cartuyvels +4

2026-08-18

OceanDepths是首个开放、全球、重网格化的AI就绪数据集,将卫星海表温度、盐度和高度产品与EN4次表层温盐剖面及GLORYS12再分析数据配对,提供2000-2024年每周0.1°分辨率的四维多元数据,包含超过950万条插值到50个标准深度的剖面,为AI方法提供了高稀疏性的挑战性测试平台。

ARXIV

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

Vahid Azizi, Fatemeh Koochaki

2026-08-18

本文扩展并微调了MiniGPT-4,使其能够执行逆向设计任务,即根据源图像、编辑版本和可选的文本描述预测编辑操作及其参数,验证了通用视觉语言模型向复杂多模态任务扩展的可行性。

ARXIV

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

Pinxin Liu, Luchuan Song +4

2026-08-18

GestureLSM 提出了一种基于流匹配语音同步手势生成方法,通过时空注意力建模身体区域交互,并引入潜在捷径学习Beta分布时间戳采样,在保持生成质量的同时大幅提升推理速度,在BEAT2上达到最优性能。

ARXIV

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

Yidong Jiang, Jiangtong Li +1

2026-08-18

本文对SAM及其变体中的提示工程技术进行了系统性综述,提出层次化分类法,涵盖几何、文本语义和多模态融合提示,并分析了从手工设计到自动化方法的转变,梳理了其在医学、遥感等领域的跨域泛化,指出了挑战与未来方向。

ARXIV

Recurrent Cross-View Object Geo-Localization

Xiaohan Zhang, Si-Yuan Cao +8

2026-08-18

本文提出 ReCOT,一种将跨视角目标地理定位建模为循环过程的 Transformer 架构,通过可学习令牌迭代细化预测位置,并引入 SAM 知识蒸馏和参考特征增强模块,在降低参数量的同时达到领先性能。

ARXIV

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

Jiawei Liang, Jianjie Huang +4

2026-08-18

本文提出ERCR框架,通过证据重组预测上下文残差化,解决多模态大模型视觉证据归因中的碎片化和上下文干扰问题,在多个模型和数据集上显著提升了令牌级视觉证据的质量。

ARXIV

SUPREME: A Multi-GPU Framework for Reproducible Image Unlearning Method Evaluation

Petros Andreou, Jamie Lanyon +2

2026-08-18

SUPREME是一个多GPU框架,用于高效评估机器遗忘方法,通过分布式训练、遗忘和评估,减少重复计算开销。

ARXIV

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

Artem Sergievskii, Artyom Turevich +1

2026-08-18

本文重新评估了8种基于无分类器引导推理时质量增强方法,在两种修正流变压器模型上使用组合对齐基准测试,发现没有方法能一致超越CFG,APG的增益在评估不确定性内,注意力扰动方法在SD3.5上有孤立提升而在FLUX.2上频繁退化,CFG仍是低成本且具竞争力的基线。

ARXIV

Unsupervised Learning of Cell Instances with Generative Routing Pyramids

Ziwen Liu, Martin Weigert

2026-08-18

本文提出一种无监督方法,从无标注的显微图像中同时完成细胞实例分割表型分类,利用粗到细的路由金字塔将像素与稀疏潜在源关联,生成实例掩码和细胞形态编码。

ARXIV

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

Yejun Zhang, Zihan Wang +9

2026-08-18

SplatGuide 通过将单个 3DGS 场景同时用于三种互补信号(渲染图像、可见性投票图和重建令牌),弥合了信息断层,实现了无姿态新视角合成的领先性能。

ARXIV

Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling

Yang Zhao, Peisong Niu +6

2026-08-18

本文提出BaguanHR框架,通过变量级超分辨率将0.25°再分析数据转化为0.1°合成数据,突破高分辨率ML天气预报的数据瓶颈,性能超越现有方法和IFS-HRES。

ARXIV

Hardware-in-the-Loop Phase-Aware CNN for Real-Time 5G Channel Estimation

Javad Zolfaghari-Bengar, Rakibul Rony +4

2026-08-18

该演示展示了一种基于硬件在环5G平台采集的实时AI上行信道估计推理,利用轻量级相位感知卷积神经网络直接从DMRS信号估计信道响应,并对比传统方法。

ARXIV

KHiM-Mamba: Injecting Pathology Knowledge into Mamba via Hidden-State Modulation for Whole Slide Image Analysis

Qixiang Zhang, Yi Li +5

2026-08-18

本文提出知识感知隐状态调制架构KHiM-Mamba,通过引入显式知识先验调控Mamba的选择性状态空间机制,解决全切片图像多实例学习中纯视觉驱动导致的诊断证据稀释问题,在11个基准上实现最优性能。

ARXIV

ForceU-VLA: A Force-Aware Vision-Language-Action Model for Embodied Ultrasound Scanning

Xingzheng Wu, Cheng Zhang +4

2026-08-18

本文提出ForceU-VLA,一个力感知视觉-语言-动作模型,通过力-超声协同融合和阶段自适应调制,实现自主具身超声扫描,显著提升接触稳定性和压力调控。

ARXIV

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

Cong Xu, Ravi Sankar

2026-08-18

本文提出一种当视觉感知受限时,利用声学模态推断隐藏道路使用者的框架。通过麦克风阵列估计声源方位和接近速率,当检测到声学特征却缺乏视觉共证时,触发溯因推理,发出风险预警。在真实盲区路口测试中,该方法能在视线可见前1.7秒发出警告,并以更低的误报率匹配基线检测性能,定位准确,校准良好,且在视觉退化时仍保持高危险感知。

ARXIV

Earth Observation Foundation Models for Terrestrial Ecohydrology: From Representation Learning to Process Inference

Yi Yu, Jian Peng +3

2026-08-18

本文开发了一个框架,评估地球观测基础模型生态水文学中的相关性和应用,发现模型与生态水文需求之间存在不匹配,并提出一个过程感知框架以支持可信监测。

ARXIV

MM-BEV: Enhancing Timeliness by Computing Where and When it Matters

Liangkai Liu, Kang G. Shin

2026-08-18

MM-BEV 是一种实时多模态鸟瞰视角感知系统,遵循“仅在关键位置和时刻计算”的原则,将感知任务分为强制性(安全关键)和可选性(非紧急)工作,通过优先级调度和稀疏化处理,在保持安全性的同时大幅降低延迟。

ARXIV

Geometry of Forgetting: Representation Flux in Continual Learning

Maksim A. Kazanskii

2026-08-18

本文研究持续学习中的灾难性遗忘,提出表征流(representation flux)这一几何度量来量化样本级表征位移,发现其与遗忘高度相关,并据此提出FlowLess-R方法,通过约束重放表征来稳定潜在空间,有效缓解遗忘。

ARXIV

AdROD: HyperNetwork-based Adversarially Robust Object Detection for Autonomous Driving

Yuting Wu, Dongfang Guo +3

2026-08-18

AdROD是一种嵌入式随机集成防御系统,利用低秩超网络逐帧生成多样化检测器,并引入功能多样性机制,提供两种服务模式,在物理对抗攻击下优于现有基线,实现实时安全停车。

ARXIV

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

Tao Feng, Xu Li +5

2026-08-18

本文提出SingDance,一个统一的视频扩散框架,将声乐发音建模为语义角色(发声者或听者),通过不对称训练和组合式零样本推理,实现从参考图像、提示文本和音频生成个性化歌舞视频。

ARXIV

OccamView: Object-Conditioned View Selection for Frame-Budgeted Active 3D Gaussian Reconstruction

Hongbo Gao, Wei Zhang +5

2026-08-18

OccamView是一种面向帧预算受限的主动三维高斯重建物体条件视角选择框架,通过在线物体记忆和保守隐藏区域代理,优先选择能补全部分观测物体的视角,在有限帧下显著提升重建完整度。

ARXIV

STAG-VIO: Stabilized Prompt-to-Geometry Interface for Robust Dynamic Visual--Inertial Odometry

Rui Zhou, Jingbin Liu +4

2026-08-18

STAG-VIO通过稳定提示分割输入的时序一致性,解决了动态环境下视觉惯性里程计的鲁棒性问题,大幅降低轨迹误差。

ARXIV

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

Yang Shi, Huanqian Wang +21

2026-08-18

该论文介绍了MME-VideoOCR基准测试,用于评估多模态大语言模型视频OCR中的表现。结果显示,现有模型在需要整体视频理解的任务上能力有限,最佳模型仅达73.7%准确率,强调了时空推理和高分辨率输入的重要性。

ARXIV

Vision-Based Calorie Estimation for Bangladeshi Street Food: A Comparative Study of Detection and Regression Models

Aparup Dhar, Antu Das +2

2026-08-18

该研究提出了一种基于视觉的孟加拉国街头食品卡路里估算系统,结合YOLO11n目标检测和随机森林回归,实现了高精度热量预测。

ARXIV

CSMoE: An Efficient Remote Sensing Foundation Model with Soft Mixture-of-Experts

Leonard Hackel, Tom Burgert +1

2026-08-18

本文提出通过模型效率和数据效率两个维度提升遥感基础模型的计算效率,将软混合专家机制集成到跨传感器掩码自编码器中,并采用主题-气候描述符驱动的采样策略构建精简训练集,使得模型在场景分类、语义分割和图像检索任务上以更少的FLOPs达到与现有最佳模型相当的性能。

ARXIV

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

Zhihong Chen, Xuehai Bai +10

2026-08-18

本文提出了OpenGPT-4o-Image数据集,通过分层任务分类和自动化生成构建了80k高质量指令-图像对,覆盖11个领域和51个子任务,微调后模型在编辑和生成任务上分别提升高达18%和13%。

ARXIV

WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis

Danilo Danese, Angela Lombardi +3

2026-08-18

WaveDiT 是一种在三维离散小波变换系数空间中操作的条件流匹配框架,通过因子化时空深度注意力和基于小波高阶统计的带间异方差不确定性建模,实现了在单块现代 GPU 上以全分辨率合成 3D 脑 MRI,且生成质量优于现有扩散、潜在和基于小波的基线方法。

ARXIV

Steering the Flow: Inverting Face Recognition Models via Gradient-Guided Flow Matching

Ye Lu, Shen Wang +5

2026-08-18

本文提出了一种名为 SFMI 的两阶段白盒模型反转攻击方法,通过流匹配先验与渐进式引导调度器,将反转过程转化为轨迹引导任务,能够稳定地生成逼近目标身份的人脸图像,并在多个模型上取得了领先的攻击成功率和视觉保真度。

ARXIV

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

Long Cui, Xiaoqian Liu +5

2026-08-18

本文针对图像编辑中概念粒度不足和训练效率低的问题,构建了包含超1000个细粒度编辑概念的层次化分类体系及1200万编辑对数据集ConceptEdit-12M,并提出密集监督训练策略,显著提升了模型性能,同时推出细粒度评估基准ConceptEdit-Bench。

ARXIV

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

Dengyang Jiang, Ruoyi Du +11

2026-08-18

本文通过实证研究发现,直接在大规模像素空间预训练扩散模型收敛缓慢,提出潜在空间到像素空间的迁移策略,在像素空间后训练时通过优化设计选择,使像素空间模型性能匹配或超越潜在空间模型,并获得3.18至4.75倍推理加速

ARXIV

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

Hongbo Jiang, Jie Li +3

2026-08-18

全模态大语言模型存在感知-决策失配问题,本文提出因果模态敏感性指标和诊断基准,并设计模态子空间激活方法在推理时校正,恢复模态敏感性。

ARXIV

SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception

Liang Hong, Jiaxin Wei +3

2026-08-18

本文提出了一种改进的可重光照三维重建框架,通过在暗高斯溅射中联合优化光照参数、引入球谐光照模型和MLP双向反射分布函数,有效缓解了机器人黑暗环境下的不均匀光照问题,提升了渲染质量和下游感知性能。

ARXIV

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

Julia Huang, Camila Gonzalez +6

2026-08-18

本文提出CAE3D,一个确定性3D条件自编码器,可从乙酰唑胺给药前的动脉自旋标记灌注图像直接合成给药后的脑血流图,用于烟雾病患者脑血流储备的无创评估,取得了低误差、高图像质量,并验证了回顾性可行性,但需前瞻性外部验证以推广至禁忌患者。

ARXIV

Bit-Level Triangular Content-Aware Permutation for Fragile Image Watermarking: Zero False Positive Rate, Single-Bit Sensitivity, and Arbitrary Dimension Support

Zahra Ghoraeian, Mohammad-Reza Sadeghi +1

2026-08-18

本文提出一种维度无关脆弱水印算法,利用三角内容感知置换(TCA)替代传统哈希函数,增强抵抗矢量量化(VQ)和拼贴攻击的安全性,实现高精度篡改定位,且无需填充约束,适用于多种位深和彩色图像。

ARXIV

MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM

Zhiqiang Hu, Shouren Huang +1

2026-08-18

MotionGS-SLAM 通过将运动模糊处理重新定义为前向生成问题,利用事件相机的高时间分辨率,提出事件调制高斯核和双重调制机制,实现严重运动模糊下的高精度 SLAM。

ARXIV

Shape Operator PCA: Curvature-Aware Projections for Geometric Machine Learning

Alexandre L. M. Levada

2026-08-18

SHOPCA是一种结合微分几何的无监督度量学习降维方法,通过形状算子正则化协方差矩阵,引导主成分朝向高方差和高信息曲率方向,在50多个数据集上提升聚类质量,特别在小样本条件下优于UMAP。

ARXIV

Population Structure Analysis of an Inbred Population using Quantitative Shape Phenotyping from Stereo Retinal Photographs

Li Tang, Michael D Abramoff

2026-08-18

利用立体眼底照片重建视神经乳头三维形状,通过深度神经网络自学习特征,对诺福克岛近交群体进行表型群体结构分析,以揭示遗传风险因素

ARXIV

Pre-training Visual Dexterity in Simulation

Sarthak Kamat, Adam Rashid +5

2026-08-18

一种利用VR仿真遥操作数据进行灵巧操作预训练的框架,通过仿真数据预训练因果Transformer并在真实世界微调,优于从头训练的行为克隆策略。

ARXIV

Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

Jiadao Zou, Hongyu Guo +1

2026-08-18

该研究解耦脑分区与分类,通过OASIS-1数据集上的AD分类,系统评估了快速深度学习分区方法相对于FreeSurfer基线的性能,采用因子设计比较了三种分区方法、两种体积策略和四种分类器范式,并用BCa Bootstrap置信区间量化结果。

ARXIV

A cross-modal generative model for incomplete and degraded prostate MRI with multicentre clinical validation

Siyuan Ma, Liang He +15

2026-08-18

本文提出MSCNet,一种序列条件跨模态生成框架,用于前列腺多参数MRI中缺失或降质序列的重建,在多项任务中优于对比方法,满足DWI、ADC和T2W的非劣性标准,并在多中心数据上验证了诊断性能。

ARXIV

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

Bingxin Xu, Yuzhang Shang +1

2026-08-18

BATON通过将子任务作为探索单元并引入过渡感知记忆,将长周期机器人操作的学习成本从乘法级降至加法级,在RoboMemArena上超越现有方法。

ARXIV

SemTalk: Holistic Co-speech Motion Generation with Frame-level Semantic Emphasis

Xiangyue Zhang, Jianfang Li +5

2026-08-18

SemTalk 通过分离学习基础节奏运动和稀疏语义手势,并自适应融合,生成语义增强的协同语音手势。

ARXIV

FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens

Christian Schlarmann, Francesco Croce +2

2026-08-18

本文提出FuseLIP,一种基于统一词表与单Transformer的早期融合多模态嵌入架构,无需额外模块,在多项多模态和单模态嵌入任务中优于常见后期融合方法。

ARXIV

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

Yuyao Ge, Shenghua Liu +7

2026-08-18

本文发现视觉语言模型在复杂视觉场景中注意力模式与性能的关系,并提出了一种无需训练的对比注意力精细化方法CARVE,通过像素级注意力对比提取任务相关视觉信号,显著提升开源模型推理性能。

ARXIV

A Versatile Foundation Model for AI-enabled Mammogram Interpretation

Fuxiang Huang, Jiayi Zhu +21

2026-08-18

VersaMammo是一个针对乳腺X线摄影的多功能基础模型,通过大规模多机构数据集和两阶段预训练策略,在涵盖92项临床任务的综合基准上取得领先性能,展现出卓越的泛化能力。

ARXIV

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

Soroush Mehraban, Vida Adeli +5

2026-08-18

PickStyle 是一种视频风格迁移框架,通过低秩适配器合成训练数据,实现了时间一致、风格忠实且内容保留的视频转换,优于现有基线。

ARXIV

REFINE: Super-efficient 3D Gaussian Splatting Pruning via Rendering-Free Primitive Importance

Zhang Chen, Shuai Wan +3

2026-08-18

REFINE框架通过一种免渲染的基元重要性度量,利用解析近似的海森场量化移除基元的感知误差,从而在维持渲染质量的同时,将剪枝计算复杂度降低3000倍,设备延迟加速约20倍。