快照更新时间: 2026-08-18
Haoran Wang, Chaofan Ma +2
2026-08-18
本文提出 TRACE-Bench,一个基于能力视角的多参考图像生成基准,将任务分解为 Anchoring、Disentangling、Applying 和 Composing 四种原子操作,并构建了约 1600 个评估案例,通过算子对齐的评分和诊断树分析揭示模型的瓶颈在于解耦和属性绑定,而非场景级组合。
Lingchen Sun, Rongyuan Wu +7
2026-08-18
PixRestore是一种无需变分自编码器的像素空间扩散变换器,用于统一图像恢复,从零开始训练,避免了预训练文本到图像模型的细节丢失和内容不一致问题,仅用约50M参数和单步推理即可达到最优性能。
Anna Mrukwa, Marek Socha +10
2026-08-18
本文提出RONALD方法,通过分割低剂量CT中的支气管血管束(血管和支气管),提高早期肺结节检测的保留率,在多个数据集上几乎达到100%的结节保留。
Garima Arya Yadav, Nilay Yilmaz +1
2026-08-18
论文提出“无字基准”(The Unwritten Benchmark),通过要求模型仅从笔划声和手部运动视频推断书写文字,揭示了当前多模态模型在抽象感知推理上的严重不足,人类准确率超80%,而模型不足10%,且多模态融合反致性能下降。
Chunlei Yang, Shuyan Li +1
2026-08-18
提出LUNG-KGMM框架,通过整合多模态数据和知识图谱实现1-6年肺癌风险预测,在MIMIC和厦门队列上性能优于现有方法,并验证了跨中心可迁移性。
Yu Chun Wang, Kaixu Chen +2
2026-08-18
本文提出利用卷积神经网络(CNN)对电刀和超声刀与组织接触时的热图像进行分类,从中提取接触帧并连接热强度质心,形成动态切口轨迹,以解决手术导航中术前三维模型需实时更新的问题,显著提升了轨迹预测精度。
Quoc Anh Nguyen, Sunhong Park +1
2026-08-18
本文提出了一种无需训练的、即插即用的测试时实例选择框架(TTIS),用于全切片图像的多实例学习。该框架在推理阶段选择紧凑且有代表性的图像块,并结合多视图集成策略,可无缝集成到现有MIL模型中,无需重新训练,在多个基准上提升或匹配了基线性能。
Yanyan Zhang, Disheng Liu +7
2026-08-18
CoRe是一种免训练框架,在推理时通过反事实想象和最小重新对齐,恢复冻结的VLA模型,无需失败数据或策略微调。
Tanapat Ratchatorn, Masayuki Tanaka
2026-08-18
本文提出了一种计算高效的指数移动平均锐度感知最小化(EMASAM)方法,通过利用EMA影子模型与主模型的差异定义扰动方向,避免额外梯度计算,在保持泛化性能的同时显著降低计算开销。
Rajat Bhattacharjya, Yoomee Jung +5
2026-08-18
本文提出FloodReasonBench基准,用于评估具身洪水响应边缘场景下的视觉语言模型推理分割能力,重点关注资源约束下的精度-延迟-能耗权衡。
Ruijie Yang, Yan Zhu +8
2026-08-18
本文提出一种上下文融合框架,无需修改预训练权重即可将冻结的通用视觉语言模型(VLM)专业化为内镜息肉报告系统,通过检索增强和可学习专家令牌实现轻量级适配,在多项指标上超越现有方法。
Zihan Ding, Longxu Dou +27
2026-08-18
UI-Mate是一种基础GUI代理,通过环境锚定训练栈和上下文演示学习,解决了训练数据稀缺、提示模糊和执行不可靠的问题,在多个基准上达到新开源最优,并显著提升了长时程任务的可靠性。
Cheng Zhang, Xingzheng Wu +5
2026-08-18
本文提出了一种超声视觉-语言-动作模型(US-VLA),通过实时超声反馈和语义目标编码实现自动探头操控,在腹部超声扫描中表现出有效性和泛化能力。
Jianchun Yang, Jian Liang +6
2026-08-18
DriveCache是一种无需训练的、动作感知的缓存控制器,利用预规划的运动信息在扩散生成过程中动态分配特征重用,并通过因果漂移检查维持生成质量,从而提升驾驶视频生成的效率与保真度平衡。
Fengji Ma, Hei Victor Cheng +2
2026-08-18
本文通过实证分析发现CLIP零样本对抗鲁棒性中的三个关键问题,并提出文本-图像互感知(TIMA)框架,通过自适应间隔校准和语义一致性保持,显著优于现有方法,在不牺牲泛化能力的前提下提升鲁棒性。
Xiaotao Hu, Mingkai Jia +4
2026-08-18
DrivingWorld 提出了一种用于自动驾驶的 GPT 风格世界模型,通过时空融合机制实现高保真、长时长的未来视频生成,最长可生成超过 40 秒的连贯视频,性能优于现有方法。
Zhuonan Liang, Dongnan Liu +7
2026-08-18
本文提出条件特征对齐(CFA)框架,解决跨域目标计数中因密度组成不同导致的模型退化问题。CFA仅在标签诱导的条件(如前景/背景或密度层级)内对齐特征,而非全局分布对齐,从而保留跨域密度组成变化这一任务相关信息。在无监督域适应和源域泛化任务上,CFA在人群与细胞计数中均取得显著性能提升。
Johann Schmidt, Sebastian Stober
2026-08-18
本文提出了一种新型空间变换器网络框架,利用Transformer的全局建模能力对仿射变换进行回归,并分解为可解释基元,在几何约束下防止训练不稳定,通过权重共享实现高效鲁棒分类。
Nikos Athanasiou, Ilya A. Petrov +8
2026-08-18
TrustCLIP 通过训练一个投影层,在保持下游任务性能的同时,降低生成式攻击者从特征复原图像的质量,从而防御特征反演带来的隐私风险。
Jiahan Zhang, Muqing Jiang +15
2026-08-18
World-in-World平台首次在闭环环境中评估生成式世界模型对具身决策的效用,发现视觉质量不保证任务成功,可控性与后训练更重要,且增加推理时计算可提升性能。
Gaofeng Su, Keya Li +2
2026-08-18
本文提出一种无需标定的框架,从单目视频中可靠估计车辆速度,不依赖道路特征、相机标定或参考物体。该框架使用36关键点车辆模板和帧间更新的单应性矩阵,比较了关键点跟踪和扭曲光流两种策略,在多个数据集上达到较高精度,并支持便携设备用于公民执法。
Yuanzhi Xu, Qian Gao +5
2026-08-18
本文提出InstaBind-Lite基准,用于检测视觉语言模型在同类别实例间错误绑定属性的盲区,揭示了标准指标无法发现的隐蔽错误。
Weiliang Chen, Haowen Sun +41
2026-08-18
本文提出HarnessEval-W,一个用于世界模型评估的代理化流水线,通过分层子代理生成透明的证据树,使评估结果具有可验证的推理链,并在18个模型330个案例上验证了与人类判断的一致性。
Chun-Yeow Yeoh, Chee Keong Tan +2
2026-08-18
本文提出HMS-SCP框架,通过层次化多尺度语义感知和联合信源信道编码,在带宽受限的密集城市环境中实现鲁棒且带宽高效的协同感知,实验表明其在严重衰落和极高压缩比下仍能保持高精度远距离检测,且延迟低于16毫秒。
Nayan Sanjay Bhatia, Pranay Kocheta +2
2026-08-18
Argus 是一种被动 Wi-Fi 感知系统,利用商品信道状态信息(CSI)的统计图谱(statgram)和轻量级 Transformer 实现免设备、无预设动作的人体身份识别,在 154 人大规模数据集上取得高精度,并显著降低计算开销。
Xiaotong Zhang, Mingyue Cui +2
2026-08-18
该研究提出了一种基于DINOv2的自监督框架,通过低秩适应和时序聚合实现左心室射血分数估计、全局纵向应变功能障碍分类和早期心脏毒性预测,无需心动周期分割或舒张末期/收缩末期标注,并在LVEF估计任务中引入生理引导的混合视图回归模型以进一步提升精度。
Yuhao Huang, Yuanji Zhang +4
2026-08-18
VIFBA框架利用胎儿超声视频预测MRI衍生的侧脑室容积,分类脑室扩张严重程度,并识别其他异常,通过时空预测目标、跨模态对齐和视觉语言模型增强,仅需超声即可实现MRI级评估,性能显著优于现有方法。
Bo Wen, Nehal Nailesh Mehta +4
2026-08-18
本文提出一种两阶段、模态无关的视网膜图像配准框架,通过通用血管分割驱动稀疏匹配和模态不变光流网络MI-RAFT实现跨模态精细配准,性能优于现有模态依赖方法。
Saksham Kumar
2026-08-18
本文提出了一种面向医疗级部署的糖尿病视网膜病变五级自动分级管线,整合了病变感知预处理、有序回归、不确定性校准和可解释性,在APTOS-2019测试集上取得了91.31%的QWK,并展示了在20%转诊率下自动处理与专家审核的平衡。
Wankun Chen, Feng Gao +5
2026-08-18
本文提出双分支状态位移网络(DBSD-Net)用于海表温度图像的超分辨率重建,通过小波频率分支和VGGUNet分支分别处理高频细节与多尺度语义特征,并引入结构状态空间模块和位移门控模块以增强长程依赖和几何感知能力,在多个公开数据集上优于现有方法。
Grigory Solomatov, Derya Akkaynak
2026-08-18
本文探讨了水下颜色复原的理论基础,指出该问题在数学上为严重不适定问题,并确定了在理想化条件下,随着相机空间分辨率提高,不确定性可被限制并收敛至零。
Zhaocen Liu, Satvik Praveen +1
2026-08-18
本文提出BRIDGE框架,将模型压缩重新定义为边界搜索问题,通过先极端稀疏化再选择性逆向再生关键结构,恢复模型性能,有效扩展压缩极限。
Kwan Yun, Serin Yoon +4
2026-08-18
AnyTalk 提出了一种无需动画数据即可为任意角色生成3D语音动画的方法,通过微调视频扩散模型生成说话头部视频,并优化得到混合形状参数。
Simon Donike, Ruben Cartuyvels +4
2026-08-18
OceanDepths是首个开放、全球、重网格化的AI就绪数据集,将卫星海表温度、盐度和高度产品与EN4次表层温盐剖面及GLORYS12再分析数据配对,提供2000-2024年每周0.1°分辨率的四维多元数据,包含超过950万条插值到50个标准深度的剖面,为AI方法提供了高稀疏性的挑战性测试平台。
Vahid Azizi, Fatemeh Koochaki
2026-08-18
本文扩展并微调了MiniGPT-4,使其能够执行逆向设计任务,即根据源图像、编辑版本和可选的文本描述预测编辑操作及其参数,验证了通用视觉语言模型向复杂多模态任务扩展的可行性。
Pinxin Liu, Luchuan Song +4
2026-08-18
GestureLSM 提出了一种基于流匹配的语音同步手势生成方法,通过时空注意力建模身体区域交互,并引入潜在捷径学习和Beta分布时间戳采样,在保持生成质量的同时大幅提升推理速度,在BEAT2上达到最优性能。
Yidong Jiang, Jiangtong Li +1
2026-08-18
本文对SAM及其变体中的提示工程技术进行了系统性综述,提出层次化分类法,涵盖几何、文本语义和多模态融合提示,并分析了从手工设计到自动化方法的转变,梳理了其在医学、遥感等领域的跨域泛化,指出了挑战与未来方向。
Xiaohan Zhang, Si-Yuan Cao +8
2026-08-18
本文提出 ReCOT,一种将跨视角目标地理定位建模为循环过程的 Transformer 架构,通过可学习令牌迭代细化预测位置,并引入 SAM 知识蒸馏和参考特征增强模块,在降低参数量的同时达到领先性能。
Jiawei Liang, Jianjie Huang +4
2026-08-18
本文提出ERCR框架,通过证据重组和预测上下文残差化,解决多模态大模型视觉证据归因中的碎片化和上下文干扰问题,在多个模型和数据集上显著提升了令牌级视觉证据的质量。
Petros Andreou, Jamie Lanyon +2
2026-08-18
SUPREME是一个多GPU框架,用于高效评估机器遗忘方法,通过分布式训练、遗忘和评估,减少重复计算开销。
Artem Sergievskii, Artyom Turevich +1
2026-08-18
本文重新评估了8种基于无分类器引导的推理时质量增强方法,在两种修正流变压器模型上使用组合对齐基准测试,发现没有方法能一致超越CFG,APG的增益在评估不确定性内,注意力扰动方法在SD3.5上有孤立提升而在FLUX.2上频繁退化,CFG仍是低成本且具竞争力的基线。
Ziwen Liu, Martin Weigert
2026-08-18
本文提出一种无监督方法,从无标注的显微图像中同时完成细胞实例分割和表型分类,利用粗到细的路由金字塔将像素与稀疏潜在源关联,生成实例掩码和细胞形态编码。
Yejun Zhang, Zihan Wang +9
2026-08-18
SplatGuide 通过将单个 3DGS 场景同时用于三种互补信号(渲染图像、可见性投票图和重建令牌),弥合了信息断层,实现了无姿态新视角合成的领先性能。
Yang Zhao, Peisong Niu +6
2026-08-18
本文提出BaguanHR框架,通过变量级超分辨率将0.25°再分析数据转化为0.1°合成数据,突破高分辨率ML天气预报的数据瓶颈,性能超越现有方法和IFS-HRES。
Javad Zolfaghari-Bengar, Rakibul Rony +4
2026-08-18
该演示展示了一种基于硬件在环5G平台采集的实时AI上行信道估计推理,利用轻量级相位感知卷积神经网络直接从DMRS信号估计信道响应,并对比传统方法。
Qixiang Zhang, Yi Li +5
2026-08-18
本文提出知识感知隐状态调制架构KHiM-Mamba,通过引入显式知识先验调控Mamba的选择性状态空间机制,解决全切片图像多实例学习中纯视觉驱动导致的诊断证据稀释问题,在11个基准上实现最优性能。
Xingzheng Wu, Cheng Zhang +4
2026-08-18
本文提出ForceU-VLA,一个力感知的视觉-语言-动作模型,通过力-超声协同融合和阶段自适应调制,实现自主具身超声扫描,显著提升接触稳定性和压力调控。
Cong Xu, Ravi Sankar
2026-08-18
本文提出一种当视觉感知受限时,利用声学模态推断隐藏道路使用者的框架。通过麦克风阵列估计声源方位和接近速率,当检测到声学特征却缺乏视觉共证时,触发溯因推理,发出风险预警。在真实盲区路口测试中,该方法能在视线可见前1.7秒发出警告,并以更低的误报率匹配基线检测性能,定位准确,校准良好,且在视觉退化时仍保持高危险感知。
Yi Yu, Jian Peng +3
2026-08-18
本文开发了一个框架,评估地球观测基础模型在生态水文学中的相关性和应用,发现模型与生态水文需求之间存在不匹配,并提出一个过程感知框架以支持可信监测。
Liangkai Liu, Kang G. Shin
2026-08-18
MM-BEV 是一种实时多模态鸟瞰视角感知系统,遵循“仅在关键位置和时刻计算”的原则,将感知任务分为强制性(安全关键)和可选性(非紧急)工作,通过优先级调度和稀疏化处理,在保持安全性的同时大幅降低延迟。
Maksim A. Kazanskii
2026-08-18
本文研究持续学习中的灾难性遗忘,提出表征流(representation flux)这一几何度量来量化样本级表征位移,发现其与遗忘高度相关,并据此提出FlowLess-R方法,通过约束重放表征来稳定潜在空间,有效缓解遗忘。
Yuting Wu, Dongfang Guo +3
2026-08-18
AdROD是一种嵌入式随机集成防御系统,利用低秩超网络逐帧生成多样化检测器,并引入功能多样性机制,提供两种服务模式,在物理对抗攻击下优于现有基线,实现实时安全停车。
Tao Feng, Xu Li +5
2026-08-18
本文提出SingDance,一个统一的视频扩散框架,将声乐发音建模为语义角色(发声者或听者),通过不对称训练和组合式零样本推理,实现从参考图像、提示文本和音频生成个性化歌舞视频。
Hongbo Gao, Wei Zhang +5
2026-08-18
OccamView是一种面向帧预算受限的主动三维高斯重建的物体条件视角选择框架,通过在线物体记忆和保守隐藏区域代理,优先选择能补全部分观测物体的视角,在有限帧下显著提升重建完整度。
Rui Zhou, Jingbin Liu +4
2026-08-18
STAG-VIO通过稳定提示分割输入的时序一致性,解决了动态环境下视觉惯性里程计的鲁棒性问题,大幅降低轨迹误差。
Yang Shi, Huanqian Wang +21
2026-08-18
该论文介绍了MME-VideoOCR基准测试,用于评估多模态大语言模型在视频OCR中的表现。结果显示,现有模型在需要整体视频理解的任务上能力有限,最佳模型仅达73.7%准确率,强调了时空推理和高分辨率输入的重要性。
Aparup Dhar, Antu Das +2
2026-08-18
该研究提出了一种基于视觉的孟加拉国街头食品卡路里估算系统,结合YOLO11n目标检测和随机森林回归,实现了高精度热量预测。
Leonard Hackel, Tom Burgert +1
2026-08-18
本文提出通过模型效率和数据效率两个维度提升遥感基础模型的计算效率,将软混合专家机制集成到跨传感器掩码自编码器中,并采用主题-气候描述符驱动的采样策略构建精简训练集,使得模型在场景分类、语义分割和图像检索任务上以更少的FLOPs达到与现有最佳模型相当的性能。
Zhihong Chen, Xuehai Bai +10
2026-08-18
本文提出了OpenGPT-4o-Image数据集,通过分层任务分类和自动化生成构建了80k高质量指令-图像对,覆盖11个领域和51个子任务,微调后模型在编辑和生成任务上分别提升高达18%和13%。
Danilo Danese, Angela Lombardi +3
2026-08-18
WaveDiT 是一种在三维离散小波变换系数空间中操作的条件流匹配框架,通过因子化时空深度注意力和基于小波高阶统计的带间异方差不确定性建模,实现了在单块现代 GPU 上以全分辨率合成 3D 脑 MRI,且生成质量优于现有扩散、潜在和基于小波的基线方法。
Ye Lu, Shen Wang +5
2026-08-18
本文提出了一种名为 SFMI 的两阶段白盒模型反转攻击方法,通过流匹配先验与渐进式引导调度器,将反转过程转化为轨迹引导任务,能够稳定地生成逼近目标身份的人脸图像,并在多个模型上取得了领先的攻击成功率和视觉保真度。
Long Cui, Xiaoqian Liu +5
2026-08-18
本文针对图像编辑中概念粒度不足和训练效率低的问题,构建了包含超1000个细粒度编辑概念的层次化分类体系及1200万编辑对数据集ConceptEdit-12M,并提出密集监督训练策略,显著提升了模型性能,同时推出细粒度评估基准ConceptEdit-Bench。
Dengyang Jiang, Ruoyi Du +11
2026-08-18
本文通过实证研究发现,直接在大规模像素空间预训练扩散模型收敛缓慢,提出潜在空间到像素空间的迁移策略,在像素空间后训练时通过优化设计选择,使像素空间模型性能匹配或超越潜在空间模型,并获得3.18至4.75倍推理加速。
Hongbo Jiang, Jie Li +3
2026-08-18
全模态大语言模型存在感知-决策失配问题,本文提出因果模态敏感性指标和诊断基准,并设计模态子空间激活方法在推理时校正,恢复模态敏感性。
Liang Hong, Jiaxin Wei +3
2026-08-18
本文提出了一种改进的可重光照三维重建框架,通过在暗高斯溅射中联合优化光照参数、引入球谐光照模型和MLP双向反射分布函数,有效缓解了机器人黑暗环境下的不均匀光照问题,提升了渲染质量和下游感知性能。
Julia Huang, Camila Gonzalez +6
2026-08-18
本文提出CAE3D,一个确定性3D条件自编码器,可从乙酰唑胺给药前的动脉自旋标记灌注图像直接合成给药后的脑血流图,用于烟雾病患者脑血流储备的无创评估,取得了低误差、高图像质量,并验证了回顾性可行性,但需前瞻性外部验证以推广至禁忌患者。
Zahra Ghoraeian, Mohammad-Reza Sadeghi +1
2026-08-18
本文提出一种维度无关的脆弱水印算法,利用三角内容感知置换(TCA)替代传统哈希函数,增强抵抗矢量量化(VQ)和拼贴攻击的安全性,实现高精度篡改定位,且无需填充约束,适用于多种位深和彩色图像。
Zhiqiang Hu, Shouren Huang +1
2026-08-18
MotionGS-SLAM 通过将运动模糊处理重新定义为前向生成问题,利用事件相机的高时间分辨率,提出事件调制高斯核和双重调制机制,实现严重运动模糊下的高精度 SLAM。
Alexandre L. M. Levada
2026-08-18
SHOPCA是一种结合微分几何的无监督度量学习降维方法,通过形状算子正则化协方差矩阵,引导主成分朝向高方差和高信息曲率方向,在50多个数据集上提升聚类质量,特别在小样本条件下优于UMAP。
Li Tang, Michael D Abramoff
2026-08-18
利用立体眼底照片重建视神经乳头三维形状,通过深度神经网络自学习特征,对诺福克岛近交群体进行表型群体结构分析,以揭示遗传风险因素。
Sarthak Kamat, Adam Rashid +5
2026-08-18
一种利用VR仿真遥操作数据进行灵巧操作预训练的框架,通过仿真数据预训练因果Transformer并在真实世界微调,优于从头训练的行为克隆策略。
Jiadao Zou, Hongyu Guo +1
2026-08-18
该研究解耦脑分区与分类,通过OASIS-1数据集上的AD分类,系统评估了快速深度学习分区方法相对于FreeSurfer基线的性能,采用因子设计比较了三种分区方法、两种体积策略和四种分类器范式,并用BCa Bootstrap置信区间量化结果。
Siyuan Ma, Liang He +15
2026-08-18
本文提出MSCNet,一种序列条件跨模态生成框架,用于前列腺多参数MRI中缺失或降质序列的重建,在多项任务中优于对比方法,满足DWI、ADC和T2W的非劣性标准,并在多中心数据上验证了诊断性能。
Bingxin Xu, Yuzhang Shang +1
2026-08-18
BATON通过将子任务作为探索单元并引入过渡感知记忆,将长周期机器人操作的学习成本从乘法级降至加法级,在RoboMemArena上超越现有方法。
Xiangyue Zhang, Jianfang Li +5
2026-08-18
SemTalk 通过分离学习基础节奏运动和稀疏语义手势,并自适应融合,生成语义增强的协同语音手势。
Christian Schlarmann, Francesco Croce +2
2026-08-18
本文提出FuseLIP,一种基于统一词表与单Transformer的早期融合多模态嵌入架构,无需额外模块,在多项多模态和单模态嵌入任务中优于常见后期融合方法。
Yuyao Ge, Shenghua Liu +7
2026-08-18
本文发现视觉语言模型在复杂视觉场景中注意力模式与性能的关系,并提出了一种无需训练的对比注意力精细化方法CARVE,通过像素级注意力对比提取任务相关视觉信号,显著提升开源模型推理性能。
Fuxiang Huang, Jiayi Zhu +21
2026-08-18
VersaMammo是一个针对乳腺X线摄影的多功能基础模型,通过大规模多机构数据集和两阶段预训练策略,在涵盖92项临床任务的综合基准上取得领先性能,展现出卓越的泛化能力。
Soroush Mehraban, Vida Adeli +5
2026-08-18
PickStyle 是一种视频风格迁移框架,通过低秩适配器和合成训练数据,实现了时间一致、风格忠实且内容保留的视频转换,优于现有基线。
Zhang Chen, Shuai Wan +3
2026-08-18
REFINE框架通过一种免渲染的基元重要性度量,利用解析近似的海森场量化移除基元的感知误差,从而在维持渲染质量的同时,将剪枝计算复杂度降低3000倍,设备延迟加速约20倍。