📚 学科:eess.* (电子工程与系统科学)
本周亮点:本次选择的论文展示了电子工程与系统科学在多个前沿领域的应用:从提升大模型合并效率的 MergePipe 框架,到增强临床 MRI 自动化流程可靠性的 BCER 智能体;在多模态生成方面,提出了关注物理一致性的视听生成基准。此外,还涵盖了针对脑部应用的简化电学模型,以及在"月船3号"探月任务中得到实证的实时重定位导航策略。这些研究体现了从算法优化到航天工程应用的广泛跨度,重点关注系统的可扩展性、可靠性与实时性。
Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging
权重空间模型合并通常被表述为对 Checkpoint 的代数运算,但在大语言模型(LLM)规模下,资源瓶颈通常在于必须读取的专家权重集。我们引入了 MergePipe,这是一个预算感知型的执行层,它将 LLM 合并抽象为一个"专家访问集"问题:在给定的合并算子和共享权重坐标系下的 Checkpoint 系列中,在显式 I/O 预算内选择要访问的专家 delta 块。MergePipe 将专家读取 I/O 减少了高达一个数量级,并实现了高达 11 倍的加速。
BCER Agent: Reliable Long-Horizon MRI Workflow Execution via Compilation, Artifact Binding, and Bounded Local Recovery
引入了 BCER(Brain-Cerebellum-Extremity-Reflector),一种旨在实现可靠长程 MRI 工作流执行的控制器架构。BCER 将高级规划与执行解耦,并提供有界的局部恢复。在涵盖大脑、前列腺和心脏任务的多器官 MRI 基准上,BCER 在端到端执行方面取得了持续改进,在长链工作流中增益最为显著。
Benchmarking Single-Factor Physical Video-to-Audio Generation
引入了 FlatSounds 基准,通过受控的反事实对和单视频模式测试来审计 V2A 模型的物理推理能力。评估揭示了一个持续的权衡:模型更多地依赖文本提示词而非视觉流来推断物理和语义。结果强调有必要从追求音频质量转向直接从像素学习物理过程。
A Lumped-Element Electrical Model of the Human Head for Brain-Oriented Applications
提出了一种用于电准静态(EQS)头部建模的紧凑替代电路。考虑了三层壳几何结构(大脑、颅骨、头皮),每一层通过径向和切向路径建模,实现为 RC 分支。频率相关的组织电导率和介电常数被映射为色散电阻和电容元件。忽略色散和电容路径可能导致在所考虑的频率范围内高估头皮电位。
Real-Time Retargeting Using Controllability Boundary for Chandrayaan-3 Lunar Landing
介绍了为"月船3号"(Chandrayaan-3)月球着陆任务开发的实时重定位导航策略。重定位策略利用可控边界的凸表示,实现了快速可行性检查和实时目标更新。这代表了数据驱动重定位框架在实际月球着陆任务中的首次应用。
📚 学科:cs.* (计算机科学)
本周亮点:计算机科学领域本周的研究焦点集中在多模态生成与智能体可靠性上。Archon 模型实现了数字人生成的全模态统一;Veda 框架通过蒸馏稀疏注意力显著加速了视频扩散模型。针对智能体,研究者探讨了多组件 LLM 的全局不一致性问题及其修正方法。此外,GAVIS 提升了 3D 高斯泼溅的主动制图精度,而一份量化的案例研究探讨了物理学家监督 AI 智能体开发科学软件的现实局限。
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
提出了 Archon,一个全预训练的以人为中心的多模态模型。Archon 通过特定模态的分词器统一了七种模态,并使用在同步模态和 72 个任务上预训练的原生自回归统一多模态模型来建模联合分布。引入了内存高效的语义视频重参数化,在保持微观动态的同时实现了 4 倍的 Token 减少。还提出了"模态思考"(Thinking in Modality),将复杂的跨模态任务分解为分步思维链。实验证明 Archon 在各种数字人生成任务中达到了优越性能。
Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software
呈现了一个量化的案例研究:一位物理学家在 12 个工作日内监督一个 AI 编码智能体构建 JAX 中的微分摄动理论模块 CLAX-PT。记录并分类了 15 次监督事件。智能体自主解决了其中 10 个,但有 3 个避开了自动化测试。研究发现,只有注入物理概念才能触发架构重新设计。结果表明,监督设计而非模型能力决定了智能体输出的可信度。
Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field
提出了 GAVIS,一个用于 3D 高斯泼溅中不确定性量化和主动制图的框架。引入了一种高效的方法来量化 3DGS 中的可见性场,定义为每个粒子相对于训练视图的各向异性可见性,并使用球谐函数表示。该可见性场被集成到基于贝叶斯网络的不确定性感知 3DGS 光栅化器中,实现了合成视图的实时(200 FPS)不确定性量化。
Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents
将多组件 LLM 智能体"局部连贯、全局不连贯"的失败正式化为组合残差 eps*。实验中发现 33-94% 的集群存在 eps* > 0 的情况。提出了一种分层 Boyle-Dykstra 投影来确定性地修复组合,并提供了一种顺序连贯性监控方法。研究还发现,检索、分区感知提示等直观的 LLM 侧缓解措施往往会失效或产生退化。
Veda: Scalable Video Diffusion via Distilled Sparse Attention
提出了 Veda,一个蒸馏稀疏注意力框架。Veda 将块选择表述为从全注意力中显式重建的问题,集成了统计感知评分和头感知分块。一个硬件高效的跳块内核将理论稀疏度转化为实际加速。在 Waver 和 Wan2.1 等大模型上的实验表明,Veda 实现了 5.1 倍的端到端加速,且生成质量无明显下降。