大模型arXiv cs.AI可信度 98%
本文提出光谱流证书(SFCs),从图的归一化拉普拉斯矩阵计算单个标量,无需模型训练或标注数据,即可在数秒内预测图神经网络在给定消息传递深度下的长距离准确率。实验表明,SFCs在合成图和真实分子图上的解释力超过90%,比传统结构统计量(如平均有效电阻、图直径)解释的方差高出两倍以上,可有效在训练前筛选出受拓扑限制的图。
填补了在训练前低成本评估图拓扑是否限制长距离信息传播的空白,避免在拓扑不可行的图上浪费训练资源。
大模型arXiv cs.AI可信度 98%
FlowEvo提出一种无需训练的框架,通过工作流到技能编译、技能到工作流反馈和技能筛选三个机制,使LLM智能体能够在不更新模型参数的情况下,持续积累和复用任务求解能力。在ALFWorld上成功率达82.8%,比最强基线高23.6个百分点,且token用量不到最高效基线的一半。
该工作解决了LLM智能体在执行过程中发现的临时有用流程无法系统性地惠及未来任务的问题,通过将成功轨迹编译为可复用技能记录,实现了智能体的自我进化,显著提升了准确率和成本效率。
大模型arXiv cs.AI可信度 98%
该研究提出FlowGuard框架,通过监控多模态大语言模型内部跨模态一致性来检测对抗性攻击,利用部分信息分解量化跨模态冗余、协同和主导度,在仅用良性数据训练下将攻击成功率从>90%降至<15%,且效用损失<3%、延迟降低6倍。
多模态AI面临单模态系统不存在的跨模态攻击面,现有孤立检查模态或检查输入输出的防御方法脆弱且昂贵,FlowGuard提供了一种轻量级、高效的推理时防御新思路。
大模型arXiv cs.AI可信度 97%
AgentKVShift 是一种免训练的探针引导 KV 残差修正方法,针对智能体记忆系统设计,通过估算每个记忆单元共享的偏移量来校正所有复用 token,从而在仅刷新 10-30% 缓存的情况下实现接近全量重计算的性能,预填充速度提升 2-3.5 倍,且与 KV 缓存量化正交兼容。
该方法解决了 LLM 智能体系统中因记忆检索触发全量 KV 编码而导致的预填充延迟瓶颈,尤其适用于结构化智能体记忆场景,相比现有 RAG 风格的 KV 复用方法有显著性能提升。
大模型arXiv cs.AI可信度 97%
准确的延迟预测对于在异构边缘设备上部署大型语言模型(LLM)至关重要,其推理延迟受模型架构、提示行为、运行时后端、硬件利用率、动态电压频率调整(DVFS)及热变化等多重因素影响。本文提出了一种运行时感知延迟预测框架,通过门控预测模型融合静态描述符与动态硬件遥测数据,将推理分解为预填充和解码阶段,并在多类设备上验证了有效性。实验表明该框架能提升延迟预测精度,并通过轻量级校准支持跨设备迁移,降低性能分析成本。
该框架解决了LLM在异构边缘设备部署时延迟预测不准的痛点,通过运行时感知和轻量校准显著提升预测精度,直接降低手动测试成本,推动LLM在边缘场景的实用化。
大模型arXiv cs.AI可信度 97%
本文提出HierFlow,一种无需训练、测试时分层搜索架构,通过拓扑与执行交织的搜索范式自动化智能体工作流设计,结合反馈引导的拓扑调整和MCTS启发的子工作流优化,以及智能门控模块提高效率。实验表明在问答、数学推理和代码生成基准上,HierFlow无需额外训练开销即可实现高质量结果与计算效率的最佳平衡。
该方法解决了现有工作流自动化因组合搜索空间大而依赖离线训练、资源消耗高的问题,提出了一种训练依赖低、测试时自适应的高效框架。
大模型arXiv cs.AI可信度 97%
该论文分析了公共空间手势交互系统从帧级识别到事件级确认的鸿沟,通过8条工程修复记录提取20个故障实例,归纳为6个非排他性故障类别,并提出事件级运行时抽象,旨在弥合识别与交互之间的差距。
该研究揭示了部署系统与学术评估之间的关键差距,即帧级准确率不保证交互成功率,为实际系统故障诊断与修复提供了结构化的分类框架和抽象方法。
大模型arXiv cs.AI可信度 74%
TILT是一种通过测试时奖励对齐实现组合文生图的免训练框架,它使用模型内在奖励来处理联合分布与单概念分布之间的重叠模式,通过KL约束目标函数和两种引导策略的混合方法,在T2ICompBench上提升了组合对齐且保持了图像质量。
该方法无需外部监督或奖励模型,以训练自由的方式解决了扩散模型在复杂组合提示下生成不忠实的问题,为组合生成提供了一种新的内在对齐思路。