Skip to main content

XMT

短闻

信流 · 上滑连读 · 来源可核

搜索 稍后
1 / 24
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

$\tau^\tau$-Bench: An Environment for End-To-End, Realistic Agent Construction

新基准τ^τ-Bench测试AI编码代理构建真实客服代理能力,仅23.9%通过率

  • τ^τ-Bench首次模拟真实客户委托场景评估代理构建全流程
  • 测试涵盖53项任务、4大领域,最强配置通过率仅23.9%
  • 专家参考方案达82.2%,暴露AI在记录理解、客户沟通、架构实验三方面缺陷

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines

审计600个HybridQA问题,发现26.6%对象在BM25检索中丢失

  • BM25在截断5时遗漏389个对象(26.6%)
  • 混合检索+重排序仅遗漏14个(1.0%)
  • 对象存在使精确匹配提升28.6–31.0分

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Extremely Sparse Supervision Incentivizes Reasoning Ability

仅用0.05%生成token监督,Qwen3模型推理能力不降反升

  • 极稀疏监督(每推理轨迹仅1-2个token)提升推理能力
  • 在9种师生配置及数学、编程、PPO-RLVR任务中均有效
  • 稀疏监督更贴近人类反思关键步骤的自然学习过程

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection

新方法将Whisper幻觉转录率从31.31%降至2.44%,无需重训练

  • 提出训练无关的推理时低秩投影法抑制Whisper幻觉转录
  • 始终启用投影使幻觉率相对降低92.21%,门控启用兼顾语音识别准确率
  • 在LibriSpeech上门控版词错误率仅增0.33–4.39个百分点

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

La Agente \'Optima: Towards Agentic Self-Driving Laboratories

La Agente 'Optima'实现全自动闭环实验优化,5天将流化学产率从30%提升至59%

  • 'Optima'构建并监督贝叶斯优化流程,保持持久优化状态
  • 在接触角实验中识别并纠正中途测量故障,推断目标不可达
  • 五日多目标流化学实验23轮迭代,产率提升29个百分点

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 雷锋网 人工智能 20″

IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径

速卖通Brand+携9大中国品牌亮相IFA,AI硬件销售额同比增100%

  • 速卖通Brand+成‘出海四小龙’中首个参展IFA的平台
  • 德法波等11国品牌渗透率超50%
  • 欧洲仓9月开仓,预计降仓配成本10%

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 雷锋网 人工智能 45″

IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径

速卖通Brand+携9大中国科技品牌首登IFA,成唯一参展跨境电商平台

  • 速卖通是出海四小龙中首个亮相IFA的跨境电商平台
  • 1-7月速卖通AI硬件出海同比增长100%,欧盟8月销售额同比增97%
  • Brand+在德法等11国品牌销售额渗透率超50%,德国仓9月中旬启用

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

IPGeoAI: Transformer-Based Geolocation with LLM Semantic Fusion

IPGeoAI实现城市级IP定位,准确率提升6%,覆盖100%流量

  • Transformer架构将IP定位转为序列建模任务
  • 零样本LLM提取AS描述语义特征并融合进模型
  • 离线测试覆盖20万城市,城市级精度超头部厂商

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

From Answers to Interpretations: Rethinking Ambiguity-Induced Aleatoric Uncertainty Estimation in LLMs

新方法直接从解释空间估算LLM歧义性偶然不确定性,AUROC提升至63.34,计算成本降4-26倍

  • 提出仅用输入澄清(不生成答案)估算歧义性偶然不确定性
  • 在三基准测试中AUROC达63.34,高于基线60.85
  • 输出token减少4-26倍,API调用减少2.2-3.5倍

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Data-Driven Discovery of Composition-Dependent Constitutive Models for Hyperelasticity and Viscoelasticity of Digital Materials

多材料3D打印数字材料的率相关本构模型数据驱动发现

  • 基于Bergström-Boyce模型构建多材料数据驱动本构框架
  • 用神经微分方程自动构建polyconvex应变能函数
  • 通过多速率单轴压缩实验验证跨组分率相关性与热力学一致性

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 38″

Towards a universal language of concepts: A survey

程序或成人类概念的通用表达语言

  • 人类靠结构化知识实现小样本概念学习
  • 程序被提出作为概念的通用表征形式
  • 综述评估了程序表征在概念学习模型中的作用

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

MaxKernel: Agentic Kernel Generation for TPUs

MaxKernel开源多智能体系统,为TPU自动生成高性能定制内核

  • 支持人机协同、全自动及图搜索三种TPU内核开发范式
  • 基于50个JaxBench任务及真实模型工作负载验证
  • 生成内核性能媲美专家手工调优

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 InfoQ 中文 人工智能 微软 6″

微软将人工智能治理从政策层面转向运行时执行

微软将AI治理从政策制定转向实时运行时执行

  • AI治理重心由书面政策转向系统级实时控制
  • 运行时执行指在AI模型部署后动态监管其行为
  • 此举标志微软AI安全实践进入操作化新阶段

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 雷锋网 人工智能 宇树科技 45″

王兴兴上市后首次公开演讲:机器人真正爆发要等两个「80%时刻」丨WRC 2026

王兴兴提出机器人爆发需达两个80%:80%陌生场景中完成80%任务

  • 机器人规模化落地核心瓶颈是泛化能力,非单点动作性能
  • 物理AI自进化闭环可替代人工微调,实现研发-仿真-测试自主迭代
  • 量产级载人机甲、实时语音生成动作、会议室整理等场景已落地验证

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

多 harness RL 中,评估环境影响求解率超训练方法4倍,分组规则差异不显著

  • 评估harness主导性能,使求解率从2.14%升至9.27%,提升4.3倍
  • Within与Cross分组规则在预留harness上差异仅+0.25pp,无统计显著性
  • Cross分组无法提升跨harness能力,信用分配仍绑定具体harness环境

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

BioSync: Transformer-Based Cross-Modal Fusion for a Multimodal Physiological Digital Biomarker

BioSync模型融合多模态生理数据,生成连续数字生物标志物BSI,AUC达0.928

  • BioSync提出BSI指数,整合心率变异性、脑电、活动量与语音四模态数据
  • 在认知衰退队列中BSI AUC达0.928,优于特征拼接基线(0.926)
  • BSI与潜在疾病严重度高度相关(r=0.91和r=0.68)

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Rethinking Indirect Prompt Injection as a Test-Time Search Problem

将间接提示注入重新定义为测试时搜索问题,揭示工具型AI新安全风险

  • 提出间接提示注入是任务相关攻击面的测试时搜索问题
  • 设计具身攻击者进行环境侦察、策略推理和自适应评估
  • 发现攻击者算力提升可增强漏洞发现,策略管理避免冗余搜索

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

4位量化致荧光寿命参数估测误差激增300倍,揭示循环网络状态写回机制关键影响

  • 4比特状态存储使τ1、τ2估测误差分别增加70倍和300倍
  • 错误源于微小更新低于写入阈值导致状态冻结
  • 误差反馈等机制可跨时间传递信息并恢复精度

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

ResLearn-XR: Residual Learning for Network Traffic and Quality-of-Experience-Aware Modeling in Extended Reality

ResLearn-XR框架提升XR流量预测与QoE风险评估精度,SMAPE分别降低17.84%和87.8%

  • 提出两阶段残差学习结构,适配突发非平稳XR流量
  • QoE分支引入因果特征构造模块DDA,支持加密流量分析
  • 构建首个配对XR流量与用户报告QoE标签的数据集

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 InfoQ 中文 人工智能 6″

传统企业 AI 转型的最短路径,藏在研发部门

传统企业AI转型最快路径在研发部门

  • AI转型起点应设在研发部门而非管理层
  • 研发部门直接对接技术落地与业务痛点
  • 已有案例显示研发主导转型周期缩短40%

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

PerfReasoning: How Well Do LLMs Reason on Hardware Performance?

PerfReasoning基准测试揭示LLM硬件性能推理能力:最强闭源模型达90%+,开源模型最高82.4%

  • PerfReasoning评估LLM对计算、数据复用与访存的结构化性能推理能力
  • 最强闭源模型Q&A准确率超90%,最佳开源模型为82.4%
  • 模型自动生成性能模型代码难度大,除GPT-5.6 Sol外其余配置平均通过率低于15%

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

HarvestBench测试9个LLM代理对动物生命的经济权衡,杀戮率从0.4%到98.8%不等

  • 9个模型在农场模拟中面临是否付费绕行动物的决策,共7201次定价选择
  • 动物阻挡时,模型可直行(零成本)或付费绕行;杀戮率与模型能力无关
  • 道德提示使5/6推理模型杀戮率降至6%以下,移除后全部升至84%以上

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets

前沿大模型能力提升反致金融系统风险上升,因行为趋同形成不可分散风险

  • 前沿LLM能力越强,交易行为相关性越高
  • 准确信息下多智能体可降市场风险
  • 共享错误信息时行为趋同反成风险源

RSS 官方收录 · 可信分层展示

详情 原文 分享图
Aggregate AI 摘要 arXiv cs.AI 人工智能 45″

Corporate Language Model (CLM): Transforming Tacit and Fragmented Enterprise Knowledge into a Sovereign, Auditable, and Executable Corporate Intelligence Layer

CLM将企业隐性知识转化为可审计、可执行的主权智能层

  • CLM框架整合结构化与隐性知识,构建本体驱动的企业智能基础
  • 五大能力平面与四大架构支柱支持可解释推理与受控执行
  • 巴西三级医院实证:CLM在LGPD合规下完成六阶段中的三阶段落地

RSS 官方收录 · 可信分层展示

详情 原文 分享图