微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开 ,或复制链接后用系统浏览器访问。
综合
官方
企业
汇聚
1 / 24
$\tau^\tau$-Bench: An Environment for End-To-End, Realistic Agent Construction
新基准τ^τ-Bench测试AI编码代理构建真实客服代理能力,仅23.9%通过率
τ^τ-Bench首次模拟真实客户委托场景评估代理构建全流程
测试涵盖53项任务、4大领域,最强配置通过率仅23.9%
专家参考方案达82.2%,暴露AI在记录理解、客户沟通、架构实验三方面缺陷
RSS 官方收录 · 可信分层展示
Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
审计600个HybridQA问题,发现26.6%对象在BM25检索中丢失
BM25在截断5时遗漏389个对象(26.6%)
混合检索+重排序仅遗漏14个(1.0%)
对象存在使精确匹配提升28.6–31.0分
RSS 官方收录 · 可信分层展示
Extremely Sparse Supervision Incentivizes Reasoning Ability
仅用0.05%生成token监督,Qwen3模型推理能力不降反升
极稀疏监督(每推理轨迹仅1-2个token)提升推理能力
在9种师生配置及数学、编程、PPO-RLVR任务中均有效
稀疏监督更贴近人类反思关键步骤的自然学习过程
RSS 官方收录 · 可信分层展示
Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection
新方法将Whisper幻觉转录率从31.31%降至2.44%,无需重训练
提出训练无关的推理时低秩投影法抑制Whisper幻觉转录
始终启用投影使幻觉率相对降低92.21%,门控启用兼顾语音识别准确率
在LibriSpeech上门控版词错误率仅增0.33–4.39个百分点
RSS 官方收录 · 可信分层展示
La Agente \'Optima: Towards Agentic Self-Driving Laboratories
La Agente 'Optima'实现全自动闭环实验优化,5天将流化学产率从30%提升至59%
'Optima'构建并监督贝叶斯优化流程,保持持久优化状态
在接触角实验中识别并纠正中途测量故障,推断目标不可达
五日多目标流化学实验23轮迭代,产率提升29个百分点
RSS 官方收录 · 可信分层展示
IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径
速卖通Brand+携9大中国品牌亮相IFA,AI硬件销售额同比增100%
速卖通Brand+成‘出海四小龙’中首个参展IFA的平台
德法波等11国品牌渗透率超50%
欧洲仓9月开仓,预计降仓配成本10%
RSS 官方收录 · 可信分层展示
IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径
速卖通Brand+携9大中国科技品牌首登IFA,成唯一参展跨境电商平台
速卖通是出海四小龙中首个亮相IFA的跨境电商平台
1-7月速卖通AI硬件出海同比增长100%,欧盟8月销售额同比增97%
Brand+在德法等11国品牌销售额渗透率超50%,德国仓9月中旬启用
RSS 官方收录 · 可信分层展示
IPGeoAI: Transformer-Based Geolocation with LLM Semantic Fusion
IPGeoAI实现城市级IP定位,准确率提升6%,覆盖100%流量
Transformer架构将IP定位转为序列建模任务
零样本LLM提取AS描述语义特征并融合进模型
离线测试覆盖20万城市,城市级精度超头部厂商
RSS 官方收录 · 可信分层展示
From Answers to Interpretations: Rethinking Ambiguity-Induced Aleatoric Uncertainty Estimation in LLMs
新方法直接从解释空间估算LLM歧义性偶然不确定性,AUROC提升至63.34,计算成本降4-26倍
提出仅用输入澄清(不生成答案)估算歧义性偶然不确定性
在三基准测试中AUROC达63.34,高于基线60.85
输出token减少4-26倍,API调用减少2.2-3.5倍
RSS 官方收录 · 可信分层展示
Data-Driven Discovery of Composition-Dependent Constitutive Models for Hyperelasticity and Viscoelasticity of Digital Materials
多材料3D打印数字材料的率相关本构模型数据驱动发现
基于Bergström-Boyce模型构建多材料数据驱动本构框架
用神经微分方程自动构建polyconvex应变能函数
通过多速率单轴压缩实验验证跨组分率相关性与热力学一致性
RSS 官方收录 · 可信分层展示
Towards a universal language of concepts: A survey
程序或成人类概念的通用表达语言
人类靠结构化知识实现小样本概念学习
程序被提出作为概念的通用表征形式
综述评估了程序表征在概念学习模型中的作用
RSS 官方收录 · 可信分层展示
MaxKernel: Agentic Kernel Generation for TPUs
MaxKernel开源多智能体系统,为TPU自动生成高性能定制内核
支持人机协同、全自动及图搜索三种TPU内核开发范式
基于50个JaxBench任务及真实模型工作负载验证
生成内核性能媲美专家手工调优
RSS 官方收录 · 可信分层展示
微软将人工智能治理从政策层面转向运行时执行
微软将AI治理从政策制定转向实时运行时执行
AI治理重心由书面政策转向系统级实时控制
运行时执行指在AI模型部署后动态监管其行为
此举标志微软AI安全实践进入操作化新阶段
RSS 官方收录 · 可信分层展示
王兴兴上市后首次公开演讲:机器人真正爆发要等两个「80%时刻」丨WRC 2026
王兴兴提出机器人爆发需达两个80%:80%陌生场景中完成80%任务
机器人规模化落地核心瓶颈是泛化能力,非单点动作性能
物理AI自进化闭环可替代人工微调,实现研发-仿真-测试自主迭代
量产级载人机甲、实时语音生成动作、会议室整理等场景已落地验证
RSS 官方收录 · 可信分层展示
What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
多 harness RL 中,评估环境影响求解率超训练方法4倍,分组规则差异不显著
评估harness主导性能,使求解率从2.14%升至9.27%,提升4.3倍
Within与Cross分组规则在预留harness上差异仅+0.25pp,无统计显著性
Cross分组无法提升跨harness能力,信用分配仍绑定具体harness环境
RSS 官方收录 · 可信分层展示
BioSync: Transformer-Based Cross-Modal Fusion for a Multimodal Physiological Digital Biomarker
BioSync模型融合多模态生理数据,生成连续数字生物标志物BSI,AUC达0.928
BioSync提出BSI指数,整合心率变异性、脑电、活动量与语音四模态数据
在认知衰退队列中BSI AUC达0.928,优于特征拼接基线(0.926)
BSI与潜在疾病严重度高度相关(r=0.91和r=0.68)
RSS 官方收录 · 可信分层展示
Rethinking Indirect Prompt Injection as a Test-Time Search Problem
将间接提示注入重新定义为测试时搜索问题,揭示工具型AI新安全风险
提出间接提示注入是任务相关攻击面的测试时搜索问题
设计具身攻击者进行环境侦察、策略推理和自适应评估
发现攻击者算力提升可增强漏洞发现,策略管理避免冗余搜索
RSS 官方收录 · 可信分层展示
When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference
4位量化致荧光寿命参数估测误差激增300倍,揭示循环网络状态写回机制关键影响
4比特状态存储使τ1、τ2估测误差分别增加70倍和300倍
错误源于微小更新低于写入阈值导致状态冻结
误差反馈等机制可跨时间传递信息并恢复精度
RSS 官方收录 · 可信分层展示
ResLearn-XR: Residual Learning for Network Traffic and Quality-of-Experience-Aware Modeling in Extended Reality
ResLearn-XR框架提升XR流量预测与QoE风险评估精度,SMAPE分别降低17.84%和87.8%
提出两阶段残差学习结构,适配突发非平稳XR流量
QoE分支引入因果特征构造模块DDA,支持加密流量分析
构建首个配对XR流量与用户报告QoE标签的数据集
RSS 官方收录 · 可信分层展示
传统企业 AI 转型的最短路径,藏在研发部门
传统企业AI转型最快路径在研发部门
AI转型起点应设在研发部门而非管理层
研发部门直接对接技术落地与业务痛点
已有案例显示研发主导转型周期缩短40%
RSS 官方收录 · 可信分层展示
PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
PerfReasoning基准测试揭示LLM硬件性能推理能力:最强闭源模型达90%+,开源模型最高82.4%
PerfReasoning评估LLM对计算、数据复用与访存的结构化性能推理能力
最强闭源模型Q&A准确率超90%,最佳开源模型为82.4%
模型自动生成性能模型代码难度大,除GPT-5.6 Sol外其余配置平均通过率低于15%
RSS 官方收录 · 可信分层展示
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
HarvestBench测试9个LLM代理对动物生命的经济权衡,杀戮率从0.4%到98.8%不等
9个模型在农场模拟中面临是否付费绕行动物的决策,共7201次定价选择
动物阻挡时,模型可直行(零成本)或付费绕行;杀戮率与模型能力无关
道德提示使5/6推理模型杀戮率降至6%以下,移除后全部升至84%以上
RSS 官方收录 · 可信分层展示
Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets
前沿大模型能力提升反致金融系统风险上升,因行为趋同形成不可分散风险
前沿LLM能力越强,交易行为相关性越高
准确信息下多智能体可降市场风险
共享错误信息时行为趋同反成风险源
RSS 官方收录 · 可信分层展示
Corporate Language Model (CLM): Transforming Tacit and Fragmented Enterprise Knowledge into a Sovereign, Auditable, and Executable Corporate Intelligence Layer
CLM将企业隐性知识转化为可审计、可执行的主权智能层
CLM框架整合结构化与隐性知识,构建本体驱动的企业智能基础
五大能力平面与四大架构支柱支持可解释推理与受控执行
巴西三级医院实证:CLM在LGPD合规下完成六阶段中的三阶段落地
RSS 官方收录 · 可信分层展示
上滑下一条
上滑 · j/k · m/u · h 隐藏 · a 稍后 · o 原文 · e 详情 · t 今日 · i 模式 · f 搜索