微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接后用系统浏览器访问。
1 / 24
:fire: 不只是 Token 流:Solon AI 4.1 的语义化聊天事件
Solon AI 4.1升级流式接口,分离语义化聊天事件类型
- 支持正文、思考过程、工具参数等8类语义化事件分离传输
- 解决传统Token流中过程数据与最终结果混杂问题
- 避免供应商协议细节泄露至UI、Agent及网关
RSS 官方收录 · 可信分层展示
$\tau^\tau$-Bench: An Environment for End-To-End, Realistic Agent Construction
新基准τ^τ-Bench测试AI编码代理构建真实客服代理能力,仅23.9%通过率
- τ^τ-Bench首次模拟真实客户委托场景评估代理构建全流程
- 测试涵盖53项任务、4大领域,最强配置通过率仅23.9%
- 专家参考方案达82.2%,暴露AI在记录理解、客户沟通、架构实验三方面缺陷
RSS 官方收录 · 可信分层展示
Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
审计600个HybridQA问题,发现26.6%对象在BM25检索中丢失
- BM25在截断5时遗漏389个对象(26.6%)
- 混合检索+重排序仅遗漏14个(1.0%)
- 对象存在使精确匹配提升28.6–31.0分
RSS 官方收录 · 可信分层展示
Extremely Sparse Supervision Incentivizes Reasoning Ability
仅用0.05%生成token监督,Qwen3模型推理能力不降反升
- 极稀疏监督(每推理轨迹仅1-2个token)提升推理能力
- 在9种师生配置及数学、编程、PPO-RLVR任务中均有效
- 稀疏监督更贴近人类反思关键步骤的自然学习过程
RSS 官方收录 · 可信分层展示
Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection
新方法将Whisper幻觉转录率从31.31%降至2.44%,无需重训练
- 提出训练无关的推理时低秩投影法抑制Whisper幻觉转录
- 始终启用投影使幻觉率相对降低92.21%,门控启用兼顾语音识别准确率
- 在LibriSpeech上门控版词错误率仅增0.33–4.39个百分点
RSS 官方收录 · 可信分层展示
La Agente \'Optima: Towards Agentic Self-Driving Laboratories
La Agente 'Optima'实现全自动闭环实验优化,5天将流化学产率从30%提升至59%
- 'Optima'构建并监督贝叶斯优化流程,保持持久优化状态
- 在接触角实验中识别并纠正中途测量故障,推断目标不可达
- 五日多目标流化学实验23轮迭代,产率提升29个百分点
RSS 官方收录 · 可信分层展示
IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径
速卖通Brand+携9大中国品牌亮相IFA,AI硬件销售额同比增100%
- 速卖通Brand+成‘出海四小龙’中首个参展IFA的平台
- 德法波等11国品牌渗透率超50%
- 欧洲仓9月开仓,预计降仓配成本10%
RSS 官方收录 · 可信分层展示
IFA新面孔:速卖通Brand+携中国品牌登场,解锁品牌出海新路径
速卖通Brand+携9大中国科技品牌首登IFA,成唯一参展跨境电商平台
- 速卖通是出海四小龙中首个亮相IFA的跨境电商平台
- 1-7月速卖通AI硬件出海同比增长100%,欧盟8月销售额同比增97%
- Brand+在德法等11国品牌销售额渗透率超50%,德国仓9月中旬启用
RSS 官方收录 · 可信分层展示
IPGeoAI: Transformer-Based Geolocation with LLM Semantic Fusion
IPGeoAI实现城市级IP定位,准确率提升6%,覆盖100%流量
- Transformer架构将IP定位转为序列建模任务
- 零样本LLM提取AS描述语义特征并融合进模型
- 离线测试覆盖20万城市,城市级精度超头部厂商
RSS 官方收录 · 可信分层展示
From Answers to Interpretations: Rethinking Ambiguity-Induced Aleatoric Uncertainty Estimation in LLMs
新方法直接从解释空间估算LLM歧义性偶然不确定性,AUROC提升至63.34,计算成本降4-26倍
- 提出仅用输入澄清(不生成答案)估算歧义性偶然不确定性
- 在三基准测试中AUROC达63.34,高于基线60.85
- 输出token减少4-26倍,API调用减少2.2-3.5倍
RSS 官方收录 · 可信分层展示
Data-Driven Discovery of Composition-Dependent Constitutive Models for Hyperelasticity and Viscoelasticity of Digital Materials
多材料3D打印数字材料的率相关本构模型数据驱动发现
- 基于Bergström-Boyce模型构建多材料数据驱动本构框架
- 用神经微分方程自动构建polyconvex应变能函数
- 通过多速率单轴压缩实验验证跨组分率相关性与热力学一致性
RSS 官方收录 · 可信分层展示
Towards a universal language of concepts: A survey
程序或成人类概念的通用表达语言
- 人类靠结构化知识实现小样本概念学习
- 程序被提出作为概念的通用表征形式
- 综述评估了程序表征在概念学习模型中的作用
RSS 官方收录 · 可信分层展示
MaxKernel: Agentic Kernel Generation for TPUs
MaxKernel开源多智能体系统,为TPU自动生成高性能定制内核
- 支持人机协同、全自动及图搜索三种TPU内核开发范式
- 基于50个JaxBench任务及真实模型工作负载验证
- 生成内核性能媲美专家手工调优
RSS 官方收录 · 可信分层展示
文章频道 - 2026中秋礼盒大赏征集,快快来!
2026中秋礼盒大赏即日起征集,9月18日截止
- 面向企业征集定制中秋礼盒实拍作品
- 需提供高清无水印照片及200字内介绍
- 礼盒须体现企业文化,非市售商品
RSS 官方收录 · 可信分层展示
项目频道 - 天猫×拉宏桑:错不起,上天猫就对了
天猫开学季联合拉宏桑,降低年轻人试错成本
- 天猫开学季提供品牌保障、货多、价低、品新
- 拉宏桑以大实话解构盲目试错,倡导理性消费
- 项目全程‘试对’:客户、导演、主演等均未真实犯错
RSS 官方收录 · 可信分层展示
EXCLUSIVE: Access to Lacoste’s Latest Capsule Requires Getting a Room
Hoxton酒店与Lacoste联名胶囊系列限量发售
- Hoxton酒店与Lacoste推出联名胶囊系列
- 合作艺术家为Michael McGregor
- 系列为限量版
RSS 官方收录 · 可信分层展示
4 Key Takeaways From Tokyo Fashion Week SS27
东京时装周SS27聚焦国际新锐设计师,本土新兴力量外流致日程显稀疏
- SS27日程因本土新兴设计师外流而显得稀疏
- JFWO借此机会重点推介国际设计人才
- 本地设计师参展减少成本季显著现象
RSS 官方收录 · 可信分层展示
Florida Bars Undocumented Students from Attending Public Universities
佛罗里达州禁止无证移民学生就读公立大学
- 该政策自2026年秋季学期起生效
- 适用于所有佛州公立大学系统院校
- 影响对象为无合法居留身份的在读及新生
RSS 官方收录 · 可信分层展示
OPINION: Arts education can change lives, but we must invest in people who make it possible
教学艺术家让艺术教育落地,但需稳定投入支持其长期驻校
- 教学艺术家是职业艺术家,与教师合作将艺术带入公立学校
- 他们关注学生优势而非缺陷,重视创造力、冒险精神等被传统课堂忽视的能力
- 长期驻校的教学艺术家能深化师生关系,使艺术教育影响持续放大
RSS 官方收录 · 可信分层展示
微软将人工智能治理从政策层面转向运行时执行
微软将AI治理从政策制定转向实时运行时执行
- AI治理重心由书面政策转向系统级实时控制
- 运行时执行指在AI模型部署后动态监管其行为
- 此举标志微软AI安全实践进入操作化新阶段
RSS 官方收录 · 可信分层展示
王兴兴上市后首次公开演讲:机器人真正爆发要等两个「80%时刻」丨WRC 2026
王兴兴提出机器人爆发需达两个80%:80%陌生场景中完成80%任务
- 机器人规模化落地核心瓶颈是泛化能力,非单点动作性能
- 物理AI自进化闭环可替代人工微调,实现研发-仿真-测试自主迭代
- 量产级载人机甲、实时语音生成动作、会议室整理等场景已落地验证
RSS 官方收录 · 可信分层展示
What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
多 harness RL 中,评估环境影响求解率超训练方法4倍,分组规则差异不显著
- 评估harness主导性能,使求解率从2.14%升至9.27%,提升4.3倍
- Within与Cross分组规则在预留harness上差异仅+0.25pp,无统计显著性
- Cross分组无法提升跨harness能力,信用分配仍绑定具体harness环境
RSS 官方收录 · 可信分层展示
BioSync: Transformer-Based Cross-Modal Fusion for a Multimodal Physiological Digital Biomarker
BioSync模型融合多模态生理数据,生成连续数字生物标志物BSI,AUC达0.928
- BioSync提出BSI指数,整合心率变异性、脑电、活动量与语音四模态数据
- 在认知衰退队列中BSI AUC达0.928,优于特征拼接基线(0.926)
- BSI与潜在疾病严重度高度相关(r=0.91和r=0.68)
RSS 官方收录 · 可信分层展示
Rethinking Indirect Prompt Injection as a Test-Time Search Problem
将间接提示注入重新定义为测试时搜索问题,揭示工具型AI新安全风险
- 提出间接提示注入是任务相关攻击面的测试时搜索问题
- 设计具身攻击者进行环境侦察、策略推理和自适应评估
- 发现攻击者算力提升可增强漏洞发现,策略管理避免冗余搜索
RSS 官方收录 · 可信分层展示
上滑下一条
上滑 · j/k · m/u · h 隐藏 · a 稍后 · o 原文 · e 详情 · t 今日 · i 模式 · f 搜索