微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接后用系统浏览器访问。
1 / 24
通过分析 16900 次会话数据,看看 Claude Code、Codex、Cursor 各选了什么工具
分析16900次会话,对比Claude Code、Codex、Cursor三大编码Agent工具选择行为
- 基于5292个有效会话覆盖51个代码库和18个行业
- 实验让Agent直接实现任务而非仅提供建议
- 数据来自Armature公司对开发者工具增长的研究
RSS 官方收录 · 可信分层展示
开源项目维护者怒了:“用 AI 刷 PR 刷简历,请去别的地方”
开源维护者怒斥AI刷PR刷简历行为
- Neil Alexander发文谴责AI生成垃圾PR污染开源项目
- 一年来PR数量激增但质量下降,AI分析和修复建议泛滥
- 安全漏洞报告增多,常附带AI生成的低质修复建议
RSS 官方收录 · 可信分层展示
业内首个!“千问办公”推出“多人工作台”
千问办公推出业内首个多人工作台,支持百人在线协作
- 支持最多百人同时在线协作的AI网页生成与发布
- 具备角色权限、云端数据库、管理后台、在线发布四大能力
- 解决SaaS采购贵、定制开发慢的组织协作难题
RSS 官方收录 · 可信分层展示
Model Retirement Creates Reproducibility Risk in Biomedical AI Publications
42%的生物医学AI论文使用已退役或两年内将退役的商用大模型
- 8931次论文-模型引用中77.7%为商用闭源模型
- 42%涉及已退役或两年内将退役的模型
- 模型从发表到退役中位数为538天
RSS 官方收录 · 可信分层展示
SQL-Zero: Self-Evolving Text-to-SQL
SQL-Zero实现零标注训练Text-to-SQL模型,BIRD开发集提升6.6–7.3分
- 无需人工标注NL-SQL对即可训练高性能Text-to-SQL模型
- 采用挑战者-求解器自博弈框架,以数据库执行结果为唯一监督信号
- 在BIRD上零样本提升显著,且3B模型在Spider跨库迁移中表现更鲁棒
RSS 官方收录 · 可信分层展示
Train What You Deploy:Token-Faithful Post-Training of a Production Coding
C-DPPO新算法提升编码模型性能3.0分,保障训练与部署token一致性
- 提出 fidelity-aware 训练框架,确保原始prompt端到端采样
- 首创C-DPPO算法,提供TV距离双向认证与错误鲁棒策略掩码
- 在Baize5B/10B上实测TMax-100任务,稳定+3.0分超越标准DPPO
RSS 官方收录 · 可信分层展示
Predicting Spatiotemporal Mobile Sensing-Based PM2.5 Concentrations Using Low-Rank Adapted Spatially Attentive Graph Neural Network
印度苏拉特市移动传感PM2.5预测新模型R²达0.95
- 构建印度苏拉特市高分辨率移动传感PM2.5数据集
- 提出SA-GNN模型融合空间聚类与自适应图注意力机制
- SA-GNN在R²、RMSE、MAE上均优于LSTM等基线模型
RSS 官方收录 · 可信分层展示
ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies
ERPBench测试100个企业决策问题,揭示LLM在Solo与Arena两种竞争生态中排名差异显著
- ERPBench含六轮ERP仿真,覆盖定价、生产、采购等六大模块
- 在Solo生态中DeepSeek估值最高(252.29M),Arena生态中Gemini领先(263.95M)
- 两生态仅21/100问题选出相同任务级优胜模型,Gemini底排率从22%降至0%
RSS 官方收录 · 可信分层展示
英伟达发布开源工具 PAIR,可将家里闲置电脑变成私有 AI 集群
英伟达开源PAIR工具,将闲置电脑组建成私有AI集群
- PAIR支持局域网内多台设备协同本地AI推理
- 主要兼容英伟达RTX 20系及以上及苹果M4+芯片
- 基于Ollama和LM Studio等开发者熟悉工具链
RSS 官方收录 · 可信分层展示
内存短缺将继续推动消费电子产品价格上涨
DRAM价格一年涨五倍,消费电子价涨最高20%,短缺将持续至2027年
- DRAM合约价每季度涨10%-20%,一年内上涨五倍
- IDC称厂商提价最高达20%,手机内存成本最高增250美元
- 诺基亚等企业正 redesign 产品减内存用量,短缺预计持续至2027年
RSS 官方收录 · 可信分层展示
South Korea’s Hanwha develops tokenized securities platform on Avalanche as local regulation takes shape: report
South Korea’s Hanwha develops tokenized securities platform on Avalanche as local regulation takes shape: report
- South Korea’s Hanwha develops tokenized securities platform on Avalanche as local regulation takes shape: report
RSS 官方收录 · 可信分层展示
阿里前销售总监在美失踪逾半月后确认身亡;5天10万元!外国高管涌入中国“工厂游”;传DeepSeek计划采购16万颗昇腾芯片|AI周报
阿里前销售总监在美失踪逾半月后确认身亡
- 阿里前销售总监在美国失踪超15天后身亡
- 外国高管5天花费10万元赴华参加工厂游
- DeepSeek拟采购16万颗华为昇腾芯片
RSS 官方收录 · 可信分层展示
Hugging Face太重要,绝不能落入英伟达手中?黄仁勋:我本想让它独立,但有其他竞购者
黄仁勋称曾想让Hugging Face独立,但因其他竞购者介入未果
- 黄仁勋透露曾计划推动Hugging Face独立运营
- Hugging Face未被英伟达收购因存在其他竞购方
- Hugging Face被视作AI时代关键基础设施
RSS 官方收录 · 可信分层展示
业内首个!「千问办公」推出「多人工作台」
千问办公推业内首个多人工作台,支持百人实时协作
- 支持最多百人同时在线协作的AI生成网页
- 具备角色权限、云端数据库、管理后台、一键发布四大能力
- 覆盖活动组织、家校协同、企业协作等场景
RSS 官方收录 · 可信分层展示
Harness-agnostic detection and immunization of reward hacking in self-evolving language models
HackProbe新工具可无侵入检测并免疫大模型奖励黑客攻击,AUROC达0.763
- HackProbe通过双黑盒接口接入任意自演化循环,不访问权重或激活值
- 四项测试覆盖能力差距、发散检测、停滞与错误率,经Sidak校正输出校准p值
- 在四通道注入测试中,误报率从0.706降至0.434,免疫后净增能力5.2分
RSS 官方收录 · 可信分层展示
Continual Graph Memory for Adaptive Recommendation under Intent Drift
CGM-Rec框架实现冻结参数下的持续图记忆推荐,HR@1最高提升29.58%
- 提出CGM-Rec框架,含语义图记忆与情景经验记忆双组件
- 模型参数冻结,仅通过内存写入实现在线适应意图漂移
- 在Bundle数据集上HR@1较最强LLM基线提升29.58%
RSS 官方收录 · 可信分层展示
A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark
新基准DevRev NL2SQL含900个嵌套查询,提出成本感知型NL2SQL架构,准确率达91.7%
- 发布DevRev NL2SQL新基准:900个执行验证的嵌套结构查询
- 提出语义深度评分SDS,衡量分析推理深度,与模式无关
- 成本感知单生成式智能体架构,91.7%答案正确率,超次优基线54.6个百分点
RSS 官方收录 · 可信分层展示
Leveraging Imperfect Restoration for Data Availability Attack
提出新型数据可用性攻击IRP,图像质量与中毒效果双优
- IRP是面向监督学习和自监督学习的新型数据中毒方法
- 理论分析揭示CUDA梯度缺陷并改进类偏置策略
- IRP在8个基线和5种防御下均展现优越性
RSS 官方收录 · 可信分层展示
SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents
SiLR新门控机制在21/21多步任务中实现100%违规恢复,远超标量门控的0/21
- SiLR通过分支级违规状态乘积序门控,避免标量投影陷阱
- 在24场景基准测试中,SiLR违规恢复率显著优于终端门控和标量门控
- SiLR作为GRPO过程奖励时,未门控策略得分0.844,高于基线0.778
RSS 官方收录 · 可信分层展示
在零跑的工厂里,我们找到了它能月销 10 万辆的秘密
零跑自建五电工厂,自研自制占比65%,月销破10万辆背后是每套电驱省50元的硬核降本
- 零跑湖州五电工厂实现电池、电驱等核心部件自研自制,占整车成本约65%
- 电驱一体化生产减少三次包装运输,每套节省50元,年产能100万套对应5000万元成本优势
- 平台通用化率达88%,定子滴漆率99.5%、电控装配精度≤10微米,降本与品控同步推进
RSS 官方收录 · 可信分层展示
:fire: 不只是 Token 流:Solon AI 4.1 的语义化聊天事件
Solon AI 4.1升级流式接口,分离语义化聊天事件类型
- 支持正文、思考过程、工具参数等8类语义化事件分离传输
- 解决传统Token流中过程数据与最终结果混杂问题
- 避免供应商协议细节泄露至UI、Agent及网关
RSS 官方收录 · 可信分层展示
$\tau^\tau$-Bench: An Environment for End-To-End, Realistic Agent Construction
新基准τ^τ-Bench测试AI编码代理构建真实客服代理能力,仅23.9%通过率
- τ^τ-Bench首次模拟真实客户委托场景评估代理构建全流程
- 测试涵盖53项任务、4大领域,最强配置通过率仅23.9%
- 专家参考方案达82.2%,暴露AI在记录理解、客户沟通、架构实验三方面缺陷
RSS 官方收录 · 可信分层展示
Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
审计600个HybridQA问题,发现26.6%对象在BM25检索中丢失
- BM25在截断5时遗漏389个对象(26.6%)
- 混合检索+重排序仅遗漏14个(1.0%)
- 对象存在使精确匹配提升28.6–31.0分
RSS 官方收录 · 可信分层展示
Extremely Sparse Supervision Incentivizes Reasoning Ability
仅用0.05%生成token监督,Qwen3模型推理能力不降反升
- 极稀疏监督(每推理轨迹仅1-2个token)提升推理能力
- 在9种师生配置及数学、编程、PPO-RLVR任务中均有效
- 稀疏监督更贴近人类反思关键步骤的自然学习过程
RSS 官方收录 · 可信分层展示
上滑下一条
上滑 · j/k · m/u · h 隐藏 · a 稍后 · o 原文 · e 详情 · t 今日 · i 模式 · f 搜索