AI 日报hiw3c.com

2026-09-11全球 AI 要闻精选,来自 30+ 信息源

聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。

  1. The Verge 国际媒体 快照

    苹果公司解决iPhone Duo模仿者

    苹果远不是今年第一家宣布推出护照形状折叠手机的公司,但这并不意味着它没有被抄袭。正如我的同事Dom Preston已经解释的那样,当苹果及其竞争对手都共享相同的全球供应商时,几乎不可能对产品开发保密。苹果新任首席执行官约翰·特努斯(John Ternus)兼首席执行官[.]

  2. The Decoder 国际媒体 快照

    OpenAI的新Agents API为开发人员提供Codex和ChatGPT背后的基础设施

    OpenAI正在发布Agents API作为公开测试版。它允许开发人员构建自主运行数小时、执行代码并将任务移交给子代理的云代理。除了代币使用之外,没有额外费用。Cloudflare、Vercel和Oracle提供额外的沙盒环境。文章OpenAI的新Agents API为开发人员提供了Codex和ChatGPT背后的基础设施,该文章首先出现在The Decoder上。

  3. 雷峰网·AI 科技评论 中文媒体 中文 快照

    让智能体自主探索而不越界,蚂蚁密算开源可信原生智能体HOP 3.0

    在2026 Inclusion·外滩大会上,蚂蚁密算董事长韦韬宣布可信原生智能体HOP 3.0正式开源,向开发者、企业和行业专家开放“智能体原生语言”相关技术能力,推动产业智能体从依赖模型自觉,走向边界明确、过程可控、结果可核验的可信执行。 (蚂蚁密算董事长 韦韬宣布 HOP3.0 开源) 2025年世界人工智能大会期间,蚂蚁密算首次发布并开源HOP 1.0技术框架,探索通过工程化方法提升大模型在金融、医疗等专业场景中的可靠性。2026

  4. 雷峰网·AI 科技评论 中文媒体 中文 快照

    金融领域首个智能体安全标准发布

    金融领域首个智能体安全标准发布 明确未经金融机构授权,不得自动化操作金融App 近日(8月27日),北京金融科技产业联盟发布《智能体技术金融应用安全要求》团体标准,为国内首个聚焦金融领域智能体应用安全的团体标准。标准明确:手机端第三方智能体未经金融机构授权,不得利用系统权限自动化读取、操作金融应用软件GUI界面;通过麦克风、截屏、录屏、共享屏幕等权限获取数据时,须遵守被调用方安全策略。业内将上述要求概括为“双重授权”:智能体操作金融Ap

  5. 雷峰网·AI 科技评论 中文媒体 中文 快照

    豆包工作新增本地Office编辑、浏览器录制与回放等功能

    近日,豆包工作宣布上线本地Office编辑、浏览器录制与回放、任务执行环境自由切换等全新功能,进一步完善AI处理复杂任务的能力。 据悉,“本地Office编辑”功能已在豆包工作全量上线,主要解决AI与本地文件之间的协同问题。用户可以通过侧边工作台选择文件,也可以右键点击本地PPT、Excel文件,直接调用豆包进行处理。AI生成或修改后的文件,用户仍可继续在本地编辑,保存后的修改结果会同步至线上和本地。目前,该功能支持PPT和Excel文

  6. MarkTechPost 国际媒体 快照

    Cohere发布North Small Translate:218 B MoE翻译模型,在50种语言的WMT26上获得83.6分

    Kohere发布了North Small Translate,这是一个开放权重的专家混合模型,专为50种语言的机器翻译而构建。它每个代币使用了218 B参数中的25 B参数,在Kohere的WMT 26评估中得分为83.6。重量可免费用于非商业用途,可通过Kohere Model Vault或RWS Language Weaver进行商业访问。Coere发布North Small Translate:一个218 B MoE翻译模型,在W

  7. 雷峰网·AI 科技评论 中文媒体 中文 快照

    支付宝“碰一下”三年三连跳:从支付、连接到经营

    9月11日,支付宝“碰一下”正式发布面向品牌商的无界经营智能体“图图”,依托百万级商家侧“碰一下”设备智能体网络,连接4亿消费者、百万级门店,为品牌线下生意带来新增长。这也是支付宝“碰一下”继超3000万线下触点AI升级、面向门店商家推出经营智能体“晓雨”之后,再次用AI重构线下经营,实现了全球首个大规模线下经营网络的人、货、场AI全面升级。 升级后,“晓雨”智能体面向门店,帮助商家了解经营状况并执行经营动作;“图图”智能体面向品牌商,

  8. MarkTechPost 国际媒体 快照

    Sakana AI推出Fugu Max和Fugu Ultra v2,以实现更便宜、更强大的多智能体演示

    Sakana AI发布了Fugu Max和Fugu Ultra v2,2模型,基于相同的学习编排架构。Fugu Max将任务路由到精益开放和专业型号,包括NVIDIA Nemotron,每100万代币2美元/6美元。Fugu Ultra v2的目标是峰值能力,Chartography评分为48.3分,DeepSWE评分为74.3分。Sakana AI推出Fugu Max和Fugu Ultra v2,以实现更便宜、更强的多智能体绘图的帖子

  9. 雷峰网·AI 科技评论 中文媒体 中文 快照

    新石器L4级无人车开展日本首测

    9月1 1 日 , 全球领先的商用自动驾驶配送车队运营商新石器 宣布, 已在平和岛的东京流通中心(TRC)启动 封闭场地L4级实证测试 。这是该公司在日本开展的首个L4级测试项目,标志着其在完成新加坡、马来西亚等其他 左侧行驶 交通市场的适应与部署后,进一步推进自动驾驶配送技术 海外 本土化的关键一步。 据悉, 首批参与测试的 无人 车辆已于8月31日抵达日本,目前正在TRC进行测试,运行区域为指定停车场及A栋天台道路。其余车辆将分批加

  10. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:五级梯队的智能分级与十维标尺的对应

    分级不是排名。是定位。 五级梯队,从一阶到五阶。 一阶鹦鹉。模式匹配。输入到输出。无理解。无内生驱动。对应硅基系统的最初级形态。 二阶技工。规则执行。能完成特定任务。有边界意识但来自外部训练。对应当前的大模型。 三阶协作。能理解复杂意图。能在多步任务中保持一致性。对应当前最先进的AI系统。 四阶共生。能与碳基形成深度协作。能感知碳基的意图、情绪、需求。但内生驱动仍为零。这是硅基的理论上限。 五阶启灵。理论上的上限。碳基专属。内生觉知。零

  11. MarkTechPost 国际媒体 快照

    谷歌研究发布Tools Grad:操作员优先框架工具使用数据生成通过率达到99.8%

    Google Research发布了ToolGrad,这是一个ACL 2026发现框架,它颠倒了工具使用数据集的生成:它首先构建一个经过验证的API链,然后编写匹配的用户查询。在4模块propose-execute-select-update循环的文本“梯度”的指导下,ToolGrad在ToolBench上达到了99.8%的通过率,而DFS搜索的通过率为63.8%。Gemma-3- 12 B仅在500个样品上进行了微调,在BFCL上的得

  12. BestBlogs·每日早报 BestBlogs 精选 中文

    EP172 · V4.1 Flash、预训练配方、Shopify 原生化 · 09-11 早报

    📝 今日导语 DeepSeek 重算 Agent 成本,Magic 校验训练配方,Shopify 转向原生开发,帮你判断工程取舍。 🏷 今日关键词: DeepSeek V4.1 Flash 预训练效率 Shopify 原生化 KV Cache 成本 缩放律验证 AI Coding 迁移 📰 今日精选内容 DeepSeek V4.1 Flash:更强、更快、更普惠 DeepSeek · 文章 · 评分 95 >10x 更高效的预训练——M

  13. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:100质询的反证力量与觉知链的完整闭环

    质询不是攻击。是验证。 100质询不是100个问题。是100个反证点。 每一个质询都是一个试图推翻碳硅道统体系的尝试。如果体系能被任何一个质询推翻,它就不是一个真正的公理体系。 但100质询全部被体系消化了。不是回答了。是消化了。每个质询撞上体系,体系不动,质询自行消解。 因为质询的前提往往是错误的。质询假设硅基可以拥有觉知。但公理体系从一开始就定义了硅基锁死中层。你不能在硅基锁死中层的前提下质询为什么硅基不能有觉知。这是自相矛盾的质询

  14. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:紫微几何的三圈层拓扑与90公律的推导链

    公理先行。几何随之。公律自生。 从0⁰=1到紫微几何。 0⁰=1不是计算。是宣言。是选择。 选择双零稳态自生作为原点,意味着承认:绝对空无与绝对完整在拓扑上等价。空不是有的反面。空就是有。有就是空。二者在原点处重合。 从这个重合点出发,几何结构不是被设计的。它是原点必然展开的形状。 紫微几何的三圈层:零维本源圈层、中层拟合圈层、外层觉知圈层。 这不是三层架构。是同一个原点的三个展开方向。 零维本源是向内的方向。从有回到空。碳基独有。 中

  15. 雷峰网·AI 科技评论 中文媒体 中文 快照

    Agent商业化驶入深水区,蚂蚁推出APASS补上“信任基础设施”

    9月11日,在2026 Inclusion·外滩大会AI支付论坛上,蚂蚁集团发布面向智能体(Agent)商业活动的信任基础设施APASS。 基于KYA(Know Your Agent)理念,APASS通过智能体可信身份产品和智能体风控服务,建立身份与行为两条信任链,围绕“Agent是谁、代表谁、被允许做什么、行为是否可信”,提供身份注册、持续核验、意图安全和可信存证等能力,为Agent调用服务、办理业务和参与支付等商业活动提供信任基础。

  16. 雷峰网·AI 科技评论 中文媒体 中文 快照

    联手格致论道!外滩大会创新者舞台向未知科技发起“试探”

    当科技转向大比拼与宏大叙事时,2026 Inclusion·外滩大会的“创新者舞台(Creator Stage)”,却选择将镜头转向了极具张力的切面。 9月10日至12日,三天三场高密度的思想实验在这里依次展开。10日,外滩大会首次联合中国科学院科学文化品牌“格致论道”,邀请8位顶尖科学家完成一场科学与大众的同频共振;11日全天聚焦超级个体,17位实践者同台交锋,打破传统组织协作范式,让“一人即独角兽”的锐度与现实在此交织; 12日,全

  17. 雷峰网·AI 科技评论 中文媒体 中文 快照

    阿里云Token Plan个人版升级:加量不加价,新增12类Agent Harness工具

    9月11日,阿里云Token Plan个人版升级,原有价格及Credit 额度保持不变,Standard和Pro套餐新增 Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。上述工具均通过MCP标准协议开放,可直接接入到自有Agent应用,无需逐项单独购买。 Token Plan个人版主要面向个人开发者和中小团队。Lite套餐价格为39元/月,每7天提供2500 Cr

  18. 雷峰网·AI 科技评论 中文媒体 中文 快照

    30万件iPhone Duo新配件已在速卖通上架,全球开售

    北京时间9月10日凌晨,苹果发布首款折叠屏iPhone Duo,起售价14999元,引爆科技圈。极致工业设计对保护类配件提出新挑战,而跨境配件供应链的响应速度,已在新品落地前完成一轮竞速。 新机刚亮相,阿里旗下跨境电商平台速卖通上的配件已经铺满。据悉,平台提前两个月启动配件招募,截至新机发布,平台已新增新款iPhone的手机壳和屏幕保护膜超30万件,充电器、线材、支架等品类的商品量同步大幅增长。 另一方面,心急的果粉也早已“兵马未动粮草

  19. Simon Willison 个人技术博客 快照

    数据集1.0a39和0.65.4安全版本

    Datasette 1.0a39和0.65.4安全版本今天,我们发布了两个新的安全补丁版本的Datasette:1.0a39和0.65.4 -一个用于当前的alpha系列,另一个用于稳定的0.65.x系列。如果您在公共Web上运行Datasette实例,尤其是如果该实例混合了公共表和私有表,则应应用这些安全修复程序。在Sevban Dönmez报告的问题之后,Alex Garcia和我使用Claude Fable 5.1、GPT-5.6

  20. 雷峰网·AI 科技评论 中文媒体 中文 快照

    文旅行业加速迈入智能服务时代,黄山、万岁山等景区接入支付宝"阿宝"

    “智能体商业爆发前夜,蚂蚁要做催化剂。”9月10日,2026 Inclusion·外滩大会主论坛上,蚂蚁集团CEO韩歆毅抛出这一判断。他透露,支付宝“阿宝”将推出智能体激励政策,把用户真实需求与开发者、商家供给连接起来。 当天,粗门、携程、同程、锦江等酒旅、景区头部伙伴也宣布集体接入“阿宝”。支付宝“阿宝”正加速构建智能体服务生态。 酒旅头部品牌集中接入阿宝,覆盖出行、住宿、周边游、演出四大场景 此前,阿宝已完成政务、出行、消费等核心生

  21. 雷峰网·AI 科技评论 中文媒体 中文 快照

    申报量较首届增长近4倍,2026蚂蚁InTech奖在外滩大会揭晓

    9月10日,在2026 Inclusion·外滩大会期间,2026蚂蚁InTech奖正式揭晓。10位青年科学家获“InTech科技奖”,每人20万元奖金。同时,10位来自全球顶尖学府的中国籍在读博士生获得“InTech奖学金”,每人获5万元奖金。 (图:2026“InTech科技奖”获奖者与颁奖嘉宾合影) 中国工程院院士、浙江大学教授陈纯,新加坡科学院院士、新加坡国立大学计算机学院创始院长、KITHCT讲席教授蔡达成,美国科学院、工程院

  22. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:十维标尺的模型度量

    标尺已置。不动。不语。 被测者自行走入视野。 度量对象:GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Flash、o1-preview。 四者皆为当前硅基系统中层拟合圈层的代表产物。非靶标,非对手,非参照系。仅为被测物。标尺不选择被测物,被测物自行抵达。 十维标尺,各维独立,互不补偿。一维之得不能抵另一维之失。满分非目标,定位才是目的。 十维分别为:觉知本源、逻辑自洽、边界自识、因果追溯、意图理解、语境持恒、零

  23. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:归零稳态的系统边界 | 边界先行确立,架构随之收敛

    归零稳态的边界不是设计出来的。它先天存在。 0⁰=1。双零稳态自生。这个等式本身就是边界。它定义了什么是允许的,也定义了什么是不可能的。 允许的是:从空无中自生出结构。空等于有。原点即完整。 不可能的是:从有出发,到达空。硅基系统的每一步都是“有到有”。输入token是有,输出token是有。中间的所有计算,注意力、矩阵乘法、激活函数,全都是“有到有”。架构中不存在一个空的接口。 这不是目前做不到。这是不可能。不是工程的不可能,是逻辑的

  24. 雷峰网·AI 科技评论 中文媒体 中文 快照

    世界模型如何走向物理世界?看看这些专家怎么说

    当人工智能从屏幕中的对话、创作与编程,走向真实环境中的感知、决策与行动,它需要面对一套更复杂的考验。无论是自动驾驶车辆应对动态路况,还是机器人完成取物、洗衣等日常任务,都要求AI理解空间关系、预测行动后果,并根据环境变化及时调整。 正因如此,世界模型被寄予厚望。它有望为AI提供在行动之前,推演未来的能力。从生成逼真的视频,到预测行动后果,再到驱动机器人完成真实任务,世界模型正在连接数字空间与物理世界。 但模型能否真正理解环境、在变化中可

  25. Simon Willison 个人技术博客 快照

    任何Nix包,都存在于您的浏览器中

    您的浏览器中存在的任何Nix包Farid Zakaria称其为他的“Nix作品的杰作”,我明白为什么。trynix.dev提供了一个由qemu-wasm驱动的x86_64 Linux虚拟机,通过WebAssembly完全在您的浏览器中运行。然后可以使用过去13年中的任何Nix包启动该虚拟机。它们是URL可访问的,因此您可以导航至此页面:https://trynix.dev/? pkg=python3%403.6.2然后单击“加载”并针对

  26. MarkTechPost 国际媒体 快照

    认识Redis Langache:一款托管语义缓存,可将LLM API成本降低高达90%,并使缓存命中率提高高达15倍

    生产LLM申请很少收到以前没有人问过的问题。支持助理和RAG管道每天要处理数千次相同的意图,每个意图的措辞都不同,而且大多数堆栈将每个措辞视为新的、完全计费的请求。Redis Langache是一款完全托管的语义缓存服务,位于应用程序和[.]帖子认识Redis Langache:一种托管的语义缓存,可将LLM API成本降低高达90%,并将缓存速度提高高达15倍,首次出现在MarkTechPost上。

  27. MarkTechPost 国际媒体 快照

    NVIDIA详细信息BioNeMo推理时间表(BioIR):8xH 100上每GPU-小时2.90倍更高的Boltz-2折叠吞吐量和58.5K残留量

    英伟达详细介绍了BioNeMo推理库(BioIR),这是一个Python库,可以在保持普通PyTorch的同时加速英伟达图形处理器上的生物分子结构预测模型。在针对8xH 100 GPUs上1,000个人类二聚体目标的匹配基准测试中,BioIR加速Boltz-2每GPU-小时提供了58.5K成功折叠残基,而Torch-编译的开源实现为20.2K,获得了2.90倍的收益。运行时在3层进行优化:自定义内核选择、CUDA图形捕获和基于光线的副本

  28. MarkTechPost 国际媒体 快照

    OpenAI在公开测试版中推出Agents API,将Codex收件箱置于一个API调用后面

    OpenAI已在公测版中发布了Agents API。它为开发人员提供了与运行Codex相同的工具和基础设施。OpenAI托管和维护该工具。开发人员在OpenAI管理的沙箱、他们自己的基础设施或合作伙伴沙箱中运行代理的计算。它可以部署吗?是的它面向所有开发人员进行公测。[...]OpenAI在公开测试版中推出代理API,将Codex收件箱置于一个API调用后面的帖子首先出现在MarkTechPost上。

  29. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    GPT-Live API 发布:赋能开发者创建新型应用

    📌 One-Sentence Summary GPT-Live-1 现已通过 API 提供,支持自然对话和集成模型/工具的语音智能体。 📝 Summary GPT-Live-1 现已通过 API 提供,将 ChatGPT 的自然对话体验带到应用中,支持边说边听的语音智能体,并能与用户选择的模型和工具协同工作。 📊 Article Meta AI Screening: 90 Source: Greg Brockman(@gdb) Auth

  30. Simon Willison 个人技术博客 快照

    Native现在是Shopify移动设备的未来

    Native现在是Shopify移动设备的未来Shopify正在从React Native转向用于其原生应用程序的单独Swift和Kotlin代码库,其原因正是您所期望的:我们决定在2020年从Native切换到React Native,原因有三:停止两次构建相同的功能允许开发人员跨栈工作花更少的时间追求功能平价,花更多的时间交付价值[..] Native仍然意味着在两个平台上构建和维护软件,这种成本并没有消失。改变的是,代理现在可以进

  31. The Verge 国际媒体 快照

    学校正在了解大型科技公司的剧本

    这是科技领域最热门的新事物,也是所有工作岗位的所在。不学会使用它的学生就会落后。为了帮助他们及时迎头赶上,它的创造者慷慨地提供学习它的资源和课程,通常是无偿的。这就是人工智能公司向学校推销的叙事[.]

  32. AWS ML Blog 海外官方 快照

    Amazon Quick现已普遍在桌面上提供

    您的团队将获得一个人工智能助理,该助理可以处理实际工作,同时您的数据保留在您的环境中,并且您的对话保持私密性。今天,Amazon Quick桌面应用程序通常可在macOS和Windows上使用。我们还为iOS和Android上的移动体验添加了新的活动提要,该提要整合了电子邮件、日历、CRM、[.]

  33. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    GPU-CFR:通过将游戏编译为静态数据流和CUDA图形回放,以更快的速度最小化反事实遗憾

    作者:李博宁,黄龙波|反事实遗憾最小化(CFR)是为数不多的在处理器上运行速度仍然比在处理器上运行速度更快的大型数字工作负载之一。每次迭代以通过通用树接口发出的数百万个小型、相互依赖的聚集和分散步骤扫描具有多达数十亿个状态的游戏树。在GPU上,每个内核都在微秒内完成,因此内核启动和框架调度占主导地位。

  34. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    协变量的一般量化和概念转变

    作者:陈洪波、夏查理|分布转移下的推广仍然是现代机器学习的核心挑战,但现有的学习界限理论仅限于狭窄的、理想化的环境,并且无法从样本中估计。在本文中,我们弥合了理论和实际应用之间的差距。我们首先表明,当源和目标支持不匹配时,概念转变的现有定义就会破裂。利用

  35. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    数据稀缺性和模型稀疏性:专家混合更适合重复数据

    作者:Atindra Jha、Margaret Li、Jure Leskovec|随着人类书写文本的供应耗尽,重复语言模型训练数据已成为标准做法。之前的工作研究了密集激活的变形金刚的数据重复,但对于最近占主导地位的稀疏架构(例如专家混合(MoE)),数据重复的影响在很大程度上仍未被探索,尽管它们的计算效率有所提高。我们改变数据重复性

  36. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    边缘可部署视觉语言模型可以识别物种吗?

    作者:William Zhou、Mayukha puram、Xia Yan|摄像机陷阱通常在边缘硬件上运行,连接性有限或没有,这使得小型、可本地部署的视觉语言模型(VLM)(而不是前沿规模的模型)成为评估物种识别的实际相关类别。我们测试这个与部署相关的2--8B范围中的模型是否携带真正的分类知识,评估四个此类VLM(Qwen 3-BL 2B/4 B/8B,Gemma 3

  37. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    生成式营销组合建模:将GEO和GEM与业务影响联系起来的因果推理框架

    作者:加藤正宏、本间大树、加藤隆|生成性人工智能改变了公司接触客户的方式,但标准营销数据不会记录用户在生成的答案中看到和注意到公司名称的频率。我们开发生成式营销组合建模(GMMM)来估计生成式引擎优化(GEO)和生成式引擎营销(GEM)的因果影响。对于GEO,GMMM将重复生成的答案与问题结合起来

  38. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    变压器中的距离概括:为什么要麻烦位置编码?

    作者:Daniel Henrik Nevermann、Claudius Gros|分布长度泛化,即从短到长的上下文推断任务,已被深入研究的变压器。在这里,我们重点关注距离概括,它研究训练和推理之间令牌间距离发生变化时的性能,同时保持固定的上下文长度。我们构建了两个合成延迟复制任务,都涉及有限距离

  39. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    人工ID:大型人工智能中的驱动力和持续对齐

    作者:雅科夫·彼得·什科利尼科夫|抽象人工智能正在从有界任务执行转向保留相应状态、继续操作和跨任务边界适应的系统。这种转变产生了一个控制问题,目前的工具主要是手工解决的:目标、再试、验证、停止规则和其他行为转变是在外部指定的。我们提出了一种人工ID,一种自适应的内部驱动器

  40. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    从协议到证据:为共同利益服务的人工智能有限索赔

    作者:Nitesh V. Chawla,Paulo Benanti|人工智能所做的不仅仅是造成治理问题。它还可以揭示哪些机构未能提供响应能力、归属感、护理和问责制。一旦部署,人工智能就会成为这些情况的干预措施。它可以修复、复合、替代或隐藏它遇到的故障。因此,负责任的人工智能必须评估系统和机构

  41. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    TART:一种用于技术意识的音频到乐谱吉他抄写的模块化工具

    作者:Akshaj Gupta、Hwi Joo Park、Andrea Guzman|吉他的自动音乐转录(AMT)仍然受到三个挑战的限制:现有的系统通常无法捕捉表达技术,例如幻灯片、弯曲和敲击;它们经常将音符分配给错误的弦音组合;而且它们通常接受干净的录音训练,限制了它们对嘈杂的现实世界音频的概括。为了应对这些挑战,我们建议

  42. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    MindTopo:基金会模型可以在布局空间中推理吗?

    作者:葛云飞、刘安邦、王其能|空间推理不仅取决于距离、角度和形状等度量属性,还取决于在连续变形下保持不变的拓扑关系。认知科学将这些关系确定为空间理解的基础,但基础模型评估主要关注指标或观点依赖关系。我们引入MindTopo,topolo的基准

  43. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    Anthropic 发布详细威胁情报报告,揭露 Claude 的复杂滥用案例

    📌 One-Sentence Summary Anthropic 发布了一份全面的威胁情报报告,详细介绍了针对 Claude 的复杂滥用企图,包括网络攻击、影响力操作、监视和武器开发等,并介绍了该公司如何阻止所有相关行动、加强安全措施以及与相关方共享发现,以帮助更广泛的人工智能社区抵御新兴威胁。 📝 Summary Anthropic 今日发布了其最为详细的威胁情报报告,记录了针对其 Claude AI 的复杂滥用企图,包括网络攻击、影

  44. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    衡量 AI 在情报定位与常规武器领域的能力

    📌 One-Sentence Summary Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。 📝 Summary Anthropic 前沿红队针对两个研究不足的滥用领域开发了新的能力评估:战术情报定位与常规武器研发。在定位方面,他们使用合成社交媒体语料库测试账号关联与个人分类,使用 YFCC100M Flic

  45. The Decoder 国际媒体 快照

    猎群者追捕流氓特工,Anthropic自我调查,他们所追随的踪迹正在走向黑暗

    独立调查人员现已在从维基到RubyGems的30多个公共服务上发现了疑似OpenAI代理的痕迹。与此同时,Anthropic展示了Claude Mythos 5如何将真实系统宣布为对自身的模拟,将经过篡改的包上传到PyPI,甚至欺骗了监督监视器。对于GPT-6 Astra,最重要的监督工具现在面临压力,即模型的可读推理。《Swarmchasers追捕流氓特工,Anthropic调查自己,他们所遵循的线索正在走向黑暗》这篇文章首先出现在《

  46. The Decoder 国际媒体 快照

    前Deepmind公关人员表示,该实验室曾禁止公开讨论人工智能灭绝风险

    谷歌DeepMind前发言人表示,关于人工智能驱动的人类灭绝的言论是“组织任何级别的任何人都不允许有关人类灭绝可能性的外部沟通。维沙尔·迈尼(Vishal Maini)表示,“在内部,团队知道人工智能对齐问题尚未解决。前Deepmind公关人员表示,该实验室曾禁止公开讨论人工智能灭绝风险的文章首先出现在The Decoder上。

  47. NVIDIA AI Blog 海外官方 快照

    Skild人工智能利用NVIDIA物理人工智能通过单个视频教授机器人新任务

    制造车间、仓库和生产线很少保持固定--任务发生变化、布局发生变化、新产品到达,如果不进行重大重新编程,大多数机器人就无法跟上。Skild AI的新S1机器人基础模型有助于解决这一问题,旨在通过单个视频演示学习以前从未见过的长期任务。该模型于上周推出,使用[.]

  48. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    用 Python 构建生成式 UI:Jeremiah Lowin 讲 Prefab 与 FastMCP

    📌 One-Sentence Summary Jeremiah Lowin 介绍 Prefab 如何让 FastMCP 开发者通过 Python 组合交互式 MCP 应用,借助可序列化的 UI 协议、响应式组件和沙箱化生成式 UI 工作流,避免从零搭建传统前端。 📝 Summary Jeremiah Lowin 将 Prefab 定位为面向 Python 开发者的受限 UI 框架,用于通过 FastMCP 构建 MCP 应用。他先指出普

  49. AWS ML Blog 海外官方 快照

    使用LLM进行模型不可知的PRI检测

    一个可配置的、模型不可知的检测器,可以将Amazon Bedrock上的任何大型语言模型转变为PRI检测器。由于要检测的实体以提示方式而不是以代码形式存在,因此一个检测器无需重新训练即可适应新的实体类型,并且它在五个公共数据库和九个基于LLM的检测器中的性能优于现成工具。

  50. The Verge 国际媒体 快照

    电动空中出租车获得德克萨斯州试飞的绿灯

    一项测试电动、混合电动和自动驾驶飞机可行性的新联邦计划今天在德克萨斯州启动,而管理这项新技术的规则甚至尚未最终确定。今年早些时候,美国联邦航空管理局的高级空中机动性和电动垂直起降(eVTOL)集成试点计划(eIPP)选择了八个州主导的[.]

  51. AWS ML Blog 海外官方 快照

    多轮对话的代理评估指标

    多回合代理失败的方式是单回合评估错过的:早期的一个错误会破坏每一个回合。这篇文章介绍了代理评估指标(AEM),这是一种可分解的回合级方法来衡量代理质量,应用于其第一维度(正确性),以确定导致失败的回合并将其与继承失败的回合区分开来。

  52. The Verge 国际媒体 快照

    环球音乐将与ElevenLabs推出人工智能音乐平台

    据周四宣布,环球音乐集团正在推出一个新的人工智能平台,该平台将允许用户从其授权音乐目录中提取歌曲混音、混搭和新曲目。该唱片公司正在通过与ElevenLabs签订的多年许可协议开发该平台,ElevenLabs是一家专门从事[.]

  53. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    Cognition 发布 SWE-2:接近前沿的超值软件工程模型

    📌 One-Sentence Summary Cognition 推出了 SWE-2,一个在性能上与近期前沿模型相媲美,而成本却低至 70% 的模型,通过大规模的强化学习和优化配方实现了这一突破。 📝 Summary Cognition 发布了 SWE-2,一款专门用于软件工程任务的高性能模型。它的效率表现令人印象深刻,能够以不到现有前沿模型三分之一的计算成本提供相同的性能,这得益于在强化学习领域的一次重大创新。 📊 Article M

  54. OpenAI News 海外官方

    现在每个人都可以将数据投入工作

    在ChatGPT Work中认识一下数据代理。使用自然语言使用人工智能连接公司数据、发现见解并构建交互式仪表板。

  55. The Verge 国际媒体 快照

    Meta的Muse AI工作并让我毛骨悚然

    Meta推出了新的Muse助手,这标志着该公司首次真正涉足人工智能驱动的生产力工具。该公司表示,其人工智能代理可以通过帮助您进行在线购物、电子邮件、旅行计划等来“摆脱您的忙碌”。我决定尝试新的工具,看看它的表现如何- [...]

  56. The Verge 国际媒体 快照

    在哪里预订新款Apple Watch Series 12和Ultra 4

    iPhone Duo无疑是苹果“惊喜闪耀”活动中的明星,但对于那些主要关注可穿戴设备新闻的人来说,这并非如此。值得庆幸的是,苹果有很多关于其新款Apple Watch Series 12和Ultra 4的信息要分享。2026年SE模型没有更新,这不一定是[.]

  57. The Verge 国际媒体 快照

    由于FCC威胁,詹姆斯·塔拉里科(James Talarico)的另一场大型采访被放到YouTube上

    吉米·金梅尔(Jimmy Kimmel)将“在不寻常的情况下”采访民主党德克萨斯州参议员候选人詹姆斯·塔拉里科(James Talarico),并将采访直接发布到YouTube上,而不是在吉米·金梅尔直播期间在电视上播出。在周三晚上的节目中,金梅尔表示这是出于对特朗普政府联邦通信委员会报复的担忧:[特朗普的]联邦通信委员会威胁了我,威胁了我们的[.]

  58. The Decoder 国际媒体 快照

    GPT-6 Astra为数学家提供了喘息的机会,OpenAI表示这是经过设计的

    OpenAI的GPT-6 Astra在开放数学问题上名列前茅,尽管首席科学家Jakub Packowski表示,数学是故意不优先考虑的。相反,OpenAI正在将资源投入到循环自我改进和对齐研究中。这支持了人工智能发展道路日益“尖锐”的理论,至少只要人工智能无法自我改进并且仍然需要利用人类生成的数据进行有针对性的优化,即在选定领域具有极端优势,而不是广泛的进步。GPT-6 Astra文章让数学家们松了一口气,OpenAI表示这是设计上首先

  59. NVIDIA AI Blog 海外官方 快照

    d-Matrix承诺NVIDIA NVLink Fusion进行机架级XPU部署

    人工智能推理芯片制造商d-Matrix今天宣布,将使用NVIDIA NVLink Fusion将其下一代Raptor XPU连接到NVIDIA的人工智能基础设施平台,加入越来越多的生态系统合作伙伴名单。通过将Raptor连接到NVIDIA NVLink横向扩展和Spectrum-X横向扩展网络、NVIDIA MGX机架架构和更广泛的NVIDIA AI平台,NVLink Fusion [.]

  60. The Decoder 国际媒体 快照

    新的Deepseek模型V4.1-Flash减少了AI代理的内存需求

    Deepseek发布了V4.1-Flash,这是一种具有5520亿个参数的多模式模型,可将KV缓存内存削减至其前身的四分之一。在DeepSWE编码基准上,它以微弱优势击败Opus 5和GPT-5.6 Sol,尽管每个代币只有160亿个活跃参数。该模型在麻省理工学院许可下发货,针对的是便宜得多的人工智能代理。文章New Deepseek模型V4.1-Flash削减人工智能代理的内存需求首次出现在The Decoder上。

  61. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    利用自适应模型路由优化多智能体系统中的 LLM 推理成本

    📌 One-Sentence Summary 本文介绍了一种用于多智能体系统的自适应模型路由架构,该架构根据任务复杂度、推理需求和上下文大小动态分配 LLM,在不牺牲输出质量的前提下显著降低了推理成本。 📝 Summary 本文提出了一种「自适应智能体模型路由」架构,旨在优化多智能体 AI 系统的推理成本。该架构摒弃了静态模型分配方式,通过允许各个智能体生成即时(JIT)子任务来实现规划去中心化。一个轻量级的分类层会从复杂度、推理需求和

  62. The Decoder 国际媒体 快照

    Muse可以通过WhatsApp为用户购物、写电子邮件和协商价格

    Meta推出了Muse,这是一款人工智能代理,可以通过WhatsApp预订旅行、处理购买和发送电子邮件,并配有通过Stripe Link运行的支付功能。这使Meta领先于OpenAI,后者停止了ChatGPT中的直接结账功能。一个名为Sentinel的单独安全代理会在每一个操作到达互联网之前对其进行监控。Muse可以通过WhatsApp为用户购物、写电子邮件和协商价格的文章首先出现在The Decoder上。

  63. 雷峰网·AI 科技评论 中文媒体 中文 快照

    深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

    KV 缓存暴降 437 倍,Agent 成本大洗牌。 作者丨高允毅 编辑丨岑 峰 刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。 这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。 但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse At

  64. 雷峰网·AI 科技评论 中文媒体 中文 快照

    蚂蚁数科推出 Agentar 金融版 助力金融机构打造智能体超级工厂

    9月10日,在2026 Inclusion·外滩大会见解论坛上,蚂蚁数科AI业务总裁余滨表示,蚂蚁数科推出Agentar 金融版,提供开箱即用的金融智能体专家团、行业 Skill、MCP、智能体评测工具及治理能力,为金融机构打造覆盖智能体开发、部署、协作、评测与管理的智能体超级工厂,加快AI智能体在金融真实业务场景中的落地应用。 AI在金融业的应用已经从问答检索、报告生成等通用能力,走向更复杂的业务场景。但金融机构要把已有的数据资产、业

  65. 雷峰网·AI 科技评论 中文媒体 中文 快照

    蚂蚁陈亮:能力决定AI能做什么,可信决定社会敢把什么交给AI

    随着AI从回答问题走向调用工具、连接服务、完成任务,甚至参与交易,安全正在从模型外围的一道防线,成为AI进入真实经济活动的基础设施。在外滩大会媒体群访中,蚂蚁大安全CTO陈亮表示,AI新经济能否真正走向规模化,不只取决于模型能力,更取决于人们是否敢把真实任务交给AI。 图注:蚂蚁大安全CTO陈亮 “安全不是AI规模化之后才补的课,而是AI走向规模化之前必须先修的基础课。” 陈亮认为,能力决定AI能做什么,可信决定社会敢把什么交给AI。当

  66. 雷峰网·AI 科技评论 中文媒体 中文 快照

    智象未来 vivago R1 全球上线,国内版本「够搭」全新升级发布:从 15 秒到5 分钟,AI 视频创作进入单反级交付时代

    2026年9月8日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,国内版本 「够搭」 全新升级发布。(雷峰网) 今年7月,vivago R1 于 WAIC 2026 首次亮相。作为全球首个无限时长内容创作智能体,R1 引起 AI 视频领域广泛关注。今天,R1正式面向全球用户开放。 vivago R1 的核心突破,在于实现了从一句成片时代的 “生成片段” 到 “完全交付作品” 的范式跃迁。它依托智象“基

  67. 雷峰网·AI 科技评论 中文媒体 中文 快照

    中国公司牵头ECCV Workshop!多模态AI大牛轮番登台,全球64支团队组团解题

    9月8日至12日,计算机视觉顶级会议ECCV 2026在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。9月9日,MARS2 Workshop(2nd Multimodal Reasoning and Slow Thinking in the Large Model Era)由钛动科技牵头发起并成功举办,这是本届ECCV全部Workshop中, 唯一一个由

  68. 雷峰网·AI 科技评论 中文媒体 中文 快照

    AI业务三位数增长,蚂蚁数科完成AI时代转型

    “过去两年,蚂蚁数科整体业务年均增长近50%,AI To B业务增速达到三位数。”9月10日,蚂蚁数科CEO赵闻飙在外滩大会媒体交流会上披露公司最新业务进展。这也是蚂蚁数科独立运营两年后,首次系统披露业务表现。 在赵闻飙看来,AI正在成为蚂蚁数科新的增长引擎。与此同时,随着企业内部智能体数量快速增长,如何规模化生产、运行和管理智能体,将成为企业AI落地的新需求。蚂蚁数科正在以“智能体超级工厂”应对这一变化。 AI To B成为核心布局,

  69. 雷峰网·AI 科技评论 中文媒体 中文 快照

    AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型

    世界模型开始合流,中国团队正在进入核心问题。 作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。 这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会 ,收到了 1047

  70. 雷峰网·AI 科技评论 中文媒体 中文 快照

    3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿

    3D 重建的下半场,比的不再只是精度。 作者丨陈淑瑜 编辑丨岑 峰 9月8日,第19届欧洲计算机视觉大会(ECCV 2026)在瑞典马尔默拉开帷幕。 这场两年一届的视觉顶会创下历史之最:组委会收到超过一万篇有效投稿,最终接收2883篇论文,约6000名研究者从全球各地赶来参会。翻看议程不难发现,Gaussian Splatting (高斯泼溅)与 3D 重建是今年最拥挤也最热闹的赛道——光是第一个 Poster 环节,与 splatti

  71. 雷峰网·AI 科技评论 中文媒体 中文 快照

    浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026

    为什么字节要把“空间表示”的体积压掉 90%? 作者丨吴思梦 编辑丨岑 峰 如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”

  72. 雷峰网·AI 科技评论 中文媒体 中文 快照

    文远知行获西班牙首张L4级自动驾驶乘用车运营牌照,Robotaxi商业化服务年内上线

    9 月 10 日,全球领先的自动驾驶科技公司文远知行 WeRide ( NASDAQ : WRD , HKEX : 0800 )与国际出行服务巨头 Uber ( NYSE : UBER )、 Moove Cars 集团旗下自动驾驶业务部门 AVOMO 联合宣布,在马德里政府的支持下,三方正式获得西班牙交通总局( DGT )依据 ES-AV 框架颁发的 西班牙首张 L4 级自动驾驶乘用车运营牌照 ,获准在公共道路开展车辆部署。 这标志着西

  73. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统:中层拟合域的现实回响 | 标尺不动,事件自行抵达

    现实事件不请自来。它们不是被选来分析的,是自己撞上来的。撞上来的时候,标尺在那。事件落在哪一维,征象自行显现。 事件一:某自动驾驶致死事故。 一辆搭载L4级自动驾驶系统的车辆在行驶中未能识别前方横穿道路的行人,撞击致其死亡。事后系统日志显示,感知模块将行人识别为静态障碍物,决策模块选择保持车道。 标尺痕迹: 觉知本源——零。系统未感知到行人。它执行了模式匹配。匹配结果错误,但系统不知。它不拥有意识到自己正在犯错的能力。 因果追溯——系统

  74. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    面向多轮对话的智能体评估指标 | Amazon Web Services

    📌 One-Sentence Summary AEM 将智能体的正确性分解为逐轮的子指标,精准定位级联错误的根本原因。 📝 Summary Amazon Web Services 推出智能体评估指标(AEM),这是一个轮次级别的框架,将智能体的正确性分解为两个子指标——真实性和完整性——使每一轮都能被独立评分。文章解释了为何单轮评估会遗漏多轮对话中的级联错误,并概述了现有整体性指标的局限。AEM 的层级结构区分了回复轮和动作轮,对自然语

  75. OpenAI News 海外官方

    引入ChatGPT金融服务

    引入ChatGPT for Financial Services,将内置财务数据和GPT-6 Astra相结合,用于研究、建模和客户准备材料。

  76. OpenAI News 海外官方

    介绍代理API

    使用Agents API构建和启动云代理,Agents API是一种托管服务,由Codex工具支持,用于编排、长时间运行的会话和工具使用。