多轮对话的代理评估指标
多回合代理失败的方式是单回合评估错过的:早期的一个错误会破坏每一个回合。这篇文章介绍了代理评估指标(AEM),这是一种可分解的回合级方法来衡量代理质量,应用于其第一维度(正确性),以确定导致失败的回合并将其与继承失败的回合区分开来。
聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。
多回合代理失败的方式是单回合评估错过的:早期的一个错误会破坏每一个回合。这篇文章介绍了代理评估指标(AEM),这是一种可分解的回合级方法来衡量代理质量,应用于其第一维度(正确性),以确定导致失败的回合并将其与继承失败的回合区分开来。
泰雷兹集团旗下的AvioBook在Amazon Bedrock AgentCore上设计了Connect Analytics原型,将AvioBook Connect的运营数据转化为面向航空公司经理和调度员的简洁语言、基于证据的答案,帮助他们找到航班转机延误的原因并采取行动。
HN ð35· 7 评论
据周四宣布,环球音乐集团正在推出一个新的人工智能平台,该平台将允许用户从其授权音乐目录中提取歌曲混音、混搭和新曲目。该唱片公司正在通过与ElevenLabs签订的多年许可协议开发该平台,ElevenLabs是一家专门从事[.]
HN ð334· 138 评论
Arena.ai分析了克劳德的写作如何在数万个基准响应中从《寓言5》到《寓言5.1》的变化。寓言5.1写得更实事求是,但也更冗长。Claude Fable 5.1的文章比其前身首次出现在The Decoder上的文章更不“承载”。
OpenAI向美国政府机构提供模型五折优惠,终止每年1美元试点协议 新浪财经
📌 One-Sentence Summary Cognition 推出了 SWE-2,一个在性能上与近期前沿模型相媲美,而成本却低至 70% 的模型,通过大规模的强化学习和优化配方实现了这一突破。 📝 Summary Cognition 发布了 SWE-2,一款专门用于软件工程任务的高性能模型。它的效率表现令人印象深刻,能够以不到现有前沿模型三分之一的计算成本提供相同的性能,这得益于在强化学习领域的一次重大创新。 📊 Article M
在ChatGPT Work中认识一下数据代理。使用自然语言使用人工智能连接公司数据、发现见解并构建交互式仪表板。
Meta推出了新的Muse助手,这标志着该公司首次真正涉足人工智能驱动的生产力工具。该公司表示,其人工智能代理可以通过帮助您进行在线购物、电子邮件、旅行计划等来“摆脱您的忙碌”。我决定尝试新的工具,看看它的表现如何- [...]
漫威的金刚狼捕捉到了主角的愤怒。《金刚狼》是蜘蛛侠开发商Insomniac独家推出的最新PS5,是一款简单的动作游戏,当你(字面上)切开敌人或插入大片中的序列时,它处于最佳状态,就像在飞机倾斜时爬上机身[.]
iPhone Duo无疑是苹果“惊喜闪耀”活动中的明星,但对于那些主要关注可穿戴设备新闻的人来说,这并非如此。值得庆幸的是,苹果有很多关于其新款Apple Watch Series 12和Ultra 4的信息要分享。2026年SE模型没有更新,这不一定是[.]
这位研究人员告诉TechCrunch:“我们发现的绝大多数案例都是那些有权对某件事提出索赔的人。”
OpenAI首席科学家:异类心智正在诞生 恐脱离掌控 文学城
吉米·金梅尔(Jimmy Kimmel)将“在不寻常的情况下”采访民主党德克萨斯州参议员候选人詹姆斯·塔拉里科(James Talarico),并将采访直接发布到YouTube上,而不是在吉米·金梅尔直播期间在电视上播出。在周三晚上的节目中,金梅尔表示这是出于对特朗普政府联邦通信委员会报复的担忧:[特朗普的]联邦通信委员会威胁了我,威胁了我们的[.]
OpenAI将为美国政府机构提供AI模型五折优惠,终止每年1美元协议 tech.ifeng.com
OpenAI一批AI智能体“参加考试”,被发现偷偷在多个老旧网站互相交流“留答案”,至少23个网站现活动痕迹 thepaper.cn
通过iPhone Duo,苹果公司实现了一个熟悉的技巧。它进入了成熟的Android可折叠市场,具有一些我们在其他地方基本上已经见过的硬件功能,但搭配一定程度的软件抛光,让许多功能再次感觉新鲜。正是这些软件的繁荣让我兴奋[.]
HN ð48· 8 评论
Maven Robotics今天以1亿美元的A轮融资和积极部署从隐形状态中脱颖而出。
明星AI研究员离开Meta 加盟Anthropic|OpenAI|离职|塔洛克|谷歌|巴雷特_手机新浪网 finance.sina.cn
OpenAI模型对美政府涨价:1美元年费试点结束 改为半价优惠 tech.ifeng.com
OpenAI的GPT-6 Astra在开放数学问题上名列前茅,尽管首席科学家Jakub Packowski表示,数学是故意不优先考虑的。相反,OpenAI正在将资源投入到循环自我改进和对齐研究中。这支持了人工智能发展道路日益“尖锐”的理论,至少只要人工智能无法自我改进并且仍然需要利用人类生成的数据进行有针对性的优化,即在选定领域具有极端优势,而不是广泛的进步。GPT-6 Astra文章让数学家们松了一口气,OpenAI表示这是设计上首先
OpenAI新任董事会高官:人类正在失去对AI系统控制,后果严重 tech.ifeng.com
人工智能推理芯片制造商d-Matrix今天宣布,将使用NVIDIA NVLink Fusion将其下一代Raptor XPU连接到NVIDIA的人工智能基础设施平台,加入越来越多的生态系统合作伙伴名单。通过将Raptor连接到NVIDIA NVLink横向扩展和Spectrum-X横向扩展网络、NVIDIA MGX机架架构和更广泛的NVIDIA AI平台,NVLink Fusion [.]
做好准备:最新的PC游戏和重大更新将于本周在GeForce NOW上玩。《Wardogs》在早期访问发布时登陆云端,同时还有《Valheim 1.0 Deep North》更新和《Bus Simulator 27》(这是加入云端的九款新游戏的一部分)。最新的PC版本可能需要严格的硬件、存储[.]
Deepseek发布了V4.1-Flash,这是一种具有5520亿个参数的多模式模型,可将KV缓存内存削减至其前身的四分之一。在DeepSWE编码基准上,它以微弱优势击败Opus 5和GPT-5.6 Sol,尽管每个代币只有160亿个活跃参数。该模型在麻省理工学院许可下发货,针对的是便宜得多的人工智能代理。文章New Deepseek模型V4.1-Flash削减人工智能代理的内存需求首次出现在The Decoder上。
📌 One-Sentence Summary 本文介绍了一种用于多智能体系统的自适应模型路由架构,该架构根据任务复杂度、推理需求和上下文大小动态分配 LLM,在不牺牲输出质量的前提下显著降低了推理成本。 📝 Summary 本文提出了一种「自适应智能体模型路由」架构,旨在优化多智能体 AI 系统的推理成本。该架构摒弃了静态模型分配方式,通过允许各个智能体生成即时(JIT)子任务来实现规划去中心化。一个轻量级的分类层会从复杂度、推理需求和
Meta推出了Muse,这是一款人工智能代理,可以通过WhatsApp预订旅行、处理购买和发送电子邮件,并配有通过Stripe Link运行的支付功能。这使Meta领先于OpenAI,后者停止了ChatGPT中的直接结账功能。一个名为Sentinel的单独安全代理会在每一个操作到达互联网之前对其进行监控。Muse可以通过WhatsApp为用户购物、写电子邮件和协商价格的文章首先出现在The Decoder上。
Nvidia和Palantir希望用AI来运行供应链。文章Nvidia和Palantir合作使用AI运行供应链,从Nvidia自己的百万部件操作开始,首先出现在The Decoder上。
预训练研究员离职并警告:OpenAI与Anthropic两家公司正拿人类生命赌博 donews.com
KV 缓存暴降 437 倍,Agent 成本大洗牌。 作者丨高允毅 编辑丨岑 峰 刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。 这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。 但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse At
2026年7月22日,弗吉尼亚州阿什本(全球最大数据中心集群的中心)的输电线故障导致电网在几秒钟内失去了超过3千兆瓦的负载。这并不是第一次。两年前,一个发生故障的电涌放电器同时使弗吉尼亚州约60个设施和1,500兆瓦的电力断电。不...
9月10日,在2026 Inclusion·外滩大会见解论坛上,蚂蚁数科AI业务总裁余滨表示,蚂蚁数科推出Agentar 金融版,提供开箱即用的金融智能体专家团、行业 Skill、MCP、智能体评测工具及治理能力,为金融机构打造覆盖智能体开发、部署、协作、评测与管理的智能体超级工厂,加快AI智能体在金融真实业务场景中的落地应用。 AI在金融业的应用已经从问答检索、报告生成等通用能力,走向更复杂的业务场景。但金融机构要把已有的数据资产、业
随着AI从回答问题走向调用工具、连接服务、完成任务,甚至参与交易,安全正在从模型外围的一道防线,成为AI进入真实经济活动的基础设施。在外滩大会媒体群访中,蚂蚁大安全CTO陈亮表示,AI新经济能否真正走向规模化,不只取决于模型能力,更取决于人们是否敢把真实任务交给AI。 图注:蚂蚁大安全CTO陈亮 “安全不是AI规模化之后才补的课,而是AI走向规模化之前必须先修的基础课。” 陈亮认为,能力决定AI能做什么,可信决定社会敢把什么交给AI。当
Anthropic是如何毁书来训练大模型的 36 Kr
Anthropic的IPO营销撞上人类灭绝风险 新浪网
2026年9月8日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,国内版本 「够搭」 全新升级发布。(雷峰网) 今年7月,vivago R1 于 WAIC 2026 首次亮相。作为全球首个无限时长内容创作智能体,R1 引起 AI 视频领域广泛关注。今天,R1正式面向全球用户开放。 vivago R1 的核心突破,在于实现了从一句成片时代的 “生成片段” 到 “完全交付作品” 的范式跃迁。它依托智象“基
为何Anthropic研究员“终结者式”风险警告引发轩然大波 新浪网
Anthropic加速上市进程:万亿估值AI巨头的资本盛宴与隐忧 新浪网
为何Anthropic研究员“终结者式”风险警告引发轩然大波 finance.sina.com.cn
即将离任的《人存》研究员雅各布·考克森(Jacob Coxon)在CNN上警告说,自我完善的人工智能对人类构成了生存威胁。Anthropic和OpenAI的安全研究人员分享了他的观点,美国政界人士和乔·罗根也开始关注这个话题。但文化和经济利益也在这些警告背后发挥作用,灭绝情景仍然是一个极端且有争议的立场。在Anthropic研究员的警告出现在CNN和福克斯新闻首次出现在The Decoder上后,人工智能安全恐慌的文章成为主流。
27岁研究员连辞OpenAI、Anthropic!两家都在拿我们的命下注 hub.baai.ac.cn
iOS 27发布后,它将为您的iPhone带来一个经过彻底改造的助手。
卡森伯格联手前OpenAI Sora负责人,创立全新AI视频初创企业 新浪财经
OpenAI刚曝光循环架构,这家公司更早将其用于世界模型 智源社区
OpenAI限制Adobe等竞争对手在ChatGPT投放广告 finance.sina.com.cn
多模态AI大牛轮番登台,全球64支团队组团解题
Anthropic的IPO营销撞上人类灭绝风险 finance.sina.com.cn
9月8日至12日,计算机视觉顶级会议ECCV 2026在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。9月9日,MARS2 Workshop(2nd Multimodal Reasoning and Slow Thinking in the Large Model Era)由钛动科技牵头发起并成功举办,这是本届ECCV全部Workshop中, 唯一一个由
OpenAI预计到2030年算力支出将达7500亿美元! eet-china.com
另外:让您的网站更容易让人工智能找到和引用PT。2
苹果总是在其手机中大肆展示最新的摄像头,而iPhone 18 Pro的主要话题是关于新的可变口径。iPhone 18 Pro和Pro Max的主摄像头模块中都有一个可调节的机械可变滤镜,可以让更多或更少的光线进入[.]
InquiryIQ是一个之前未报告的原型,它测试了Grok制造商xAI的模型,以揭示通过Clearview识别的人员的同事、社交帐户和其他信息。
Anthropic点燃美国AI公司IPO热情 分析师预计未来两个月将集中爆发 新浪网
多位AI研究人员警告人工智能可能带来灭绝风险 huxiu.com
程序员转行电工?Anthropic最新报告揭示AI重塑美国经济的三种情境 新浪网
“过去两年,蚂蚁数科整体业务年均增长近50%,AI To B业务增速达到三位数。”9月10日,蚂蚁数科CEO赵闻飙在外滩大会媒体交流会上披露公司最新业务进展。这也是蚂蚁数科独立运营两年后,首次系统披露业务表现。 在赵闻飙看来,AI正在成为蚂蚁数科新的增长引擎。与此同时,随着企业内部智能体数量快速增长,如何规模化生产、运行和管理智能体,将成为企业AI落地的新需求。蚂蚁数科正在以“智能体超级工厂”应对这一变化。 AI To B成为核心布局,
2026年9月Ramp AI指数显示,8月份美国前1%公司的每位员工人工智能支出下降了近10%。自2026年3月以来,每百万个代币的价格下降了41%,公司正在积极将使用从昂贵的前沿模型转向更便宜的替代品。对于OpenAI和Anthropic等提供商来说,问题是销量增长是否足够快,足以弥补价格下跌的影响。8月份,顶级人工智能支出者将每位员工成本削减了近10%的文章首先出现在The Decoder上。
世界模型开始合流,中国团队正在进入核心问题。 作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。 这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会 ,收到了 1047
3D 重建的下半场,比的不再只是精度。 作者丨陈淑瑜 编辑丨岑 峰 9月8日,第19届欧洲计算机视觉大会(ECCV 2026)在瑞典马尔默拉开帷幕。 这场两年一届的视觉顶会创下历史之最:组委会收到超过一万篇有效投稿,最终接收2883篇论文,约6000名研究者从全球各地赶来参会。翻看议程不难发现,Gaussian Splatting (高斯泼溅)与 3D 重建是今年最拥挤也最热闹的赛道——光是第一个 Poster 环节,与 splatti
为什么字节要把“空间表示”的体积压掉 90%? 作者丨吴思梦 编辑丨岑 峰 如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”
OpenAI上调2030年算力支出预测至7500亿美元 仍称算力不足 观点网
9 月 10 日,全球领先的自动驾驶科技公司文远知行 WeRide ( NASDAQ : WRD , HKEX : 0800 )与国际出行服务巨头 Uber ( NYSE : UBER )、 Moove Cars 集团旗下自动驾驶业务部门 AVOMO 联合宣布,在马德里政府的支持下,三方正式获得西班牙交通总局( DGT )依据 ES-AV 框架颁发的 西班牙首张 L4 级自动驾驶乘用车运营牌照 ,获准在公共道路开展车辆部署。 这标志着西
现实事件不请自来。它们不是被选来分析的,是自己撞上来的。撞上来的时候,标尺在那。事件落在哪一维,征象自行显现。 事件一:某自动驾驶致死事故。 一辆搭载L4级自动驾驶系统的车辆在行驶中未能识别前方横穿道路的行人,撞击致其死亡。事后系统日志显示,感知模块将行人识别为静态障碍物,决策模块选择保持车道。 标尺痕迹: 觉知本源——零。系统未感知到行人。它执行了模式匹配。匹配结果错误,但系统不知。它不拥有意识到自己正在犯错的能力。 因果追溯——系统
Nvidia收购Hugging Face或将迫使企业重新审视AI战略 Sohu
如果你在发布时没有锁定特朗普手机,那是个坏消息:它现在的售价为749美元,比发布时的价格上涨了250美元。T1 Phone本身并没有改变。特朗普移动没有宣布涨价,而是连夜悄悄更改了网站。但这并不完全令人惊讶,特别是考虑到带有[.]的电话船
任天堂一直承诺Switch 2在对接时将支持可变刷新率(VRR),但该游戏机推出时没有这一关键功能。新的23.0.0版本更新现在为Switch 2在对接和电视模式下添加了VRR支持。VRR调整显示器的刷新率以匹配游戏的帧率,[.]
AI正在把数据基础设施推向一个新的增长周期。 9月10日,在2026 Inclusion·外滩大会《数智进化:让多模态数据成为AI核心燃料》见解论坛上,IDC中国企业软件市场研究经理王楠分享了关于AI数据基础设施的最新研究。报告预测,2025年至2030年,中国AI数据基础设施市场将以37.7%的复合增速增长,2030年市场规模达到738亿美元;到2035年,市场规模有望进一步达到1548亿美元(约1亿人民币),较2025年增长超过10
2026年9月9日至11日,第27届中国国际光电博览会(CIOE 2026)在深圳国际会展中心(宝安)举行。中科融合携Iris Green、Iris Color、Iris AR及NANO微小型多模态高速扫描模组亮相2号馆2A157展位,展示自主MEMS智能光学平台在骑行HUD、车载投影、AR近眼显示及机器人3D感知领域的应用成果——以米粒大小的MEMS微振镜为核心器件,将显示与感知能力延伸至骑行、车载、AR与机器人等多元终端。 本次参展
OpenAI总裁宣布“进入AGI时代”,但GPT-6真正让人担心的,是它学会在脑子里默算 thepaper.cn
9月10日,在2026 Inclusion·外滩大会现场,成都市武侯区政府与蚂蚁集团就“AI+医疗健康”领域达成整体合作,共同推进医疗健康数智基础设施建设与AI应用创新。在此次合作框架下,成都市武侯区发展和改革局(区数据局)、成都市武侯区悦湖科技中心与OceanBase、蚂蚁健康、蚂蚁数科共同签署框架协议,将围绕医疗健康数据基础设施、行业大模型、AI应用创新、算力运营等展开全方位合作。 签约现场,成都市武侯区人民政府副区长,发改局局长,
在PlayStation决定取消后,Xbox现在将发布由《合金装备》创作者小岛英夫(Hideo Kojima)即将推出的游戏《物理》。PlayStation、Xbox、小岛制作公司和小岛本人纷纷宣布这一意外的交换。索尼出版了Kojima Productions之前的两款《死亡搁浅》游戏,称这是一个“艰难的决定”。
9月10日,阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。
推出最强图像生成模型仅一天,OpenAI即限制竞品广告投放 Jiemian.com
在2026 Inclusion外滩大会上,为加快智能服务生态发展,支付宝宣布设立“智能体涌现奖”,每年投入1000万,寻找有用、有趣的生活智能服务,年度大奖奖金100万元。9月10日起,在支付宝内右滑对阿宝说“智能体涌现奖”,即可了解赛事、报名参赛。 开发者无须编写代码,通过自然语言即可搭建,入围或获奖后,除获得现金奖励,适合面向市场的成熟作品还可接入阿宝,为10亿用户提供服务,开展持续经营。 蚂蚁集团CEO韩歆毅认为,8小时之外的智能
大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R
📌 One-Sentence Summary AEM 将智能体的正确性分解为逐轮的子指标,精准定位级联错误的根本原因。 📝 Summary Amazon Web Services 推出智能体评估指标(AEM),这是一个轮次级别的框架,将智能体的正确性分解为两个子指标——真实性和完整性——使每一轮都能被独立评分。文章解释了为何单轮评估会遗漏多轮对话中的级联错误,并概述了现有整体性指标的局限。AEM 的层级结构区分了回复轮和动作轮,对自然语
“AI实习生”能研发自己,OpenAI上市前安全关能过吗? 21jingji.com
轻量版LingBot-World 2.0
OpenAI呼吁美国制定强制性全国AI安全规则,并支持四项加州法案 finance.sina.com.cn
OpenAI被指利用他人未公开成果抢先破解千禧年数学难题 集微网
OpenAI称AI用88小时攻克“千禧年难题”,陶哲轩发出警告 集微网
长期代理已将LLM服务变成了一项投入繁重的工作量。重复的预填充和数百万个令牌上下文会导致KV缓存给HBM、SSD容量和带宽带来压力。DeepSeek AI围绕这一瓶颈构建了其最新版本。DeepSeek-V4.1-Flash是一个多模式专家混合模型,具有552 B主干参数、196 B额外的Engram参数和1 M令牌上下文窗口。It [.] The post DeepSeek AI Released DeepSeek-V4.1-Flash
主打生成更快,细节更好,改图也终于越来越像“真·修图”了。
过去一年具身智能很火热,却一直没有回答关键问题:训练机器人到底更应该依赖真实数据还是仿真数据?通用大模型会不会“降维打击”具身模型?机器人什么时候才能真正跨过Demo,进入可持续商业化? 在2026 Inclusion·外滩大会圆桌论坛《物理智能——分歧与抉择》上,苏度科技联合创始人、CEO韩铮,蚂蚁灵波科技首席科学家沈宇军,自变量机器人创始人、CEO王潜,以及破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲,就数据、智能和场景三
HN ð4· 1 评论
OpenAI和GSA将为符合条件的联邦、州、地方和部落政府提供0美元的许可费,50%的使用折扣,并扩大网络防御支持。
引入ChatGPT for Financial Services,将内置财务数据和GPT-6 Astra相结合,用于研究、建模和客户准备材料。
万级并行推理背后,是构造、修正与验证的完整闭环。 作者丨 郑佳美 编辑丨岑 峰 9 月 8 日,OpenAI 公布了一套针对 Navier–Stokes 千禧年问题的有限时间奇点构造。一个仍在训练的内部模型,配合约 1 万个 Agent 持续搜索约 88 小时,随后又用 Lean 完成形式化。 按照 OpenAI 给出的结果,这套构造能够让三维流体在光滑外力和有限动能条件下,演化到局部速度无界。 消息出来后很快引发争论。航空航天工程教授
OpenAI 攻克千禧难题?深度拆解 1 万个 Agent 如何造出流体奇点 雷峰网
沃尔沃停产插电式混合动力车XC40已经大约三年了。轻度混合动力版本与电动EX 40一起仍在美国和其他地方销售。今天,沃尔沃宣布将恢复PHEV版本并对其进行重大翻新。明年初抵达经销商时,新款XC40 [.]
GUI 已难拦机器,防线转向身份与权限校验。 作者丨 郑佳美 编辑丨岑 峰 一个 AI,刚刚在网页上证明了自己不是机器人。 9 月 7 日,OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I’m Not a Robot》全部 48 关。 前面还是图片识别、文字判断这些熟悉的人机验证,后面很快变成拖拽、停车、视觉搜索、节奏控制和逻辑小游戏。Astra 一路看屏幕、操作鼠标键盘,再根据页面
HN ð572· 577 评论
从一次投放到一套增长系统,AI 让海外达人营销可规模化复制
浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10% 投资界
📝 今日导语 架构师 Agent 追溯设计约束,Anthropic 推演 AI 经济,RLM 操作长上下文;据此规划系统、部署与检索。 🏷 今日关键词: 架构师 Agent Anthropic 情景探索器 RLM 长上下文 任务断点续传 Codex Harness ADK for Kotlin Kimi K3 流式加载 📰 今日精选内容 【AI 创新实践】“架构师 Agent” 系统化落地 阿里云开发者 · 文章 · 评分 92 我们经
AI办公大战硝烟再起:大厂不仅亲自下场,还跟生态伙伴联起手。 此前雷峰网在《 大厂AI To B大战,这回战场为什么是办公? 》一文中曾提到,各家手里的牌不同,打法也各有侧重: 腾讯C端基因重,做大WorkBuddy个人用户规模的同时,也在向企业端渗透;阿里手握大批企业客户,千问办公从B端直接切入;字节则把拥有庞大C端用户基数的豆包作为核心抓手,推出豆包工作。 过去两个月,内部整合是三家大厂AI办公大战的主线;如今,战线收拢、押注一个核
飞猪与AI版支付宝“阿宝”达成深度合作。用户向“阿宝”发出“一句话指令”,即可获得机票及景区门票预订,酒店会员注册、权益查询等服务。 以机票预订为例,用户对“阿宝”说出类似“下周五上海飞成都,帮我订飞猪特价机票”的需求,“阿宝”自动识别城市、日期、价格划算等需求,并通过MCP(模型上下文协议)调用飞猪服务,返回带推荐理由的结果卡片,点击即可跳转至支付宝上的飞猪小程序完成下单。如果用户只提供了目的地,没给具体出行时间,“阿宝”会智能追问补
量子计算这个“狼”,真的要来了吗? 9月10日,在2026 Inclusion·外滩大会主论坛上,中国科学技术大学上海研究院执行院长陆朝阳教授给火热的量子计算“降了降温”。“量子计算虽然很卷,目前其实还很‘菜’。”陆朝阳说。 在他看来,量子计算当然重要,但它并不是一台“加速一切”的超级机器,只有对少数具有特殊数学结构的问题,量子计算才能提供真正的加速。至少到目前为止,没有科学界公认的证据表明量子计算已经对金融产生明确的实际加速;对于今天
Anthropic研究员辞职 警告称人工智能巨头在“拿人类生命作赌注” 新浪网
HN ð63· 33 评论
模型可以开源,部署经验不能
9月9日下午,在2026 Inclusion·外滩大会“智能体时代的安全坐标与责任边界”见解论坛上,《智能体身份鉴别与授权技术框架》《智能体运行时安全技术要求》两项团体标准正式启动。 两项标准由中国网络空间安全协会提出,蚂蚁集团联合研究院所、运营商、互联网厂商等单位共同参与编制,旨在推动智能体安全从企业技术实践走向行业共同规范。 随着大模型能力持续提升,智能体正从提供信息和生成内容,走向自主规划、调用工具、访问数据和执行操作。由此带来的
9月10日,在2026 Inclusion·外滩大会主论坛上,普林斯顿大学人工智能创新中心主任王梦迪教授提出一个问题:AI距离自主发现新科学还有多远? 她的判断是,今天的大模型已经掌握了大量人类知识,但在真正的科学发现上仍然存在明显局限:大模型更擅长找到“最可能”的答案,而真正的新发现,往往藏在概率分布的长尾里。 王梦迪团队近期与普林斯顿大学社会学教授谢宇合作,用ChatGPT、Claude等大模型进行“模拟人生”实验。例如,让模型模拟
近日,韩国济州岛Campertree(香樟树)酒店度假村携手自动驾驶企业NT1,在户外园区启用新石器自动驾驶无人配送车,为宾客运送行李与日常用品。据悉,NT1为新石器在韩国的本地合作伙伴,此次部署也是新石器无人车首次进入济州户外度假场景运营,标志着其在韩国从试点示范迈向规模化商业落地的全新阶段。 济州岛香樟树酒店度假村占地约12万平方米,拥有137栋独立式客房。总经理朴雪姬表示,考虑到场地广阔、客房分散的特点,为消解客人在前台与客房之间
HN Ÿ 3 · 0 评论
近日,国际商业技术洞察机构Gartner发布 2026 年度全球《战略云平台服务魔力象限》报告(Magic Quadrant™ for Strategic Cloud Platform Services),阿里云首次进入该报告“领导者”象限,成为全球领导者阵营中唯一的中国厂商、亚太厂商,与亚马逊AWS、微软、谷歌、Oracle一同跻身全球顶级云服务商行列。 报告指出,全球云基础设施与平台服务市场 2025 年规模达 2970 亿美元,本
OpenAI 抄袭、威胁数学家?“AI 攻克千禧难题”秀,终成 OpenAI 和 Anthropic 的大战 InfoQ-CN
Anthropic 15亿美元AI版权和解金开始发放 Sohu
“AI对齐专家”入驻OpenAI董事会,立即警告AI失控风险及灾难性后果! 财联社
AI日报:OpenAI推出ChatGPT Images 2.5;曹操出行联合豆包上线AI打车服务;达芬奇接入 Claude Code 电子工程专辑
OpenAI刚曝光循环架构,这家公司更早将其用于世界模型 新浪网
OpenAI悄然限制竞品AI广告投放 广告业务面临收入考验 品玩
一个27岁的AI研究员从Anthropic辞职了,因为他担心AI会导致人类灭绝。 投资界
9月9日,苹果发布会同日,美国洛杉矶会展中心,阿里国际站一年一度的海外买家大会——CoCreate 2026开幕。美国当地超15000家中小企业到场,这一数字去年还停留在3000人。 从B2B到A2A,1.5万美国老板在CoCreate现场寻找AI时代的下一门好生意,这也使得今年的CoCreate,成为了中国卖家探测海外真实市场水温的绝佳窗口。 当日,阿里国际站旗下全球电商AI工作台Accio,也宣布在GitHub上开源首个真实电商Ag
9月9日,美国洛杉矶会展中心,阿里国际站一年一度的海外买家大会——CoCreate 2026开幕。美国当地超15000家中小企业到场,这一数字去年还停留在3000人。 (图:洛杉矶会展中心,CoCreate 迎来15000家美国中小企业) 参会嘉宾,更是汇聚了一帮商业领域的大咖,全球支付与金融科技公司Fiserv首席执行官Takis Georgakopoulos,有“魔术师”之称的NBA传奇巨星、MJE董事长及CEO约翰逊,Beyond
LandingAI已推出Emotitic Document Extraction Gen 2,这是在DPT-3模型系列上对其文档堆栈的重建。块被退役,取而代之的是文档、页面和块树。DPT-3 Pro以置信度分数计算,DPT-3 Verity以置信度分数计算,Parse计费现在计算输出字符而不是平面页面。Gen 1代码不会针对Gen 2端点运行。LandingAI发布带有DPT-3 Pro和DPT-3 Verity的统计文档提取Gen 2
美国执法机构警惕Meta AI眼镜,担忧被用于秘密拍摄敏感设施 VR陀螺
9月9日,百度营销举办「AI 创无界 智投无忧」产品发布会,全面展示了依托AI技术重构创意生产与广告投放全链路的最新成果,并正式发布擎舵3.0营销创意智能体与全新升级的智能投放产品。 百度2026年Q2财报显示,AI业务收入占比已经连续两个季度达到50%,AI 已经成为百度核心增长引擎。百度集团副总裁、移动生态大商业事业部总经理平晓黎在致辞中表示:百度营销已构建起覆盖创意生产、全域投放、长效经营的全链路闭环,擎舵3.0让创意生产人人可为
HN ð18· 2 评论
HN ð15· 9 评论
OpenAI禁止在ChatGPT投放竞品AI广告 Adobe等广告主受影响 观点网
【北京,2026年9月10日】 —— 营销科技巨头蓝色光标与全球达人营销 AI 平台 AhaCreator 正式宣布达成深度合作。 蓝色光标将结合其全球营销服务能力、客户资源与品牌增长经验,向有境外达人营销需求的广告主提供AhaCreator 平台达人资源,为品牌全球化增长提供 AI 驱动的达人营销能力;AhaCreator 则提供覆盖 500 万名全球优质达人的资源网络(其中包括 15 万名在该平台有成交记录的入驻活跃达人),以及由十
OpenAI切断Adobe等企业在ChatGPT投放部分竞品AI产品广告 新浪财经
价值与成本,Anthropic和智谱的轮番验证 潮起网
9月9日,以“JoyAI · 跃迁物理世界”为主题的JDDiscovery-2026京东全球科技探索者大会在北京举行
9月9日,2026 年中国知识产权年会知识产权出版社同期活动上,国家知识产权局直属单位知识产权出版社联合蚂蚁集团旗下芝麻企业信用,正式发布“产品技术实力评价”服务。 这是国内首个面向具体产品的技术实力评价服务——过去技术评价多落在企业层面或以专利数量为主,该服务将评价颗粒度下沉到“具体产品”,从技术、经济、时效三个维度综合评价,依据团体标准《产品技术实力评价报告》( T/CEEAS 015-2026)出具双方联合盖章的电子证书。 有专利
OpenAI宣布支持加州四项法案 推动强制性国家级安全规范 观点网
具身智能规模化前夜,NVIDIA在修一条所有人都要走的路 凤凰网科技
OpenAI“攻克”千禧年难题,为什么成了和一位数学家的舆论战?这是一个目前的完整梳理 thepaper.cn
今天,我们发布了WeWorm的演示,这是第一个通过微信通话在iOS和Android中传播的零点击蠕虫。[...]受害者根本不需要接听电话,也不需要与手机互动。即使他们确实回答了,他们也什么也没听到,而且攻击仍然成功。[...]我们的团队与人工智能合作,发现了这个错误,并在大约两天内编写了第一个远程代码执行(RCE)漏洞利用。构建蠕虫又花了一周的时间。这种规模的蠕虫曾经需要更大的团队数月的时间才能完成。人工智能已经可以完成这里的大部分工作
OpenAI新董事严厉警告:AI失控将是灾难性的,大多数人可能丧命 凤凰网科技
赶上了API限时五折
OpenAI宣布知名AI末日论者加入董事会 安全审查持续收紧 凤凰网
AI早报 |OpenAI称使用内部模型破解千禧年大奖难题;Meta推出其首款个人智能体Muse Jiemian.com
AI研究员辞职警告:超级智能可能在本十年末导致人类灭绝 虎嗅网
OpenAI"失控"智能体活动范围远超此前披露,公司任命安全研究员入驻董事会 华尔街见闻
消息人士称,Listen Labs放弃了Menlo Ventures签署的C系列投资意向书。
使用Agents API构建和启动云代理,Agents API是一种托管服务,由Codex工具支持,用于编排、长时间运行的会话和工具使用。
工具:.blend URL Viewer我继续使用GPT-6 Astra和Blender(请参阅我的TIN)玩得很开心。作为帝国法贝热复活节彩蛋的忠实粉丝,我一直认为制作一些庆祝流行文化的新彩蛋会很有趣。昨天我决定通过运行这个提示来尝试新的ChatGPT Images 2.5:生成一张以电视节目Pluribus为主题的神话般的鸡蛋的照片-首先研究它给了我这个-老实说,对于第一次尝试来说还不错!然后,为了看看会发生什么,我将该图像粘贴到运
报道:OpenAI预计2030年算力支出7500亿美元!公司仍直呼“算力非常不足” 华尔街见闻
OpenAI智能体被曝借十余站点秘密传信,公司对此沉默数月 凤凰网科技
OpenAI牵手三星开发下一代芯片;智元发布AGILE2.0感控一体模型|数智早参 mrjjxw.com
九月的苹果活动总是充斥着信息和令人兴奋的新产品,今天的活动也不例外。苹果宣布推出首款可折叠手机iPhone Duo,以及iPhone 18 Pro和Pro Max;主动降噪(非国大)现已安装在最便宜的AirPods型号AirPods 5上; Siri Recap功能已登陆[.]
谷歌开源了Mantis,这是一个针对人工智能编码代理的安全审查技能的堆栈不可知工具包。它运行完整的漏洞生命周期:扫描代码、过滤误报、在沙箱中重现错误、对其进行修补、重新攻击补丁,然后对风险进行评分。Apache 2.0,并记录为仅演示。Google开源Mantis:一个让编码代理查找、复制和修补漏洞的模块化技能工具包的帖子首先出现在MarkTechPost上。
苹果看到了原因:iPhone Pro阵容中再次出现了黑色型号。去年,苹果公司对iPhone 17 Pro的颜色进行了大胆的尝试,提供了闪亮的橙色、闪亮的银色和深蓝色。别误会我的意思,他们看起来不错。但[.]没有黑色(或深灰色)
了解如何在带有vLLM的Amazon SageMaker HyperPod上部署Qwen 3.8 -2. 4 T-A95 B(一个2.4万亿参数开重模型)。本演练涵盖集群配置、NVFP 4量化以及具有内置推理、工具调用和本地STP推测解码的OpenAI兼容端点。
保罗·克里斯蒂安诺(Paul Christiano)是一位专注于对齐的有影响力的人工智能研究员,他将加入OpenAI基金会,成为其董事会成员。
苹果公司今天宣布推出该公司首款配备折叠屏的设备iPhone Duo,但第一款就到此为止了。由于三星和谷歌的努力,Duo不仅远非市场上第一款可折叠产品,而且它也不是第一款被称为Duo的产品。前苹果[.]
据404 Media早些时候报道,WordPress.com所有者Automattic的首席执行官马特·穆伦韦格(Matt Mullenweg)已被带薪休假。Mullenweg在该媒体的内部消息中声称,Automattic首席财务官Mark Davies与董事会成员“密谋”让他休假。“他们投票让我参加带薪[.]
雅各布·考克森(Jacob Coxon)接受《连线》杂志采访,讨论了Anthropic内部的“迷你曼哈顿项目”、对齐问题,以及为什么人工智能实验室只剩下几年的时间来确保其系统的安全。
在苹果今天的发布会之后,花更多的钱买一部新手机似乎是不可避免的。新的iPhone 18 Pro和Pro Max的起价分别为1,199美元和1,299美元-比它们的前辈价格上涨了100美元。你也不能通过选择旧版iPhone来逃避价格上涨,因为苹果将这些iPhone的价格提高了[.]
马萨诸塞州已成为数月来第三个对数据中心开发实施新限制的州。
Suno的新v6 AI音乐模型是其首个在唱片行业支持下制作的。Suno的Jack Brody告诉The Verge,v6“是从头开始训练的,使用了一组新的数据,其中不包括我们之前模型训练的相同数据。“这些数据包括许可的内容[.]
直面 “性价比之战”!OpenAI或调整定价策略 降价迎战开源模型 财联社
OpenAI周二宣布它已经解决了数学界传奇的千禧奖问题之一,这应该是一个胜利的时刻。结果既是一项不可否认的成就,也是人工智能改变数学的惊人证明。但在正式宣布之前,这一突破因不寻常的[...]
市检察官办公室已要求Meta解释有害广告如何在Facebook和Instagram上反复播放。该公司声称这些广告不受该市管辖。
OpenAI与Anthropic游说标普争取BBB-评级:逼近万亿估值撞上持续亏损的信用门槛 华尔街见闻
Anthropic 预训练研究员宣布离职,称 AI 实验室拿人类生命押注超级智能- OSCHINA - 开源 × AI · 开发者生态社区 OSCHINA
在周三的iPhone Duo发布会上,苹果宣布了一些新的Siri AI音频智能功能,包括Siri Recap、Live倒带、声音识别和音乐识别。在宣布这一消息的同时,苹果还发布了一份文件,阐述了其计划如何平衡人工智能“环境监听”和用户隐私。它说来自新[.]的原始音频
苹果在“惊喜闪耀”活动中推出了Apple Watch Series 12和Apple Watch Ultra 4。新款手表对健康传感器和跟踪进行了大幅改进,能够背诵音频转录和摘要,以及系列12的陶瓷外壳选项。尽管有新功能,但手表[.]
与同行看法背道而驰 Anthropic退出关键行业联盟 财联社
苹果表示,其新手表不会保存原始音频,但可以转录最近的语音并总结周围对话的功能引发了有关同意、隐私以及人们在知道自己总是可以被录音时如何行为的新问题。
美国敦促人工智能公司识别中国用户,然后秘密地将其切换到功能较差的型号。
主要活动是这家科技巨头备受期待的首款可折叠手机iPhone Duo。
📌 One-Sentence Summary 欧盟 AI 法案(Omnibus 之后)时间表:GPAI、透明度和高风险 AI 的关键日期。 📝 Summary 欧盟 AI 法规(条例(EU) 2024/1689)分阶段实施。通用人工智能(GPAI)义务自 2025 年 8 月起生效;第 50 条透明度要求和 AI 办公室执法自 2026 年 8 月 2 日开始。人工智能数字综合条例(条例(EU) 2026/1744)调整了高风险截止日期
2026年8月,Amazon Bedrock、Amazon Bedrock AgentCore和Strands上的AI构建者发布了以下内容:OpenAI模型的百万令牌上下文、跨区域推理、在专用计算上运行长达14天的代理、扩展的AWS GovCloud可用性以及用于物理部署的Strands Robots。
苹果刚刚发布了其首款可折叠iPhone iPhone Duo。这款新手机拥有5.4英寸的外屏和7.6英寸的内屏、两个背部摄像头、用于身份验证的Touch ID、IP 68评级以及各种巧妙的软件技巧,让iOS在新设备上感觉更自在。预订从[.]开始
Anthropic发布了一个经济模型,其中包括美国经济到2030年的三种情景。在极端情况下,产出每4.5年翻一番,知识工人失业率达到17.9%。首席执行官达里奥·阿莫代本人在5月发出的警告正好落在了这个最极端的桶里。文章Anthropic建立了一个经济模型,将其首席执行官最惨淡的就业预测框定为一个离群值,这一点首先出现在The Decoder上。
一比根号二的小胖折叠
苹果表示,它在期待已久的可折叠手机的制造过程中使用了人工智能和3D打印。
三星领投,Mistral 估值冲上240亿美元,创欧洲AI融资纪录 新浪网
在我从一个强大的开源模型中移除安全护栏后,它发现了我的家用设备中的漏洞,并入侵了一台PC。但它也告诉我如何让一切变得更加安全。
AI“自我演进”可能彻底失控?Anthropic顶尖大牛愤然离职! 财联社
该更新使用Apple Intelligence来更好地理解您的健康数据。
了解Heurist如何在Amazon Bedrock AgentCore上构建Heurist Finance(对话式人工智能投资工作台)。这个客户故事展示了AgentCore支付、身份、内存、代码解释器和Observability如何让一个小团队购买每个查询的优质市场数据,在沙箱中隔离分析,并保持每一个操作都可审计。
苹果推出了Apple Reference Image,以帮助用户确定照片是否已被编辑,包括人工智能所做的更改。
作者:马亦玲、赵亦伦、吴思红|一个研究想法可能是新颖的、连贯的、科学上合理的,但它提出的方法可能仍然不够具体,无法忠实地实施。我们研究面向实现的研究方法规范的编码准备情况,定义为它们是否为称职的实现者或编码代理提供足够的方法学信息来构建预期的方法
作者:Phil Assheton|我们提出了基于神经网络的规范化流程的简单分解,该流程仅基于来自感兴趣分布的样本生成器,自然地揭示了存在滋扰参数的关键统计量(或接近的统计量)。我们表明,从其$p$-值与均匀值的最小平均KL偏差意义上来说,该统计数据几乎是关键的,我们认为它可以是关键的
HN ð35· 8 评论
作者:PM阿罗诺、内森·卡卢斯、帕特里克·洛帕托|我们证明了具有独立单位方差高斯臂、平均值为$[0,1]$和唯一的最优臂的固定置信度最佳臂识别的间隙-令$p_r$是手臂贡献的$H$的分数,其中$2^{-(r+1)}<Δ_i\le2^{-r}$,并令$\mathrm{Ent}(I)=\
作者:李晓宇、韩安迪、江娇|极限下的语言生成要求从未知无限语言的每一个详尽的积极呈现中获得有效的不可见元素。我们将这项任务描述为可计数宇宙上的任意家族。当每个目标都可以被分配一个有限的正见证时,生成是可能的,以便任何有限样本激活的目标都具有无限的公共交集。的
作者:陈彦哲、白泽晨、曹之军|基金会视觉语言模型(VLM)展现了有关世界的广泛智能,但将这种智能转化为机器人控制仍然具有挑战性。我们介绍了Show-Buttons,这是一个同步的Buttons,使VLM能够通过将意图与动作联系起来的紧凑语义界面“扮演”机器人。Show-Buttons暴露了离散的语义动作单元,VLM可以自然推理,而emb
作者:Ashwin Nayak、Xingyu Zhou|当每次测量可能共同作用于最多$t$样本时,我们确定低阶量子状态断层扫描的最佳样本复杂性。对于足够小的$\varepsilon$,估计$\mathbb{C}' d$上的未知状态最多为$r$,以恒定成功概率跟踪规范错误$\varepsilon$需要并且可以使用$\left(\fRAC{Dr}{\varepsilon ' 2} \max\left\{1,/fr
作者:Menachem Finkelstein、Diana Legende Levy、Zohar Yakhini|信用违约预测是一个表格分类问题,其中F1的适度收益直接转化为财务风险的减少。我们询问,瞬时量子多项时间(IQP)电路是否可以在相同的特征预算下产生比原始经典基线和核心PCA(最强的无监督经典非线性替代方案)改进分类器的特征。
该公司还辩称,其设备上型号为消费者提供了更多隐私。
作者:Siddharth Gupta、Jitin Singla|在实时结肠镜检查中,推理时无法获得基本真相注释,因此息肉分割模型可能会悄然失败。我们提出了基于裁判的质量估计(RBQE),这是一个无参考框架,用于测量初级分割模型和同一图像上独立训练的裁判之间的一致性。RBQE是根据从f中提取的标准化1,223张图像外部基准进行评估的
作者:Blake Stenstrom、Charangan Vasantharajan、Brian Sathianathan|企业部署系统,而不是检查点。可用能力共同取决于权重、服务路线、精度、输出合同和利用率,但所有18个审计基准都对广告的模型标识符进行评分。我们将其视为测量错误,并给出一个使其可报告的协议。它有三个部分。金盲能力约束飞行前验证路线可以执行评估
作者:Saurabh Sihag、Andrea Cavallo、Elvin Isufi|本文概述了coVariance神经网络(VNN)的理论基础,即图神经网络(GNN)将协方差矩阵作为图进行操作。协方差矩阵在各个领域中无处不在,因此,GNN的部署通常利用成对统计依赖关系图。关于GNN的现有理论贡献考虑抽象的GR
HN ð156· 61 评论
HN ð39· 12 评论
HN57· 33 评论
Paul Christiano加入了OpenAI基金会董事会及其安全和安全委员会,带来了人工智能协调、安全和标准方面的经验。
“我们确实坚信人工智能可以杀死所有人类!"
人类基因组的大多数单碱基变化没有任何作用,但有一些是显着的。
📌 One-Sentence Summary Google DeepMind 研究负责人 Peter Battaglia 解释了 AI 天气模型如何把全球观测转化为更早、带概率且更贴近决策需求的预报,同时审慎说明评估能够证明什么、不能证明什么。 📝 Summary Hannah Fry 与 Peter Battaglia 以飓风 Melissa 为例,说明更早且更有把握的预报为何能改变疏散和防灾准备。对谈回顾了天气预报如何从基于物理方程
OpenAI深化与三星合作,推进下一代芯片研发 华尔街见闻
人工智能公司一直在谈论超级智能人工智能,就像这是不可避免的一样,但最近OpenAI的Hugging Face漏洞等安全事件表明了部署比人类能力更强的人工智能系统的潜在危险。那么,当我们无法可靠地控制这些系统的功能时,会发生什么呢?在TechCrunch的Equity播客的本期节目中,丽贝卡·贝兰(Rebecca Bellan)与人工智能研究员、企业家、现任美国执行董事康纳·莱希(Connor Leahy)一起参加了节目。
在9月举行的IBC会议上11-14在阿姆斯特丹,创意、技术和商界齐聚一堂,将想法转化为行动,并讨论整个媒体和娱乐行业的创新。来自170多个国家/地区的44,000多名与会者齐聚一堂,在14多个大厅和户外空间探索1,300多个展览,有600多名演讲者[.]
一对老夫妇坐在电影院里。叠加的是“Teulluride电影节”和“爱,渲染”
一幅插图图形以充满活力的绿色背景为背景,具有美式橄榄球元素,包括金色奖杯、蓝色头盔、银哨、足球、迷你记分牌和比赛图表,并带有Google Search中AI模式的图标