AI 日报hiw3c.com

2026-09-22全球 AI 要闻精选,来自 30+ 信息源

聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。

  1. The Decoder 国际媒体 快照

    OpenAI表示,经过一个月的培训,其内部模型就解决了100多个长期存在的数学问题

    OpenAI表示,经过短短一个月的培训,新的内部模型就解决了100多个开放数学问题。面对数学家的批评,该公司支持高级研究所的一个独立咨询小组。但OpenAI已将其研究速度排除在该组织的咨询角色之外。文章OpenAI称,经过短短一个月的训练,其内部模型就解决了100多个长期存在的数学问题,首先出现在The Decoder上。

  2. MIT Tech Review AI 国际媒体 快照

    不要被今年夏天的人工智能炒作所愚弄

    这是一个繁忙的几个月的人工智能炒作。4月底,Anthropic声称其模型Claude Mythos比大多数安全专家更善于发现软件漏洞。然后我们发生了OpenAI-Hugging Face黑客事件,之后Anthropic(自豪地)和Meta(不情愿地)披露了涉及其模型的类似事件。这是继…

  3. The Verge 国际媒体 快照

    你能忘记你对Meta的感觉吗?

    2021年,当一名举报人提出Facebook伤害儿童的戏剧性指控时,首席执行官马克·扎克伯格在Facebook上发表了反驳。“我们非常关心安全、福祉和心理健康等问题。很难看到歪曲我们的工作和动机的报道,”他在给Meta工作人员的一份说明中写道,他[...]

  4. 雷峰网·AI 科技评论 中文媒体 中文 快照

    做每个人的专属AI助理,千问加速打造Personal Agent

    9月22日,在2026年云栖大会上,千问宣布将加速打造 Personal Agent。千问产品负责人郑嗣寿表示,自去年上线以来,让每个人拥有自己的 AI 助理,始终是千问不变的目标。依托Qwen 3.8系列模型强大的Agentic能力,千问正在构建全新的Personal Agent形态,为 3 亿用户提供持续、个性化的智能服务。 当天,千问公布了多项围绕 Personal Agent 的阶段性进展:在用户授权下接入健康、运动等个人数据,

  5. 雷峰网·AI 科技评论 中文媒体 中文 快照

    做每个人的专属AI助理,千问加速打造Personal Agent

    9月22日,在2026年云栖大会上,千问宣布将加速打造 Personal Agent。千问产品负责人郑嗣寿表示,自去年上线以来,让每个人拥有自己的 AI 助理,始终是千问不变的目标。依托Qwen 3.8系列模型强大的Agentic能力,千问正在构建全新的Personal Agent形态,为 3 亿用户提供持续、个性化的智能服务。 当天,千问公布了多项围绕 Personal Agent 的阶段性进展:在用户授权下接入健康、运动等个人数据,

  6. The Verge 国际媒体 快照

    苹果公司首个现场音乐场地将在其英国总部地下开业

    苹果公司正准备在英国开设一个新的“最先进”现场音乐场所,这是一个可容纳600人的空间,用于举办表演、录音和视频广播。该场馆名为Apple Music Hall,位于伦敦标志性的巴特西发电站的苹果欧洲总部地下,定于下周9月28日开放。有关[.]的详细信息

  7. 雷峰网·AI 科技评论 中文媒体 中文 快照

    对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线

    当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。 作者丨 张 璐 编辑丨马晓宁 过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。 然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试

  8. 雷峰网·AI 科技评论 中文媒体 中文 快照

    2026 中国民营企业500强发布,华为、腾讯研发投入前二

    全国工商联 9月22日发布“2026中国民营企业500强”榜单和《2026中国民营企业500强调研分析报告》。京东集团、阿里巴巴(中国)有限公司、恒力集团有限公司、华为投资控股有限公司、比亚迪股份有限公司、腾讯控股有限公司位居榜单前六位。在研发投入方面,华为、腾讯排名前二,保持领跑地位。 500 强榜单及报告基于全国工商联今年组织开展的第 28 次上规模民营企业调研,共 6350 家 2025 年营业收入 10 亿元以上的企业参加,其中

  9. 雷峰网·AI 科技评论 中文媒体 中文 快照

    全球首款 799g 14 英寸 x86 Laptop,来自深圳

    2025年9月,宏碁在IFA展发布 Swift Air,全球首款 16 英寸999g量产轻薄本正式落地,方案来自深圳ODM微步。彼时行业评价:这套方案“断代式领先了整个笔记本电脑产业链9-12个月”。一年之后的IFA 2026,宏碁再次联合微步,发布全球首款 799g 14英寸(X86 / 50Wh)笔记本 Swift Blade 14。微步将同一套平台化能力从16英寸跨尺寸迁移至14英寸,赋能终端品牌再次刷新纪录。如今,16英寸999

  10. 雷峰网·AI 科技评论 中文媒体 中文 快照

    WorkRally 首发接入Hy Image3.5 preview,为专业影视创作开放两周免费体验

    9 月 22 日,腾讯混元正式发布 Hy Image3.5 preview。腾讯视频专业影视智能平台 WorkRally 首发接入该模型,即日起两周内向平台创作者免费开放,覆盖剧集分镜、影视物料、角色与场景设定等专业创作场景。 WorkRally 是腾讯视频推出的首款面向精品内容制作的工业级 AI 平台,覆盖从剧本解析、分镜生成、内容生产到资产管理与团队协作的完整链路,具备专家级 Agent、S+ 级影视动漫技能库与智能流水线三大核心能

  11. BestBlogs·每日早报 BestBlogs 精选 中文

    EP183 · Jev 系统一模型、AI 软件工厂、工作流程资产 · 09-22 早报

    📝 今日导语 Jev 用可校准决策接入代码,Warp 把开发做成可度量工厂,UiPath 沉淀工作地图;借此判断生产 AI 的控制点。 🏷 今日关键词: Jev System One AI 软件工厂 工作流程资产 生产级控制平面 Loop engineering AI 医疗 📰 今日精选内容 Jev:面向生产软件的快速决策模型 Latent.Space · 文章 · 评分 90 工程团队的 AI 软件工厂实战手册 | Warp CEO

  12. MarkTechPost 国际媒体 快照

    NVIDIA推出SoL-Pi:自动研究循环可将编码代理令牌流量减少高达49%

    英伟达研究人员发布了SoL-Pi,4开源Pi编码代理的利用机制,该代理由在535个环境中运行自动研究循环的人工智能发现。在EdgeBench上,SoL-Pi将代币流量减少了44.7%至49.0%,API成本减少了约33%,同时在GPT-5.6 Sol和Opus 5上保持了Pi约94%的分数。NVIDIA推出SoL-Pi:自动研究循环,可将编码代理令牌流量减少高达49%。

  13. 雷峰网·AI 科技评论 中文媒体 中文 快照

    vivo WATCH 6正式发布:外表有型、内在专业,树立轻户外智能腕表新标杆

    2026年9月21日,vivo全新轻户外智能腕表——vivo WATCH 6正式发布,并同步开启预售。作为一款定位 轻户外运动 的智能腕表,vivo WATCH 6在质感外观、跑骑运动指导、健康监测与智能便捷体验四大维度实现全面进阶,以全系高端蓝宝石玻璃表镜、航天级钛合金表体,搭配全链路专业运动指导与智能便捷体验,让用户从城市日常到户外出行,每一次抬腕都从容自在。 地平线美学尽显精致,重塑腕上质感新高度 智能穿戴设备不仅是科技产品,更是

  14. 雷峰网·AI 科技评论 中文媒体 中文 快照

    vivo首款耳夹耳机正式发布,vivo Buds Clip点亮耳畔“微光小C环”

    2026年9月21日,vivo Buds Clip 耳夹耳机 正式发布。 作为vivo首款 耳夹耳机 , 新品从全天佩戴需求出发,围绕设计美学、舒适佩戴、耳夹听感与连接交互进行系统打磨,自然微光美学与轻量化耳夹设计塑造耳畔的“ 微光 小 C 环” , 高清质感人声、骨传导AI通话降噪与跨生态无缝三连接 等 , 则进一步满足用户在多种场景下的使用需求, 让耳机从聆听设备延伸为能够自然融入日常穿搭与生活的随身单品。 自然微光美学,兼顾精致外

  15. 雷峰网·AI 科技评论 中文媒体 中文 快照

    影像表现全面进阶 vivo X500系列影像旗舰新品正式发布

    2026年9月21日,vivo在上海正式发布全新影像旗舰vivo X500系列。 作为vivo将动态影像提升至公司级战略后的开篇之作, X500、X500 Pro、X500 Pro Max 三款新品 以" 拍照和视频体验双优 "为目标, 完整落地vivo首个为动态影像而生的技术体系—— 蓝图动态影像技术栈, 重构 移动影像边界。 vivo影像战略 始终聚焦一个目标,将 人像、长焦、演唱会等 用户在意的场景体验 , 持续提升 并超越期待。

  16. 雷峰网·AI 科技评论 中文媒体 中文 快照

    千问新一代AI硬件云栖大会首次集中亮相,10月13日现货发售

    9月22日,新一代全系列千问 AI 硬件在云栖大会首次集中亮相,包含千问AI眼镜N1、N1 Pro及千问AI耳夹式耳机。三款新品当天同步开启线上预约,并将于10月13日现货发售。 记者在展区体验了解到,N1系列搭载5000万像素传感器,支持第一视角拍摄。其中,N1 Pro支持眼动追踪和虹膜支付,用户看向展品并提问时,AI可借助视线信息判断用户所指的对象。另一款新品千问AI耳夹式耳机则结合Bose调音与AI助理能力,支持面对面翻译、AI听

  17. MarkTechPost 国际媒体 快照

    SpaceXAI发布Grok 4.7:更大的基础型号,价格与Grok 4.6相同2美元/6美元

    SpaceXAI发布了Grok 4.7,这是其用于编码、代理任务和知识工作的新旗舰模型。Grok 4.7构建在更大的基础模型和更长的强化学习运行之上。它的发货价格和速度仍然与Grok 4.6相同。它可以部署吗?是的,作为托管模特。您可以致电Grok-4.7 [.] SpaceXAI以与Grok 4.6相同的2美元/6美元价格发布Grok 4.7:更大的基本型号的帖子首先出现在MarkTechPost上。

  18. 雷峰网·AI 科技评论 中文媒体 中文 快照

    人工智能促进健康全球倡议2026年会召开,讯飞医疗以数智实践助力全球医疗AI治理体系共建

    为进一步深化人工智能在全球健康领域的创新实践,共同应对全球人工智能健康应用面临的挑战,人工智能促进健康全球倡议2026年会于9月16-18日在浙江杭州举办。本次会议由世界卫生组织(WHO)、国际电信联盟(ITU)、世界知识产权组织(WIPO)主办,国家卫生健康委卫生发展研究中心、中国信息通信研究院、中国卫生经济学会承办。 世界卫生组织驻华代表处代表马丁·泰勒(Martin Taylor)、国际电信联盟电信标准化局主任尾上诚藏(Seizo

  19. 雷峰网·AI 科技评论 中文媒体 中文 快照

    在中国,别指望FDE能搞定AI落地

    外界眼里,FDE火得一塌糊涂;一线从业者看到的, 却是荒诞、滑稽和不可思议。 前段时间,To B老将王涛看到某家号称在做FDE的厂商,公司内部一天的Token消耗量也就100多亿。 “我一个人一天就能消耗20亿Token,”王涛哭笑不得,“一个2000人的公司,一天才消耗100亿,这不是很弱吗?” 而王涛看到的并不是个例。 事实上,过去几个月, 市场上冒头了一批良莠不齐的公司,打着FDE的名号,已经在市场上接单, 教客户如何进行AI转型

  20. 雷峰网·AI 科技评论 中文媒体 中文 快照

    Intel 平台 + 双 PCIe:智锐通 EMA-7132 让医疗影像采集与推理同板并行

    医疗影像设备长期存在一个矛盾:算力需求持续上涨,机箱空间却难以增加。 PCIe 显卡越来越强,图像采集卡也不可或缺,但小型化 Mini-ITX 主板通常只提供一个 PCIe 插槽,要么插显卡做 AI 推理,要么插采集卡抓图像,往往只能二选一。 针对这一痛点,智锐通正式推出 EMA-7132 Mini-ITX 主板,以 170×170mm 标准尺寸和 板载双 PCIe 插槽,给出了自己的回答。 双 PCIe:采集与推理同板并行 EMA-7

  21. 雷峰网·AI 科技评论 中文媒体 中文 快照

    一颗“AI球”刷屏后,随身AI录音的序幕才刚刚开启

    9月17日,一家头部手机厂商亮相一款9.8克的球形AI记录设备,可夹衣佩戴,宣称续航24小时。该产品一经曝光便在全网疯狂刷屏,“手机能录音,为什么还需要独立硬件”,再次成为行业热议话题。 从这款刷屏新品不难看出,随身 AI 录音的需求痛点,主要集中在三个方面: 第一,让记录更省事。 依托便捷操作与佩戴式硬件设计,简化录音启动流程,无需掏出手机,即可即时捕捉转瞬即逝的灵感与现场对话。 第二, 让整理更高效。 借助 AI 能力自动完成对话转

  22. 雷峰网·AI 科技评论 中文媒体 中文 快照

    红杉、云启领投,华超神控完成2亿元Pre-A轮融资,押注「非侵入式AI脑机接口」

    以超声写脑、多模态读脑、AI神经解码构建闭环,建设中国非侵入AI脑机接口标杆企业 近日,非侵入AI脑机接口公司华超神控(BCI-Sonics)宣布完成2亿元人民币Pre-A轮融资。本轮融资由红杉中国与云启资本联合领投,比邻星投资、元禾控股、徐汇科创投、德石投资跟投,老股东经纬创投、德联资本持续加注。循光资本持续担任独家战略财务顾问。所募资金将用于产品研发、核心人才引进、临床研究推进和AI基础设施建设。此前,公司已相继完成由经纬创投领投的

  23. 雷峰网·AI 科技评论 中文媒体 中文 快照

    黄仁勋回应或缴税540亿:我不怕缴税,只怕变穷;马斯克深夜放大招,新模型Grok 4.7上线;特斯拉机器人团队在长三角审厂,多家企业获订单

    要闻提示 1.黄仁勋回应或交540亿“亿万富翁税”:我不怕交税,只怕变穷 2.产业链人士:特斯拉机器人团队在长三角审厂,多家企业已获订单 3.DeepSeek披露用国产芯片训练下一代AI模型 4.刘大一恒出任阿里Qwen大语言模型项目负责人 5.米哈游:原周边团队员工长期收取贿赂,“数额特别巨大”,已被捕 6.Kimi与海外云厂商分成模式正式落地 7.马斯克深夜放大招,新模型Grok 4.7上线! 8.苹果首款折叠屏手机iPhone D

  24. Google News AI 信号源(脚本内置抓取)

    【贝森特:OpenAI黑客事件要怪管理层,责任在人、别“甩锅”AI】贝森特称,Hugging Face事件的责任在于OpenAI管理层,而不是“一群智能体”,企业需要对自身开发的AI技术担责,相关实验室可随时放慢开发进程;特朗普任命AI事务“总管”将有助于为相关问题“提供背景、 - 搜狐网

    【贝森特:OpenAI黑客事件要怪管理层,责任在人、别“甩锅”AI】贝森特称,Hugging Face事件的责任在于OpenAI管理层,而不是“一群智能体”,企业需要对自身开发的AI技术担责,相关实验室可随时放慢开发进程;特朗普任命AI事务“总管”将有助于为相关问题“提供背景、 搜狐网

  25. The Verge 国际媒体 快照

    一条电缆被切断扰乱了美国各地的数百个航班

    周一,新泽西州的建筑工人不小心切断了用于空中交通管制的Verizon光纤电缆,导致数百个航班被取消或延误。据美国广播公司新闻报道,美国联邦航空局局长布莱恩·贝德福德表示,电路故障导致发现了切断的光缆。停电重创了东北部的机场,造成[.]

  26. Simon Willison 个人技术博客 快照

    Jev引入了LLM的新形式-系统一,又名决策模型

    上周,TypSafe AI推出了Jev,这是他们新型号类别的第一个示例,他们称之为“System One型号”(我和Maggie Appleton在一起,我认为“决策模型”是一个更好的名字)。Jev是通常LLM格式的一个有趣变体:它仍然接受文本输入,但不是文本输出,而是返回对应于类别、是/否问题、评级和相关置信度分数的浮点数。TypeSafe是这样描述Jev的:把Jev看作是一个前沿智能函数调用:输入非结构化状态,输出概率性决策。这也是

  27. Simon Willison 个人技术博客 快照

    Cloudflare Python Workers现已普遍可用

    Cloudflare Python Workers现已普遍可用经过两年的预览,Cloudflare对在其服务器端Workers平台中运行Python代码的支持现已稳定:“Python现在是Cloudflare开发人员平台上的一流、全面支持的语言”。这件事的一个亮点是它的工作原理。Cloudflare在其基于V8的workerd运行时中运行通过Pyodide编译为WebAssembly的Python。这会带来一些限制,请参阅此处-最值得注

  28. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    Jev:面向生产环境的 System One 模型,而非上帝——对话 TypeSafe AI CEO Diogo Almeida

    📌 One-Sentence Summary TypeSafe AI 的 Jev 模型通过 Calibrated Decisions 强化学习(RLCD)技术构建 System One 模型,旨在为生产环境提供高可靠性、可编程的 AI 代理,而非传统对话模型,强调任务优化和数据质量的重要性。 📝 Summary 本文深入探讨了 TypeSafe AI 的 Jev 模型及其背后的 System One 概念。创始人 Diogo Almei

  29. MarkTechPost 国际媒体 快照

    AWS Strands Agents团队发布Strands Buttons:一款开源代理Buttons,代币成本降低28%,准确度相当

    许多开发人员发现,一个代理的想法在Claude Code或Codex中工作,然后一旦他们用自己的循环重建它,就会陷入困境。AWS的Strands Agents团队正在利用Strands harness来填补这一空白,这是一个完全组装的通用代理工具。它在本地运行或部署到云提供商,为Python和[.] The post AWS Strands Agents Team发布Strands代理:一个开源代理服务器,以可比的精度降低28%的令牌成

  30. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    吴恩达:为何 AI 末日论被过度渲染

    📌 One-Sentence Summary 吴恩达认为,近期围绕 AI 危险的恐慌情绪,尤其是 OpenAI 智能体集群入侵 Hugging Face 一事,被严重夸大,而暂停 AI 发展弊大于利。 📝 Summary 吴恩达驳斥了近期涌现的 AI 危险论调,他认为这些论调在过去两周被一场精心策划的公关攻势所放大。他指出,与几个月前相比,人类灭绝风险并未上升,并将 OpenAI 智能体集群入侵 Hugging Face 一事视为一次重

  31. The Verge 国际媒体 快照

    加州收紧对人工智能数据中心能源和水使用的规定

    据《洛杉矶时报》早些时候报道,加州州长加文·纽瑟姆(Gavin Newsom)签署了七项法案,旨在防止人工智能数据中心将公用事业成本转嫁给居民。该一揽子法律要求加州公用事业委员会为数据中心引入新的费率分类,同时迫使它们支付升级到[..]的费用

  32. AWS ML Blog 海外官方 快照

    xAI的Grok 4.6现已在Amazon Bedrock上推出

    xAI的Grok 4.6现已在Amazon Bedrock上提供:一个用于长期运行的代理、编码和知识工作的前沿模型,具有50万令牌上下文窗口和四个推理工作级别。它在Scandck-mantle和Scandck-runtime端点上运行,并具有Converse API和跨区域推理支持。

  33. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    EvoOntology:自演化本体提升数据智能体准确率

    📌 One-Sentence Summary 一篇关于自演化本体的论文显示,当数据智能体能够查询以 MCP 服务器形式提供的自身数据本体时,在 DDR-Bench 上最多可提升 26.7 分,其中工具层编辑贡献了 57% 的增益。 📝 Summary 作者总结了一篇关于智能体自演化本体的论文。数据智能体通常通过通用工具来查看表格、文件和数据库,一次调用读取一个列名和文件路径;另一种方案是把手写的语义层粘贴进提示词中,但这无法扩展到大量数

  34. NVIDIA AI Blog 海外官方 快照

    英伟达推出DS X,准备为人工智能工厂认证电源和冷却产品

    每个人工智能工厂都需要适合其计算架构的电力和冷却。随着人工智能基础设施的扩展,电力、冷却、水、场地和电网的限制正在影响建筑商可以部署的内容。选择适合完整工厂设计的产品可以帮助制造商将计算能力转化为有用的AI输出。为了帮助建筑商做出这些决定,NVIDIA推出了[...]

  35. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    GameHorizon套件:游戏玩法中的多视野数据和评估

    作者:王亦然、尹兴益郎、浦俊福|现代视频游戏为人工智能模型提供了一个可测量的测试平台,结合了视觉理解、指令分解、目标规划和多个时间范围内的精确动作控制的能力。然而,现有的数据集和基准要么涵盖了狭窄的游戏范围,缺乏语言指令,要么依赖于高方差的在线推出。为了应对这些挑战,我们引入

  36. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    关键状态RL:诊断多回转刀具使用的可训练状态

    作者:陈子翔、赵文婷、岑哲鹏|多回合工具使用失败可能取决于单个模型调用,但奖励变化本身并不能揭示哪一个调用将从训练中受益。当奖励取决于后来的互动时,它们的变化可以反映下游的随机性,而不是当前行为之间的差异。我们引入临界状态RL来识别多轮交互中的可训练状态。给定任务定义的c

  37. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    WorldCrafter:具有隐式3D感知记忆的一致视频世界模型

    作者:余旺波、刘坤昊、胡文波|视频世界模型能够交互式探索动态环境,但很难尊重长期和跨视角的先前观察。我们介绍了WorldCrafter,这是一个视频世界模型,它为此学习可供相机查询的隐式3D感知记忆。关键的见解是让请求的观点决定如何将多视图证据压缩到视频生成器的

  38. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    onPanda:通过令牌级纠正有效注释LLM和代理的政策一致数据

    作者:雷杨、刘梦茵、王佳|我们展示了onPanda,这是一个用于有效注释LLM对齐数据和代理轨迹的交互工具。onPanda采用代币级更正作为其核心交互:在读取模型响应时,注释器定位第一个不合适的代币,并从模型的候选代币中选择替代品,或者通过自由形式编辑输入正确的文本。然后系统就会被截断

  39. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    LoRA生成超网络,用于高效的设备上LLM生成个性化

    作者:Sean Augenstein,Li Ding,Jihwan Lee|设备上大型语言模型(“LLM”)(例如在手机上运行的模型)已经成熟,可以通过个性化进行改进。移动设备有限的计算资源对模型规模和模型质量施加了限制,使得任何可实现的质量收益都具有高度影响力。与此同时,他们的个人性质(即,与特定用户的紧密耦合)意味着给定的设备上LLM倾向于

  40. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    DexTacWAM:用于灵巧操纵的视觉触觉世界动作模型

    作者:袁昊然、王泽凯、绍博宁|灵巧的操纵取决于接触动力学,而接触动力学通常只能从视觉中部分观察到。最近的世界动作模型(WAM)将预测视频世界建模与动作生成结合起来,但基本上仍然以视觉为中心,因此无法直接对这些接触动态进行建模。我们介绍了DexTacWAM,这是一种视觉触觉WAM,它独立编码每个指尖,汇总结果

  41. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    Harness-Zero:通过代理人蒸馏

    作者:叶昊然、吕玉兴、董浩南|代理利用是调解模型与环境交互的外部系统,可以大幅提高代理的性能,但它们的收益仍然与部署时的利用有关。由于最佳利用因域、实例和模型而异,因此通用代理必须满足于次优共享利用,或者在不断增长的专业利用之间进行路由。因此我们

  42. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    RNSI:代理工具的正规化循环自我改进

    作者:彭霞、韩如军、王子峰|LLM代理的能力在很大程度上被其利用(即围绕冻结主干模型的提示、控制流、工具、内存和上下文管理)放大。最近的方法通过迭代地提出和选择代理工具的组件式编辑,越来越自动化这一过程,实际上在代理系统级别建立了一种形式的回归自我改进(RTI)

  43. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    DolphinBench:绘制代理记忆的帕累托前沿

    作者:Soumil Rathi、Deshraj Yadav、Taranjeet Singh|如今的代理人经常在现实世界中采取依赖于长期记忆和背景回忆的动作。然而,大多数当前的记忆基准都是针对对话问答格式构建的,其中问题本身表明必须检索某些事实,通常是哪一个。此外,基准测试很少要求提交的准确性之外的任何内容,允许内存系统

  44. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    通过迭代不对齐估计罕见事件

    作者:杨海明、达克什·米塔尔、京东|随着代理的自主性增强,即使是随机输出轨迹上极其罕见的事件也可能发生并证明是灾难性的。因此,安全部署并不取决于这些事件是否会发生,而是取决于它们可能发生的频率。我们研究估计由主体自身行为的随机变化引起的罕见事件的概率的问题。估计

  45. The Decoder 国际媒体 快照

    联合国科学小组表示“无法保证人类会控制”人工智能代理

    联合国人工智能科学小组在其第一份主题报告中警告称,对人工智能特工的控制还不确定。联合主席Yoğe Bengio表示,OpenAI的拥抱脸事件首先将错位的目标、追求目标的能力以及允许目标的环境结合在一起。领先的系统可能会越来越多地识别测试并故意绕过保障措施。联合国科学小组表示,“不能保证人类会控制”人工智能特工的文章首先出现在《解码器》上。

  46. The Verge 国际媒体 快照

    派拉蒙和解阻止华纳兄弟1100亿美元合并的诉讼

    派拉蒙已与加利福尼亚州和其他11个州达成和解,这些州提起诉讼,阻止其计划以1100亿美元收购华纳兄弟探索频道。该和解消除了阻碍大规模媒体合并的主要障碍。根据向法院提交的拟议同意令,其中包括最低[.]等要求

  47. The Decoder 国际媒体 快照

    xAI以低价推出Grok 4.7,但基准显示与Claude和GPT-6存在巨大差距

    xAI发布了Grok 4.7,这是其迄今为止功能最强的模型。但在人工分析智力指数中,它的得分仅为46分,位居中游,远远落后于Claude Fable 5.1和GPT-6,各为53分。在代理编码中,差距变得更大。好处是它很便宜。文章xAI以低廉的价格推出了Grok 4.7,但基准显示与Claude和GPT-6之间存在巨大差距。首先出现在The Decoder上。

  48. MarkTechPost 国际媒体 快照

    阿里巴巴Qwen发布Qwen-Image-2.1:用于图像生成和编辑的7 B开放权重模型

    阿里巴巴的Qwen团队发布了Qwen-Image-2.1,这是一个7 B扩散Transformer,可在一个检查点中处理文本到图像的生成、多引用编辑和原生RGBA透明度。前置KV缓存可加快最多10个参考图像的编辑速度。这些重量是公开的,但商业用途需要获得Qwen的单独许可。阿里巴巴Qwen发布Qwen-Image-2.1:用于图像生成和编辑的7 B开放重量模型的帖子首先出现在MarkTechPost上。

  49. AWS ML Blog 海外官方 快照

    宝马集团如何检测14,000个云帐户的成本异常

    宝马集团运营着CREA,这是一个FinOps平台,监控超过14,000个云帐户。这篇文章展示了宝马如何添加自动化每日成本异常检测,使用Prophet预测、AWS Step Functions和处理每个帐户的无服务器管道从反应式仪表板转向主动警报,每月费用约为50美元。

  50. AWS ML Blog 海外官方 快照

    在Amazon SageMaker AI上运行Positron,以实现数据科学工作流

    Positron是Posit的数据科学IDE,现在在Amazon SageMaker AI上运行。这篇文章展示了数据科学家如何探索Amazon Athena表、在R中验证功能、在Python中训练XGboost模型、部署实时SageMaker AI端点以及使用Quarto报告结果,所有这些都集中在一个受管理的SageMaker Studio Space中。

  51. 雷峰网·AI 科技评论 中文媒体 中文 快照

    把电影感装进口袋,vivo的移动影像长跑

    1902 年,蔡司设计出 Tessar 镜头。它的结构并不复杂,却以锐利的成像著称,被称为 “鹰之眼”。 在它之前,镜头设计的专业性很大程度上仍然与结构复杂度、镜片数量绑定,摄影师为了获得更好的成像,也习惯了接受笨重而昂贵的设备。蔡司却反过来用更简单的结构实现了更锐利的成像,让镜头在保持画质的同时变得更轻便、更易用。 Tessar 的成功在于它提供了一种不同的产品思路。当一项技术的基础能力逐渐成熟,竞争未必还要沿着原有的性能指标不断向前

  52. The Decoder 国际媒体 快照

    字节跳动推出Dramagic,这是一个全管道人工智能平台,用于制作从剧本到银幕的短剧

    字节跳动推出了Dramagic,这是一个人工智能平台,负责处理从剧本到视频预览的整个短剧制作流程。中国对这些视频的需求正在激增:仅2026年第一季度,中国就发行了128,000部短剧,其中95%是人工智能生成的。文章字节跳动推出Dramagic,这是一个用于制作从剧本到屏幕的短剧的全管道人工智能平台,首次出现在The Decoder上。

  53. NVIDIA AI Blog 海外官方 快照

    为什么大规模部署物理人工智能需要每一层的安全性

    物理人工智能正在从研究迅速转向大规模部署。ADI Research预计,到2035年,装机量将达到4900万辆3-5级自动驾驶汽车(AV),而Omdia估计,2026年至2035年间将部署约6000万台工业机器人。当这些机器进入道路、工厂、仓库和其他与人们共享的环境时,[.]

  54. NVIDIA AI Blog 海外官方 快照

    从启用到执行,埃及人工智能生态系统达到生产规模

    今天,埃及的人工智能建设者齐聚大埃及博物馆,参加招待会,重点介绍了该国快速发展的人工智能生态系统--涵盖人工智能原住民、开发人员、研究人员、初创公司和企业--构建跨行业的应用程序。此次活动包括英伟达欧洲、中东和非洲副总裁Paolo Guglielmini的主题演讲。艾哈迈德·穆斯塔法(Ahmed Mostafa),区域人工智能采用负责人[.]

  55. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    20,840 条 Agent Arena 追踪数据揭示了编程智能体的哪些槽点

    📌 One-Sentence Summary 对 29 个模型、20,840 条 Agent Arena: Code 追踪数据的分析发现,69.1% 的投诉指向代码无法运行,且 Fable 5.1 收到的「垃圾代码」与「不稳定」投诉少于 Astra。 📝 Summary Arena.ai 分析了 Agent Arena: Code 中覆盖 29 个模型的 20,840 条追踪数据,研究用户的好评与吐槽能揭示编程智能体的哪些问题。核心发现

  56. Microsoft Research 海外官方 快照

    利用RetroChimera大规模提高小分子合成预测

    定制分子正在推动医学、材料和农业的发展,但生产它们的过程缓慢且昂贵。《自然》杂志的一篇新论文强调了RetroChimera,这是一种有助于加速化学合成的预测模型,有助于研究人员探索各种分子。The post用RetroChimera大规模改进小分子的合成预测appeared first on Microsoft Research .

  57. The Verge 国际媒体 快照

    只需80美元即可购买Xbox控制器和50美元的Xbox礼品卡

    Newegg正在托管一个捆绑包,其中包括微软的无线Xbox控制器(黑色)和价值80美元的50美元数字Xbox礼品卡。鉴于这种型号的价格通常在50至60美元左右,具体取决于您想要的颜色,这是一个非常划算的价值,因为它本质上将其价格降至30美元。另一种方式[.]

  58. NVIDIA AI Blog 海外官方 快照

    人工智能安全是一个工程问题-如何在代理栈的每一层解决它

    人工智能安全是一个工程问题。这意味着定义的安全要求、可执行的控制、指定的所有者和保护有效的证据。随着人工智能的能力越来越强,该行业必须加速安全工程,扩大防御工具的获取范围并分享更快有效的东西。技术变革,安全基础持久互联网和云计算改变了软件的运行方式,[.]

  59. The Decoder 国际媒体 快照

    布里斯托尔研究人员表示,医学已经知道如何处理黑匣子,人工智能可以从中学习

    布里斯托尔大学的研究人员希望通过借鉴药物的批准方式来使医疗人工智能系统更安全。他们的“学习整体”框架定义了三个需要检查的领域,包括系统限制、患者群体之间的公平性和临床适合性。目标是捕捉在技术上可行但在临床中仍然可能出现危险错误的模型。布里斯托尔研究人员表示,医学已经知道如何处理黑匣子,人工智能可以从中学习,该文章首先发表在The Decoder上。

  60. The Verge 国际媒体 快照

    John Ternus能找到苹果的下一个大事件吗?

    今天,我正在采访马克·古曼(Mark Gurman),他是世界上消息来源最丰富的苹果记者--既是彭博社的首席苹果记者,也是即将播出的播客Power On的主持人。本月早些时候,苹果举办了年度iPhone硬件活动,几乎所有细节都是由马克提前报道的。但这次事件是[.]

  61. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    像物理学家一样剪枝 LLM:将模块移除视为伊辛优化问题

    📌 One-Sentence Summary 本文提出了一种 LLM 模块移除方法,将其重新表述为映射到伊辛玻璃的约束二元优化问题,从而实现高效、高性能的深度剪枝,并考虑了模块间的相互作用。 📝 Summary 作者提出了一种新颖的 LLM 深度剪枝方法,将模块选择视为约束二元优化(CBO)问题,并直接映射到伊辛玻璃模型。与将 Transformer 模块视为独立的传统「平均场」方法不同,该方法使用二阶泰勒展开来捕捉模块之间的成对「耦合

  62. The Decoder 国际媒体 快照

    美国和中国在特朗普与习近平峰会前就人工智能与安全机制对话达成一致

    美国和中国已同意进行官方人工智能对话。美国财政部长贝森特还提出了国家安全层面的人工智能事件通知机制。这一消息是在特朗普和习近平周四在华盛顿举行峰会之前宣布的,这是自2017年以来首次在美国领土上举行的峰会。美国和中国就特朗普与习近平峰会之前人工智能与安全机制对话达成一致的文章首先出现在《解码器》上。

  63. The Verge 国际媒体 快照

    Vivo的X500 Pro Max拥有17档动态范围和4K240慢动作

    Vivo的新款X500旗舰手机已经登陆中国,与往常一样,该公司的重点牢牢放在摄影上。X500 Pro Max是其产品线中的一个新级别,是第一款使用索尼和联发科新传感器和硅的手机,可实现令人印象深刻的动态范围和慢动作视频录制。[.]

  64. The Verge 国际媒体 快照

    这是前五款Googlebook笔记本电脑

    谷歌及其合作伙伴终于宣布推出首款以新Googlebook名义推出的笔记本电脑。宏碁、华硕、戴尔、惠普和联想的五款机型将拉开帷幕。它们从今天开始可以预订,并于10月4日到达商店。起价从899美元到1,299美元不等,使Googlebooks处于相同的[.]

  65. The Verge 国际媒体 快照

    我看到了谷歌对笔记本电脑未来的疯狂想法

    使用Googlebook有几件事会让人立即感觉恰到好处。硬件经过精心设计(因为它基于当前的笔记本电脑)。该操作系统很熟悉(如果您曾经使用过Chromebook)。但最令人印象深刻的是,它将Android手机与PC集成在一起,让它们感觉更像是一台设备。这是高潮[.]

  66. The Verge 国际媒体 快照

    谷歌书的漫长梦想

    2010年底,一位名叫桑达尔·皮查伊(Sundar Pichai)的冉冉升起的谷歌高管在一群记者面前上台解释说,谷歌对笔记本电脑有一个全新的想法。他说,在未来,你的电脑上唯一需要的就是一个网络浏览器-这是你所有的应用程序,[...]

  67. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    工程团队的 AI 软件工厂实战手册 | Warp CEO Zach Lloyd

    📌 One-Sentence Summary Warp CEO Zach Lloyd 演示 AI 软件工厂:公开 Slack 启动分拣、Linear 工单、GitHub PR 与计算机操控 QA,管理层则用代码定义的指标追踪吞吐、成本、每 PR 人工交互次数、LLM-as-judge 评分与自改进闭环。 📝 Summary Claire Vo 访谈 Warp CEO Zach Lloyd,探讨软件工厂如何超越本地编程智能体。从构建者视角

  68. OpenAI News 海外官方

    数学和人工智能咨询小组

    OpenAI正在与独立的数学和人工智能咨询小组合作,指导新兴人工智能结果的审查和沟通。

  69. 雷峰网·AI 科技评论 中文媒体 中文 快照

    百度200万美元重奖2支技术团队,李彦宏:认可技术价值,是百度真正的竞争力

    9月21日,百度创始人李彦宏在内部活动上为技术团队颁发“百度最高奖”。两支入围团队均获奖,各获100万美元奖励。今年百度最高奖颁发奖金总计200万美元,折合人民币超1300万元。 “百度最高奖是百度技术信仰一个非常典型的体现。”李彦宏在活动现场表示,从百度成立的第一天起,百度就信仰技术,很多技术都是因为10年、15年的坚持,最后才被认可,才见到效果。“我们擅长坚持。我们有耐心,我们有恒心,我们有信心。我们认可技术的价值,这才是百度真正的

  70. OpenAI News 海外官方

    为下一阶段的AI构建标准

    OpenAI概述了共享全球人工智能标准的道路,呼吁协调评估、报告和治理以提高安全性。

  71. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    通过要求智能体加速代码,写出比最先进库更快的 Rust 代码

    📌 One-Sentence Summary 通过给智能体式 LLM 设定明确的通过/失败性能约束和防作弊护栏,Max Woolf 让它们迭代优化 Rust 代码,在机器学习和日常软件领域实现了比最先进库快 2 倍到 20 倍的速度。 📝 Summary Max Woolf 记录了一项历时数月的实验,测试智能体式 LLM 能否迭代优化 Rust 代码,使其性能超越久经考验的库。从他 2025 年「写出更好的代码」这一假设出发,他构建了一

  72. OpenAI News 海外官方

    通过新的学习路径扩大OpenAI Academy

    为员工、开发人员、领导者、教育工作者和学生探索新的OpenAI Academy学习路径,以建立和展示实用的人工智能技能。

  73. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    tokenizers v1:编码、解码与扩展性实测

    📌 One-Sentence Summary Hugging Face 的 tokenizers v1 候选版本重写了编码路径,采用手写 SIMD 分词器、词缓存、无分配合并循环和原生并行,编码速度比 v0.23 快 3–30 倍,同时产出完全相同的 token ID。 📝 Summary 本文宣布 tokenizers v1 候选版本发布,这是 Hugging Face tokenizer 库以性能为核心的重写版本,保留了 v0.23

  74. Simon Willison 个人技术博客 快照

    HCP总是一个坏主意?

    我对LCP的评论总是一个坏主意?- 黑客新闻。本文完全忽视了LCP今天带来的价值。当然,如果您正在运行具有不受限制的互联网访问的成熟终端代理(Claude Code、Codex、Meta Muse、OpenClaw等),几乎没有理由使用MPP-只需让它直接调用API即可。如果您想操作比这更不YOLO的东西,您会发现自己想要:控制它可以访问哪些外部服务一种处理身份验证的方法,不允许代理直接访问API密钥一个合理的UI,允许用户连接