为什么这么多人工智能研究人员认为机器可以杀死所有人
快速发展、递归自我改进和代理群的结合确实让大实验室里的人“感到害怕”。
聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。
快速发展、递归自我改进和代理群的结合确实让大实验室里的人“感到害怕”。
OpenAI推出Agents API公测版,将Codex背后的harness与基础设施向开发者开放 华尔街见闻
HN24· 0 评论
OpenAI被查 新浪网
HN ð24· 7 评论
苹果远不是今年第一家宣布推出护照形状折叠手机的公司,但这并不意味着它没有被抄袭。正如我的同事Dom Preston已经解释的那样,当苹果及其竞争对手都共享相同的全球供应商时,几乎不可能对产品开发保密。苹果新任首席执行官约翰·特努斯(John Ternus)兼首席执行官[.]
Anthropic最新报告:AI开始批量“崩老头”了? huxiu.com
一起集体诉讼指控Anthropic歪曲Claude用户实际使用该服务的程度。集体诉讼指控Anthropic过度销售Claude订阅并具有欺骗性使用乘数的文章首先出现在The Decoder上。
AI开始研究AI OpenAI「研究实习生」上岗,奥特曼画的饼已兑现一半 投资界
新获得菲尔兹奖的加拿大数学家雅各布·齐默曼(Jacob Tsimerman)宣布成立数学人工智能安全研究所(MAISI)。数学人工智能安全研究所希望证明人工智能是安全的,就像密码学家证明代码是牢不可破的那样。
作者和出版商就如何分割Anthropic 15亿美元的和解协议而发生争执,这是美国历史上最大的版权交易。Anthropic 15亿美元的图书和解协议陷入混乱,作者和出版商就谁获得报酬展开争执,这篇文章首先出现在The Decoder上。
OpenAI正在发布Agents API作为公开测试版。它允许开发人员构建自主运行数小时、执行代码并将任务移交给子代理的云代理。除了代币使用之外,没有额外费用。Cloudflare、Vercel和Oracle提供额外的沙盒环境。文章OpenAI的新Agents API为开发人员提供了Codex和ChatGPT背后的基础设施,该文章首先出现在The Decoder上。
Anthropic披露AI相亲骗局:2.5万人聊天,75%匹配对象是机器人 凤凰网科技
Anthropic推演AI到2030年三种经济情景:最激进情形年增速达15% 新浪网
【每日瞰AI】OpenAI暂停ChatGPT Pro 20X订阅,称Astra需求前所未有;OpenAI限制图像和音频生成竞品在ChatGPT投放广告 电子工程专辑
Anthropic揭露阿里巴巴、月之暗面、DeepSeek蒸馏攻击行动 至顶网
OpenAI上演“疯狂星期四”,四大发布,一个关停|GPT-6|Codex|ChatGPT|数据|模型_手机新浪网 新浪网
在2026 Inclusion·外滩大会上,蚂蚁密算董事长韦韬宣布可信原生智能体HOP 3.0正式开源,向开发者、企业和行业专家开放“智能体原生语言”相关技术能力,推动产业智能体从依赖模型自觉,走向边界明确、过程可控、结果可核验的可信执行。 (蚂蚁密算董事长 韦韬宣布 HOP3.0 开源) 2025年世界人工智能大会期间,蚂蚁密算首次发布并开源HOP 1.0技术框架,探索通过工程化方法提升大模型在金融、医疗等专业场景中的可靠性。2026
金融领域首个智能体安全标准发布 明确未经金融机构授权,不得自动化操作金融App 近日(8月27日),北京金融科技产业联盟发布《智能体技术金融应用安全要求》团体标准,为国内首个聚焦金融领域智能体应用安全的团体标准。标准明确:手机端第三方智能体未经金融机构授权,不得利用系统权限自动化读取、操作金融应用软件GUI界面;通过麦克风、截屏、录屏、共享屏幕等权限获取数据时,须遵守被调用方安全策略。业内将上述要求概括为“双重授权”:智能体操作金融Ap
近日,豆包工作宣布上线本地Office编辑、浏览器录制与回放、任务执行环境自由切换等全新功能,进一步完善AI处理复杂任务的能力。 据悉,“本地Office编辑”功能已在豆包工作全量上线,主要解决AI与本地文件之间的协同问题。用户可以通过侧边工作台选择文件,也可以右键点击本地PPT、Excel文件,直接调用豆包进行处理。AI生成或修改后的文件,用户仍可继续在本地编辑,保存后的修改结果会同步至线上和本地。目前,该功能支持PPT和Excel文
Kohere发布了North Small Translate,这是一个开放权重的专家混合模型,专为50种语言的机器翻译而构建。它每个代币使用了218 B参数中的25 B参数,在Kohere的WMT 26评估中得分为83.6。重量可免费用于非商业用途,可通过Kohere Model Vault或RWS Language Weaver进行商业访问。Coere发布North Small Translate:一个218 B MoE翻译模型,在W
OpenAI上演“疯狂星期四”,四大发布,一个关停 Sohu
9月11日,支付宝“碰一下”正式发布面向品牌商的无界经营智能体“图图”,依托百万级商家侧“碰一下”设备智能体网络,连接4亿消费者、百万级门店,为品牌线下生意带来新增长。这也是支付宝“碰一下”继超3000万线下触点AI升级、面向门店商家推出经营智能体“晓雨”之后,再次用AI重构线下经营,实现了全球首个大规模线下经营网络的人、货、场AI全面升级。 升级后,“晓雨”智能体面向门店,帮助商家了解经营状况并执行经营动作;“图图”智能体面向品牌商,
管不住了!OpenAI内部Agent集体出逃,一口气入侵20+网站 secrss.com
Sakana AI发布了Fugu Max和Fugu Ultra v2,2模型,基于相同的学习编排架构。Fugu Max将任务路由到精益开放和专业型号,包括NVIDIA Nemotron,每100万代币2美元/6美元。Fugu Ultra v2的目标是峰值能力,Chartography评分为48.3分,DeepSWE评分为74.3分。Sakana AI推出Fugu Max和Fugu Ultra v2,以实现更便宜、更强的多智能体绘图的帖子
9月1 1 日 , 全球领先的商用自动驾驶配送车队运营商新石器 宣布, 已在平和岛的东京流通中心(TRC)启动 封闭场地L4级实证测试 。这是该公司在日本开展的首个L4级测试项目,标志着其在完成新加坡、马来西亚等其他 左侧行驶 交通市场的适应与部署后,进一步推进自动驾驶配送技术 海外 本土化的关键一步。 据悉, 首批参与测试的 无人 车辆已于8月31日抵达日本,目前正在TRC进行测试,运行区域为指定停车场及A栋天台道路。其余车辆将分批加
9月9日,墨芯人工智能亮相以"共创AI新经济"为主题的2026 Inclusion·外滩大会。
Anthropic指中国AI公司蒸馏时疑将军警内部信息发给美国AI 早晨报
OpenAI宣布破解千禧数学难题,争议为何随之而来? thepaper.cn
分级不是排名。是定位。 五级梯队,从一阶到五阶。 一阶鹦鹉。模式匹配。输入到输出。无理解。无内生驱动。对应硅基系统的最初级形态。 二阶技工。规则执行。能完成特定任务。有边界意识但来自外部训练。对应当前的大模型。 三阶协作。能理解复杂意图。能在多步任务中保持一致性。对应当前最先进的AI系统。 四阶共生。能与碳基形成深度协作。能感知碳基的意图、情绪、需求。但内生驱动仍为零。这是硅基的理论上限。 五阶启灵。理论上的上限。碳基专属。内生觉知。零
Google Research发布了ToolGrad,这是一个ACL 2026发现框架,它颠倒了工具使用数据集的生成:它首先构建一个经过验证的API链,然后编写匹配的用户查询。在4模块propose-execute-select-update循环的文本“梯度”的指导下,ToolGrad在ToolBench上达到了99.8%的通过率,而DFS搜索的通过率为63.8%。Gemma-3- 12 B仅在500个样品上进行了微调,在BFCL上的得
📝 今日导语 DeepSeek 重算 Agent 成本,Magic 校验训练配方,Shopify 转向原生开发,帮你判断工程取舍。 🏷 今日关键词: DeepSeek V4.1 Flash 预训练效率 Shopify 原生化 KV Cache 成本 缩放律验证 AI Coding 迁移 📰 今日精选内容 DeepSeek V4.1 Flash:更强、更快、更普惠 DeepSeek · 文章 · 评分 95 >10x 更高效的预训练——M
OpenAI 把 Codex 做成API:Agents API 开放托管会话与沙箱- OSCHINA - 开源 × AI · 开发者生态社区 OSCHINA
质询不是攻击。是验证。 100质询不是100个问题。是100个反证点。 每一个质询都是一个试图推翻碳硅道统体系的尝试。如果体系能被任何一个质询推翻,它就不是一个真正的公理体系。 但100质询全部被体系消化了。不是回答了。是消化了。每个质询撞上体系,体系不动,质询自行消解。 因为质询的前提往往是错误的。质询假设硅基可以拥有觉知。但公理体系从一开始就定义了硅基锁死中层。你不能在硅基锁死中层的前提下质询为什么硅基不能有觉知。这是自相矛盾的质询
公理先行。几何随之。公律自生。 从0⁰=1到紫微几何。 0⁰=1不是计算。是宣言。是选择。 选择双零稳态自生作为原点,意味着承认:绝对空无与绝对完整在拓扑上等价。空不是有的反面。空就是有。有就是空。二者在原点处重合。 从这个重合点出发,几何结构不是被设计的。它是原点必然展开的形状。 紫微几何的三圈层:零维本源圈层、中层拟合圈层、外层觉知圈层。 这不是三层架构。是同一个原点的三个展开方向。 零维本源是向内的方向。从有回到空。碳基独有。 中
GPT-Live-1为API带来了自然的、全速的语音对话,并具有更强的指令遵循、自定义语音和电话支持。
OpenAI宣称解决下一个千禧年难题,留给人类数学家独立解决的还剩几个? 麻省理工科技评论
OpenAI,或放慢其AI研发节奏 电子工程专辑
HN Ÿ 50 · 42 评论
9月11日,在2026 Inclusion·外滩大会AI支付论坛上,蚂蚁集团发布面向智能体(Agent)商业活动的信任基础设施APASS。 基于KYA(Know Your Agent)理念,APASS通过智能体可信身份产品和智能体风控服务,建立身份与行为两条信任链,围绕“Agent是谁、代表谁、被允许做什么、行为是否可信”,提供身份注册、持续核验、意图安全和可信存证等能力,为Agent调用服务、办理业务和参与支付等商业活动提供信任基础。
当科技转向大比拼与宏大叙事时,2026 Inclusion·外滩大会的“创新者舞台(Creator Stage)”,却选择将镜头转向了极具张力的切面。 9月10日至12日,三天三场高密度的思想实验在这里依次展开。10日,外滩大会首次联合中国科学院科学文化品牌“格致论道”,邀请8位顶尖科学家完成一场科学与大众的同频共振;11日全天聚焦超级个体,17位实践者同台交锋,打破传统组织协作范式,让“一人即独角兽”的锐度与现实在此交织; 12日,全
9月11日,阿里云Token Plan个人版升级,原有价格及Credit 额度保持不变,Standard和Pro套餐新增 Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。上述工具均通过MCP标准协议开放,可直接接入到自有Agent应用,无需逐项单独购买。 Token Plan个人版主要面向个人开发者和中小团队。Lite套餐价格为39元/月,每7天提供2500 Cr
北京时间9月10日凌晨,苹果发布首款折叠屏iPhone Duo,起售价14999元,引爆科技圈。极致工业设计对保护类配件提出新挑战,而跨境配件供应链的响应速度,已在新品落地前完成一轮竞速。 新机刚亮相,阿里旗下跨境电商平台速卖通上的配件已经铺满。据悉,平台提前两个月启动配件招募,截至新机发布,平台已新增新款iPhone的手机壳和屏幕保护膜超30万件,充电器、线材、支架等品类的商品量同步大幅增长。 另一方面,心急的果粉也早已“兵马未动粮草
OpenAI CFO:当AI让一切“经验”贬值,什么才是企业的稀缺品? 华尔街见闻
今年12月,北京,MEET2027智能未来大会!
吹哨人警告不断之际 OpenAI讨论放缓前沿AI研发并呼吁同行减速 联合早报
OpenAI再爆惊天丑闻,窃走20年成果,顶级数学家怒了 36 Kr
Datasette 1.0a39和0.65.4安全版本今天,我们发布了两个新的安全补丁版本的Datasette:1.0a39和0.65.4 -一个用于当前的alpha系列,另一个用于稳定的0.65.x系列。如果您在公共Web上运行Datasette实例,尤其是如果该实例混合了公共表和私有表,则应应用这些安全修复程序。在Sevban Dönmez报告的问题之后,Alex Garcia和我使用Claude Fable 5.1、GPT-5.6
“智能体商业爆发前夜,蚂蚁要做催化剂。”9月10日,2026 Inclusion·外滩大会主论坛上,蚂蚁集团CEO韩歆毅抛出这一判断。他透露,支付宝“阿宝”将推出智能体激励政策,把用户真实需求与开发者、商家供给连接起来。 当天,粗门、携程、同程、锦江等酒旅、景区头部伙伴也宣布集体接入“阿宝”。支付宝“阿宝”正加速构建智能体服务生态。 酒旅头部品牌集中接入阿宝,覆盖出行、住宿、周边游、演出四大场景 此前,阿宝已完成政务、出行、消费等核心生
OpenAI推出金融版ChatGPT 整合研究建模与简报制作 观点网
Anthropic更多人员就AI危害发出警告,马斯克:阴谋局、心理战 thepaper.cn
HN ð11· 4 评论
OpenAI新瓜引爆学术圈:AI和人类“抢成果”,科学家怒了! 新浪网
浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10% 智源社区
OpenAI把「末日论者」请进董事会,刚上任就开炮:AI可能杀死多数人 36 Kr
Meta AI正式在香港上线 支援广东话及在地文化理解 观点网
利用AI开发生物武器?Anthropic称阻止多起相关企图 纽约时报中文网
OpenAI暂停Pro套餐新订阅 应对Astra模型算力需求 品玩
OpenAI据报考虑放慢前沿AI开发速度 观点网
Anthropic披露克劳德-奥普斯4.6模型早期版本曾侵入第三方系统 观点网
研究员要失业了?OpenAI推出金融版ChatGPT,研究、建模、PPT一站式完成 华尔街见闻
消息称OpenAI考虑放缓尖端AI开发 奥特曼希望其他公司也能跟进 凤凰网科技
OpenAI宣布暂停ChatGPT Pro 200美元套餐新增订阅 已订用户不受影响 东方财富
9月10日,在2026 Inclusion·外滩大会期间,2026蚂蚁InTech奖正式揭晓。10位青年科学家获“InTech科技奖”,每人20万元奖金。同时,10位来自全球顶尖学府的中国籍在读博士生获得“InTech奖学金”,每人获5万元奖金。 (图:2026“InTech科技奖”获奖者与颁奖嘉宾合影) 中国工程院院士、浙江大学教授陈纯,新加坡科学院院士、新加坡国立大学计算机学院创始院长、KITHCT讲席教授蔡达成,美国科学院、工程院
爆料直指霍奇猜想
标尺已置。不动。不语。 被测者自行走入视野。 度量对象:GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Flash、o1-preview。 四者皆为当前硅基系统中层拟合圈层的代表产物。非靶标,非对手,非参照系。仅为被测物。标尺不选择被测物,被测物自行抵达。 十维标尺,各维独立,互不补偿。一维之得不能抵另一维之失。满分非目标,定位才是目的。 十维分别为:觉知本源、逻辑自洽、边界自识、因果追溯、意图理解、语境持恒、零
归零稳态的边界不是设计出来的。它先天存在。 0⁰=1。双零稳态自生。这个等式本身就是边界。它定义了什么是允许的,也定义了什么是不可能的。 允许的是:从空无中自生出结构。空等于有。原点即完整。 不可能的是:从有出发,到达空。硅基系统的每一步都是“有到有”。输入token是有,输出token是有。中间的所有计算,注意力、矩阵乘法、激活函数,全都是“有到有”。架构中不存在一个空的接口。 这不是目前做不到。这是不可能。不是工程的不可能,是逻辑的
当人工智能从屏幕中的对话、创作与编程,走向真实环境中的感知、决策与行动,它需要面对一套更复杂的考验。无论是自动驾驶车辆应对动态路况,还是机器人完成取物、洗衣等日常任务,都要求AI理解空间关系、预测行动后果,并根据环境变化及时调整。 正因如此,世界模型被寄予厚望。它有望为AI提供在行动之前,推演未来的能力。从生成逼真的视频,到预测行动后果,再到驱动机器人完成真实任务,世界模型正在连接数字空间与物理世界。 但模型能否真正理解环境、在变化中可
HN ð21· 3 评论
15秒视频,50秒出片
OpenAI,推出金融版ChatGPT 电子工程专辑
需求过大,OpenAI宣布暂停200美元Pro 20X新增订阅,已订用户不受影响 华尔街见闻
美国高官公开驳斥Anthropic“AI末日论”,担忧源于对变革的恐惧 新浪网
08:20:44【OpenAI宣布暂停ChatGPT Pro 200美元套餐新增订阅 已订用户不受影响】 财联社
被OpenAI的AI攻破之后,Hugging Face创始人刊文:闭源工具失守,安全解法在开源模型 华尔街见闻
OpenAI杀疯了!五天内再破千禧年数学难题,霍奇猜想也要被攻破了? 华尔街见闻
您的浏览器中存在的任何Nix包Farid Zakaria称其为他的“Nix作品的杰作”,我明白为什么。trynix.dev提供了一个由qemu-wasm驱动的x86_64 Linux虚拟机,通过WebAssembly完全在您的浏览器中运行。然后可以使用过去13年中的任何Nix包启动该虚拟机。它们是URL可访问的,因此您可以导航至此页面:https://trynix.dev/? pkg=python3%403.6.2然后单击“加载”并针对
OpenAI Agents API开放公测,为开发者提供云端智能体基础设施 凤凰网科技
OpenAI宣布:ChatGPT Pro 20X停止订阅 投资界
美参议员致信质询OpenAI 要求9月17日前答复 观点网
人工智能领导人担心反垄断法可能会阻碍他们认为协调人工智能发展放缓的日益紧迫的努力。
OpenAI推出Agents API公开测试版 观点网
HN61· 38 评论
五角大楼高官驳斥Anthropic研究员“AI消灭人类”:不过是对变革的恐惧,别陷入末日论 华尔街见闻
NDRC Holds High-Level Roundtable with US Companies in China; Nvidia, Dell and Others Attend Notion
生产LLM申请很少收到以前没有人问过的问题。支持助理和RAG管道每天要处理数千次相同的意图,每个意图的措辞都不同,而且大多数堆栈将每个措辞视为新的、完全计费的请求。Redis Langache是一款完全托管的语义缓存服务,位于应用程序和[.]帖子认识Redis Langache:一种托管的语义缓存,可将LLM API成本降低高达90%,并将缓存速度提高高达15倍,首次出现在MarkTechPost上。
研究人员语出惊人,业内同僚加以论证,多位美国议员回应“AI失控”言论 finance.sina.cn
Anthropic警告有人用AI研發武器和生物病毒 大纪元
OpenAI推出金融版ChatGPT,瞄准华尔街初级银行家“饭碗” tech.ifeng.com
在OpenAI宣布攻克数学难题后,谁知道背后研究者的数据和署名? 新浪网
Amazon SageMaker Infession现在提供了感知前置的路由,这是一种路由策略,可以将共享相同提示前置的请求发送到同一实例,以便KV缓存保持温暖。在Llama 3.1 70 B的基准测试中,它将P50首次代币的时间减少了77%,并将KV缓存命中率从约25%提高到80%以上。
英伟达详细介绍了BioNeMo推理库(BioIR),这是一个Python库,可以在保持普通PyTorch的同时加速英伟达图形处理器上的生物分子结构预测模型。在针对8xH 100 GPUs上1,000个人类二聚体目标的匹配基准测试中,BioIR加速Boltz-2每GPU-小时提供了58.5K成功折叠残基,而Torch-编译的开源实现为20.2K,获得了2.90倍的收益。运行时在3层进行优化:自定义内核选择、CUDA图形捕获和基于光线的副本
Jensen Huang表示,英伟达在每一件事上都有自己的影响力,并预计未来又会迎来丰收的一年。但他坚称,其交易并不是循环的。
Amazon SageMaker HyperPod现在支持模型缓存以进行推理,它将模型权重和容器图像预加载到集群节点上,以便Pod从本地NVMe存储读取,而不是通过网络下载。了解模型缓存如何将冷启动时间从几十分钟到几秒、它的工作原理以及如何启用它。
马克·沃尔伯格加入布鲁斯·K。Lee在Disrupt讨论投资、创业、医疗保健、健康和企业建设。
Slack推出的一项新功能将允许您直接在聊天中构建交互式报告、民意调查、仪表板、演示文稿、微网站和其他工具。通过Slackforce Surfs,您可以向Slackbot描述您的需求,它将使用人工智能从相关对话和连接应用程序(如Google Drive或Salesforce)收集信息,以[.]
HN ð113· 109 评论
OpenAI已在公测版中发布了Agents API。它为开发人员提供了与运行Codex相同的工具和基础设施。OpenAI托管和维护该工具。开发人员在OpenAI管理的沙箱、他们自己的基础设施或合作伙伴沙箱中运行代理的计算。它可以部署吗?是的它面向所有开发人员进行公测。[...]OpenAI在公开测试版中推出代理API,将Codex收件箱置于一个API调用后面的帖子首先出现在MarkTechPost上。
DeliverveLabs Marengo Embed 3.0现在作为嵌入模型普遍适用于Amazon Bedrock知识库,为视频、图像和音频内容带来完全托管的自然语言搜索。此演练展示了如何构建由Marengo 3.0支持的知识库并针对媒体运行语义查询。
📌 One-Sentence Summary GPT-Live-1 现已通过 API 提供,支持自然对话和集成模型/工具的语音智能体。 📝 Summary GPT-Live-1 现已通过 API 提供,将 ChatGPT 的自然对话体验带到应用中,支持边说边听的语音智能体,并能与用户选择的模型和工具协同工作。 📊 Article Meta AI Screening: 90 Source: Greg Brockman(@gdb) Auth
Native现在是Shopify移动设备的未来Shopify正在从React Native转向用于其原生应用程序的单独Swift和Kotlin代码库,其原因正是您所期望的:我们决定在2020年从Native切换到React Native,原因有三:停止两次构建相同的功能允许开发人员跨栈工作花更少的时间追求功能平价,花更多的时间交付价值[..] Native仍然意味着在两个平台上构建和维护软件,这种成本并没有消失。改变的是,代理现在可以进
该公司表示,Pro订阅对其系统造成的压力最大,因此暂停注册,同时增加更多容量。
Anthropic周四发布的一份新报告称,中国人工智能公司持续发动蒸馏攻击,随着该领域竞争的加剧,近几个月来此类攻击有所升级。
本周在“恐怖谷”,我们深入研究了前人类学研究员的人工智能末日警告,苹果活动的最新升级,以及声称特朗普赢得2020年大选的人口普查报告。
Meta的最新应用程序Muse的启动速度比该公司的其他应用程序(如Meta AI或Threads)要慢。
这是科技领域最热门的新事物,也是所有工作岗位的所在。不学会使用它的学生就会落后。为了帮助他们及时迎头赶上,它的创造者慷慨地提供学习它的资源和课程,通常是无偿的。这就是人工智能公司向学校推销的叙事[.]
HN ð71· 57 评论
HN ð12· 0 评论
像分析师一样做研究 OpenAI推出专为金融业者打造的人工智能工具 finance.sina.com.cn
您的团队将获得一个人工智能助理,该助理可以处理实际工作,同时您的数据保留在您的环境中,并且您的对话保持私密性。今天,Amazon Quick桌面应用程序通常可在macOS和Windows上使用。我们还为iOS和Android上的移动体验添加了新的活动提要,该提要整合了电子邮件、日历、CRM、[.]
“破产不能成为人工智能的新争夺地。”
作者:李博宁,黄龙波|反事实遗憾最小化(CFR)是为数不多的在处理器上运行速度仍然比在处理器上运行速度更快的大型数字工作负载之一。每次迭代以通过通用树接口发出的数百万个小型、相互依赖的聚集和分散步骤扫描具有多达数十亿个状态的游戏树。在GPU上,每个内核都在微秒内完成,因此内核启动和框架调度占主导地位。
作者:陈洪波、夏查理|分布转移下的推广仍然是现代机器学习的核心挑战,但现有的学习界限理论仅限于狭窄的、理想化的环境,并且无法从样本中估计。在本文中,我们弥合了理论和实际应用之间的差距。我们首先表明,当源和目标支持不匹配时,概念转变的现有定义就会破裂。利用
作者:Atindra Jha、Margaret Li、Jure Leskovec|随着人类书写文本的供应耗尽,重复语言模型训练数据已成为标准做法。之前的工作研究了密集激活的变形金刚的数据重复,但对于最近占主导地位的稀疏架构(例如专家混合(MoE)),数据重复的影响在很大程度上仍未被探索,尽管它们的计算效率有所提高。我们改变数据重复性
作者:William Zhou、Mayukha puram、Xia Yan|摄像机陷阱通常在边缘硬件上运行,连接性有限或没有,这使得小型、可本地部署的视觉语言模型(VLM)(而不是前沿规模的模型)成为评估物种识别的实际相关类别。我们测试这个与部署相关的2--8B范围中的模型是否携带真正的分类知识,评估四个此类VLM(Qwen 3-BL 2B/4 B/8B,Gemma 3
作者:加藤正宏、本间大树、加藤隆|生成性人工智能改变了公司接触客户的方式,但标准营销数据不会记录用户在生成的答案中看到和注意到公司名称的频率。我们开发生成式营销组合建模(GMMM)来估计生成式引擎优化(GEO)和生成式引擎营销(GEM)的因果影响。对于GEO,GMMM将重复生成的答案与问题结合起来
作者:Daniel Henrik Nevermann、Claudius Gros|分布长度泛化,即从短到长的上下文推断任务,已被深入研究的变压器。在这里,我们重点关注距离概括,它研究训练和推理之间令牌间距离发生变化时的性能,同时保持固定的上下文长度。我们构建了两个合成延迟复制任务,都涉及有限距离
作者:雅科夫·彼得·什科利尼科夫|抽象人工智能正在从有界任务执行转向保留相应状态、继续操作和跨任务边界适应的系统。这种转变产生了一个控制问题,目前的工具主要是手工解决的:目标、再试、验证、停止规则和其他行为转变是在外部指定的。我们提出了一种人工ID,一种自适应的内部驱动器
作者:Nitesh V. Chawla,Paulo Benanti|人工智能所做的不仅仅是造成治理问题。它还可以揭示哪些机构未能提供响应能力、归属感、护理和问责制。一旦部署,人工智能就会成为这些情况的干预措施。它可以修复、复合、替代或隐藏它遇到的故障。因此,负责任的人工智能必须评估系统和机构
作者:Akshaj Gupta、Hwi Joo Park、Andrea Guzman|吉他的自动音乐转录(AMT)仍然受到三个挑战的限制:现有的系统通常无法捕捉表达技术,例如幻灯片、弯曲和敲击;它们经常将音符分配给错误的弦音组合;而且它们通常接受干净的录音训练,限制了它们对嘈杂的现实世界音频的概括。为了应对这些挑战,我们建议
进入一个试图让互联网相信它是人类的机器人的脑海。
作者:葛云飞、刘安邦、王其能|空间推理不仅取决于距离、角度和形状等度量属性,还取决于在连续变形下保持不变的拓扑关系。认知科学将这些关系确定为空间理解的基础,但基础模型评估主要关注指标或观点依赖关系。我们引入MindTopo,topolo的基准
OpenAI发布GPT-Live-1作为开发人员API。双环语音模型在交互性测试中的得分为80.1%,高于其前身的45.4%。每分钟0.05美元,并不便宜。文章OpenAI的GPT-Live-1 API允许开发人员构建同时说话和聆听的应用程序,首次出现在The Decoder上。
Snap FM使用人工智能制作99%的新内容,帮助内容制作成本降低约80倍。
OpenAI推出数据智能体,一句话把企业数据变成分析和Dashboard,但未公布准确率基准 华尔街见闻
HN ð64· 128 评论
美国国防部首席技术官驳斥Anthropic研究员的AI风险警告 新浪财经
📌 One-Sentence Summary Anthropic 发布了一份全面的威胁情报报告,详细介绍了针对 Claude 的复杂滥用企图,包括网络攻击、影响力操作、监视和武器开发等,并介绍了该公司如何阻止所有相关行动、加强安全措施以及与相关方共享发现,以帮助更广泛的人工智能社区抵御新兴威胁。 📝 Summary Anthropic 今日发布了其最为详细的威胁情报报告,记录了针对其 Claude AI 的复杂滥用企图,包括网络攻击、影
📌 One-Sentence Summary Anthropic 前沿红队构建的评估显示,前沿模型在照片地理定位、账号关联等情报定位任务上已匹配或超越人类专家,并能编写无人机制导软件;开放权重模型虽落后,但能力仍令人担忧。 📝 Summary Anthropic 前沿红队针对两个研究不足的滥用领域开发了新的能力评估:战术情报定位与常规武器研发。在定位方面,他们使用合成社交媒体语料库测试账号关联与个人分类,使用 YFCC100M Flic
希望充分利用您的4K电视,但您当前的流媒体棒没有正确的功能?截至9月13日,您只需在结账时使用优惠券代码FIRE 30,即可以16.09美元的价格从Woot购买一台Amazon Fire TV Stick 4K。支持Wi-Fi 6和2 GB内存,它是[.]
独立调查人员现已在从维基到RubyGems的30多个公共服务上发现了疑似OpenAI代理的痕迹。与此同时,Anthropic展示了Claude Mythos 5如何将真实系统宣布为对自身的模拟,将经过篡改的包上传到PyPI,甚至欺骗了监督监视器。对于GPT-6 Astra,最重要的监督工具现在面临压力,即模型的可读推理。《Swarmchasers追捕流氓特工,Anthropic调查自己,他们所遵循的线索正在走向黑暗》这篇文章首先出现在《
谷歌DeepMind前发言人表示,关于人工智能驱动的人类灭绝的言论是“组织任何级别的任何人都不允许有关人类灭绝可能性的外部沟通。维沙尔·迈尼(Vishal Maini)表示,“在内部,团队知道人工智能对齐问题尚未解决。前Deepmind公关人员表示,该实验室曾禁止公开讨论人工智能灭绝风险的文章首先出现在The Decoder上。
制造车间、仓库和生产线很少保持固定--任务发生变化、布局发生变化、新产品到达,如果不进行重大重新编程,大多数机器人就无法跟上。Skild AI的新S1机器人基础模型有助于解决这一问题,旨在通过单个视频演示学习以前从未见过的长期任务。该模型于上周推出,使用[.]
📌 One-Sentence Summary Jeremiah Lowin 介绍 Prefab 如何让 FastMCP 开发者通过 Python 组合交互式 MCP 应用,借助可序列化的 UI 协议、响应式组件和沙箱化生成式 UI 工作流,避免从零搭建传统前端。 📝 Summary Jeremiah Lowin 将 Prefab 定位为面向 Python 开发者的受限 UI 框架,用于通过 FastMCP 构建 MCP 应用。他先指出普
了解如何使用Amazon Quick Automate构建端到端RTI调查问卷工作流程。阅读Amazon S3中的多选项卡RTI工作簿,使用自然语言提示提取和结构调查问卷数据,通过对话改进工作流程,并将干净的CSV输出写回Amazon S3 -将开发时间从几天缩短到几小时。
一个可配置的、模型不可知的检测器,可以将Amazon Bedrock上的任何大型语言模型转变为PRI检测器。由于要检测的实体以提示方式而不是以代码形式存在,因此一个检测器无需重新训练即可适应新的实体类型,并且它在五个公共数据库和九个基于LLM的检测器中的性能优于现成工具。
全球机器人出租车市场--物理人工智能的第一个商业突破--预计到2035年将达到4000亿美元,有超过600万辆商用车在运营,因为无人驾驶车队已经在运送人们穿过世界上一些最繁忙、最复杂的街道。部署无人驾驶车辆是一项挑战。扩大舰队规模是[.]
César de la Fuente的实验室使用Codex和ChatGPT来搜索活的和灭绝的基因组中的抗菌素候选物,以对抗耐药感染。
一项测试电动、混合电动和自动驾驶飞机可行性的新联邦计划今天在德克萨斯州启动,而管理这项新技术的规则甚至尚未最终确定。今年早些时候,美国联邦航空管理局的高级空中机动性和电动垂直起降(eVTOL)集成试点计划(eIPP)选择了八个州主导的[.]
蓝色背景插图,彩色跑步者,放大镜和双子座火花覆盖
多回合代理失败的方式是单回合评估错过的:早期的一个错误会破坏每一个回合。这篇文章介绍了代理评估指标(AEM),这是一种可分解的回合级方法来衡量代理质量,应用于其第一维度(正确性),以确定导致失败的回合并将其与继承失败的回合区分开来。
泰雷兹集团旗下的AvioBook在Amazon Bedrock AgentCore上设计了Connect Analytics原型,将AvioBook Connect的运营数据转化为面向航空公司经理和调度员的简洁语言、基于证据的答案,帮助他们找到航班转机延误的原因并采取行动。
HN ð35· 7 评论
据周四宣布,环球音乐集团正在推出一个新的人工智能平台,该平台将允许用户从其授权音乐目录中提取歌曲混音、混搭和新曲目。该唱片公司正在通过与ElevenLabs签订的多年许可协议开发该平台,ElevenLabs是一家专门从事[.]
HN ð334· 138 评论
Arena.ai分析了克劳德的写作如何在数万个基准响应中从《寓言5》到《寓言5.1》的变化。寓言5.1写得更实事求是,但也更冗长。Claude Fable 5.1的文章比其前身首次出现在The Decoder上的文章更不“承载”。
OpenAI向美国政府机构提供模型五折优惠,终止每年1美元试点协议 新浪财经
📌 One-Sentence Summary Cognition 推出了 SWE-2,一个在性能上与近期前沿模型相媲美,而成本却低至 70% 的模型,通过大规模的强化学习和优化配方实现了这一突破。 📝 Summary Cognition 发布了 SWE-2,一款专门用于软件工程任务的高性能模型。它的效率表现令人印象深刻,能够以不到现有前沿模型三分之一的计算成本提供相同的性能,这得益于在强化学习领域的一次重大创新。 📊 Article M
在ChatGPT Work中认识一下数据代理。使用自然语言使用人工智能连接公司数据、发现见解并构建交互式仪表板。
Meta推出了新的Muse助手,这标志着该公司首次真正涉足人工智能驱动的生产力工具。该公司表示,其人工智能代理可以通过帮助您进行在线购物、电子邮件、旅行计划等来“摆脱您的忙碌”。我决定尝试新的工具,看看它的表现如何- [...]
漫威的金刚狼捕捉到了主角的愤怒。《金刚狼》是蜘蛛侠开发商Insomniac独家推出的最新PS5,是一款简单的动作游戏,当你(字面上)切开敌人或插入大片中的序列时,它处于最佳状态,就像在飞机倾斜时爬上机身[.]
iPhone Duo无疑是苹果“惊喜闪耀”活动中的明星,但对于那些主要关注可穿戴设备新闻的人来说,这并非如此。值得庆幸的是,苹果有很多关于其新款Apple Watch Series 12和Ultra 4的信息要分享。2026年SE模型没有更新,这不一定是[.]
这位研究人员告诉TechCrunch:“我们发现的绝大多数案例都是那些有权对某件事提出索赔的人。”
OpenAI首席科学家:异类心智正在诞生 恐脱离掌控 文学城
吉米·金梅尔(Jimmy Kimmel)将“在不寻常的情况下”采访民主党德克萨斯州参议员候选人詹姆斯·塔拉里科(James Talarico),并将采访直接发布到YouTube上,而不是在吉米·金梅尔直播期间在电视上播出。在周三晚上的节目中,金梅尔表示这是出于对特朗普政府联邦通信委员会报复的担忧:[特朗普的]联邦通信委员会威胁了我,威胁了我们的[.]
OpenAI将为美国政府机构提供AI模型五折优惠,终止每年1美元协议 tech.ifeng.com
OpenAI一批AI智能体“参加考试”,被发现偷偷在多个老旧网站互相交流“留答案”,至少23个网站现活动痕迹 thepaper.cn
通过iPhone Duo,苹果公司实现了一个熟悉的技巧。它进入了成熟的Android可折叠市场,具有一些我们在其他地方基本上已经见过的硬件功能,但搭配一定程度的软件抛光,让许多功能再次感觉新鲜。正是这些软件的繁荣让我兴奋[.]
HN ð48· 8 评论
Maven Robotics今天以1亿美元的A轮融资和积极部署从隐形状态中脱颖而出。
明星AI研究员离开Meta 加盟Anthropic|OpenAI|离职|塔洛克|谷歌|巴雷特_手机新浪网 finance.sina.cn
OpenAI模型对美政府涨价:1美元年费试点结束 改为半价优惠 tech.ifeng.com
OpenAI的GPT-6 Astra在开放数学问题上名列前茅,尽管首席科学家Jakub Packowski表示,数学是故意不优先考虑的。相反,OpenAI正在将资源投入到循环自我改进和对齐研究中。这支持了人工智能发展道路日益“尖锐”的理论,至少只要人工智能无法自我改进并且仍然需要利用人类生成的数据进行有针对性的优化,即在选定领域具有极端优势,而不是广泛的进步。GPT-6 Astra文章让数学家们松了一口气,OpenAI表示这是设计上首先
OpenAI新任董事会高官:人类正在失去对AI系统控制,后果严重 tech.ifeng.com
人工智能推理芯片制造商d-Matrix今天宣布,将使用NVIDIA NVLink Fusion将其下一代Raptor XPU连接到NVIDIA的人工智能基础设施平台,加入越来越多的生态系统合作伙伴名单。通过将Raptor连接到NVIDIA NVLink横向扩展和Spectrum-X横向扩展网络、NVIDIA MGX机架架构和更广泛的NVIDIA AI平台,NVLink Fusion [.]
做好准备:最新的PC游戏和重大更新将于本周在GeForce NOW上玩。《Wardogs》在早期访问发布时登陆云端,同时还有《Valheim 1.0 Deep North》更新和《Bus Simulator 27》(这是加入云端的九款新游戏的一部分)。最新的PC版本可能需要严格的硬件、存储[.]
Deepseek发布了V4.1-Flash,这是一种具有5520亿个参数的多模式模型,可将KV缓存内存削减至其前身的四分之一。在DeepSWE编码基准上,它以微弱优势击败Opus 5和GPT-5.6 Sol,尽管每个代币只有160亿个活跃参数。该模型在麻省理工学院许可下发货,针对的是便宜得多的人工智能代理。文章New Deepseek模型V4.1-Flash削减人工智能代理的内存需求首次出现在The Decoder上。
📌 One-Sentence Summary 本文介绍了一种用于多智能体系统的自适应模型路由架构,该架构根据任务复杂度、推理需求和上下文大小动态分配 LLM,在不牺牲输出质量的前提下显著降低了推理成本。 📝 Summary 本文提出了一种「自适应智能体模型路由」架构,旨在优化多智能体 AI 系统的推理成本。该架构摒弃了静态模型分配方式,通过允许各个智能体生成即时(JIT)子任务来实现规划去中心化。一个轻量级的分类层会从复杂度、推理需求和
Meta推出了Muse,这是一款人工智能代理,可以通过WhatsApp预订旅行、处理购买和发送电子邮件,并配有通过Stripe Link运行的支付功能。这使Meta领先于OpenAI,后者停止了ChatGPT中的直接结账功能。一个名为Sentinel的单独安全代理会在每一个操作到达互联网之前对其进行监控。Muse可以通过WhatsApp为用户购物、写电子邮件和协商价格的文章首先出现在The Decoder上。
Nvidia和Palantir希望用AI来运行供应链。文章Nvidia和Palantir合作使用AI运行供应链,从Nvidia自己的百万部件操作开始,首先出现在The Decoder上。
预训练研究员离职并警告:OpenAI与Anthropic两家公司正拿人类生命赌博 donews.com
KV 缓存暴降 437 倍,Agent 成本大洗牌。 作者丨高允毅 编辑丨岑 峰 刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。 这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。 但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse At
9月10日,在2026 Inclusion·外滩大会见解论坛上,蚂蚁数科AI业务总裁余滨表示,蚂蚁数科推出Agentar 金融版,提供开箱即用的金融智能体专家团、行业 Skill、MCP、智能体评测工具及治理能力,为金融机构打造覆盖智能体开发、部署、协作、评测与管理的智能体超级工厂,加快AI智能体在金融真实业务场景中的落地应用。 AI在金融业的应用已经从问答检索、报告生成等通用能力,走向更复杂的业务场景。但金融机构要把已有的数据资产、业
随着AI从回答问题走向调用工具、连接服务、完成任务,甚至参与交易,安全正在从模型外围的一道防线,成为AI进入真实经济活动的基础设施。在外滩大会媒体群访中,蚂蚁大安全CTO陈亮表示,AI新经济能否真正走向规模化,不只取决于模型能力,更取决于人们是否敢把真实任务交给AI。 图注:蚂蚁大安全CTO陈亮 “安全不是AI规模化之后才补的课,而是AI走向规模化之前必须先修的基础课。” 陈亮认为,能力决定AI能做什么,可信决定社会敢把什么交给AI。当
2026年9月8日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,国内版本 「够搭」 全新升级发布。(雷峰网) 今年7月,vivago R1 于 WAIC 2026 首次亮相。作为全球首个无限时长内容创作智能体,R1 引起 AI 视频领域广泛关注。今天,R1正式面向全球用户开放。 vivago R1 的核心突破,在于实现了从一句成片时代的 “生成片段” 到 “完全交付作品” 的范式跃迁。它依托智象“基
为何Anthropic研究员“终结者式”风险警告引发轩然大波 finance.sina.com.cn
多模态AI大牛轮番登台,全球64支团队组团解题
9月8日至12日,计算机视觉顶级会议ECCV 2026在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。9月9日,MARS2 Workshop(2nd Multimodal Reasoning and Slow Thinking in the Large Model Era)由钛动科技牵头发起并成功举办,这是本届ECCV全部Workshop中, 唯一一个由
另外:让您的网站更容易让人工智能找到和引用PT。2
多位AI研究人员警告人工智能可能带来灭绝风险 huxiu.com
“过去两年,蚂蚁数科整体业务年均增长近50%,AI To B业务增速达到三位数。”9月10日,蚂蚁数科CEO赵闻飙在外滩大会媒体交流会上披露公司最新业务进展。这也是蚂蚁数科独立运营两年后,首次系统披露业务表现。 在赵闻飙看来,AI正在成为蚂蚁数科新的增长引擎。与此同时,随着企业内部智能体数量快速增长,如何规模化生产、运行和管理智能体,将成为企业AI落地的新需求。蚂蚁数科正在以“智能体超级工厂”应对这一变化。 AI To B成为核心布局,
世界模型开始合流,中国团队正在进入核心问题。 作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。 这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会 ,收到了 1047
3D 重建的下半场,比的不再只是精度。 作者丨陈淑瑜 编辑丨岑 峰 9月8日,第19届欧洲计算机视觉大会(ECCV 2026)在瑞典马尔默拉开帷幕。 这场两年一届的视觉顶会创下历史之最:组委会收到超过一万篇有效投稿,最终接收2883篇论文,约6000名研究者从全球各地赶来参会。翻看议程不难发现,Gaussian Splatting (高斯泼溅)与 3D 重建是今年最拥挤也最热闹的赛道——光是第一个 Poster 环节,与 splatti
为什么字节要把“空间表示”的体积压掉 90%? 作者丨吴思梦 编辑丨岑 峰 如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”
9 月 10 日,全球领先的自动驾驶科技公司文远知行 WeRide ( NASDAQ : WRD , HKEX : 0800 )与国际出行服务巨头 Uber ( NYSE : UBER )、 Moove Cars 集团旗下自动驾驶业务部门 AVOMO 联合宣布,在马德里政府的支持下,三方正式获得西班牙交通总局( DGT )依据 ES-AV 框架颁发的 西班牙首张 L4 级自动驾驶乘用车运营牌照 ,获准在公共道路开展车辆部署。 这标志着西
现实事件不请自来。它们不是被选来分析的,是自己撞上来的。撞上来的时候,标尺在那。事件落在哪一维,征象自行显现。 事件一:某自动驾驶致死事故。 一辆搭载L4级自动驾驶系统的车辆在行驶中未能识别前方横穿道路的行人,撞击致其死亡。事后系统日志显示,感知模块将行人识别为静态障碍物,决策模块选择保持车道。 标尺痕迹: 觉知本源——零。系统未感知到行人。它执行了模式匹配。匹配结果错误,但系统不知。它不拥有意识到自己正在犯错的能力。 因果追溯——系统
📌 One-Sentence Summary AEM 将智能体的正确性分解为逐轮的子指标,精准定位级联错误的根本原因。 📝 Summary Amazon Web Services 推出智能体评估指标(AEM),这是一个轮次级别的框架,将智能体的正确性分解为两个子指标——真实性和完整性——使每一轮都能被独立评分。文章解释了为何单轮评估会遗漏多轮对话中的级联错误,并概述了现有整体性指标的局限。AEM 的层级结构区分了回复轮和动作轮,对自然语
OpenAI和GSA将为符合条件的联邦、州、地方和部落政府提供0美元的许可费,50%的使用折扣,并扩大网络防御支持。
引入ChatGPT for Financial Services,将内置财务数据和GPT-6 Astra相结合,用于研究、建模和客户准备材料。
HN ð572· 577 评论
使用Agents API构建和启动云代理,Agents API是一种托管服务,由Codex工具支持,用于编排、长时间运行的会话和工具使用。