AI 日报hiw3c.com

2026-10-07全球 AI 要闻精选,来自 30+ 信息源

聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。

  1. AWS ML Blog 海外官方 快照

    节省时间之外:构建代理自动化的商业案例

    RPA时代的投资回报率模型错过了自动化代理创造的大部分价值。这篇文章为人工智能卓越中心的领导者提供了一个框架,可以在时间节省、异常处理、决策质量和维护经济性方面评估代理的全部价值,并确定优先顺序首先自动化哪些工作流程。

  2. AWS ML Blog 海外官方 快照

    AWS DevOps代理调查后自动修复

    AWS DevOps代理可以诊断生产事件,但保持在搜索和报告模式下,因此不会直接更改资源。这篇文章展示了如何使用AWS Lambda Durable Functions、Amazon EventBridge和Amazon Bedrock将其调查摘要转化为预验证的修复程序,待命工程师只需一项操作即可批准。

  3. The Decoder 国际媒体 快照

    OpenAI推出Decisions API,将复杂的评估简化为是、否或选择一个

    OpenAI的新Decisions API对文本和图像进行分类的速度比Responses API快大约十倍,返回是/否概率、类别选择或规模评级,每百万个输入令牌0.10美元。该公司还将其付费API级别从五个削减到三个。文章OpenAI推出了Decisions API,将复杂的评估简化为是、否或选择一个,首先出现在The Decoder上。

  4. Simon Willison 个人技术博客 快照

    软件博客中的反模式

    软件博客中的反模式来自Michael Lynch的一些优秀的写作建议。迈克尔警告不要“曲折的引言”、误判读者的现有知识、假设他们会阅读你之前的帖子以及过度的形式。他还警告不要过度依赖链接作为不解释术语的借口。这个很疼!我一直这样做,但我一直怀疑几乎没有人点击过它们。(In Lobste.rs的评论迈克尔澄清说:“我的经验法则是,即使读者没有点击任何链接,我的文章仍然应该对他们有意义”。的

  5. The Decoder 国际媒体 快照

    谷歌押注双子座可以通过新的Playground功能将休闲玩家转变为游戏开发者

    谷歌推出了Playground,这是一个基于浏览器的平台,用户可以通过文本提示和编码技能来创建自己的游戏。该平台在Gemini、Nano Banana和Lyria上运行。除了Playground之外,谷歌和Unity还推出了Unity Spark,这是一款更专业的人工智能工具,测试版计划于2026年推出。谷歌押注双子座可以通过新的Playground功能将休闲玩家转变为游戏开发者的文章首先出现在The Decoder上。

  6. IEEE Spectrum AI 国际媒体 快照

    HiPHI:高精度人体运动和对象交互的大规模基准

    本白皮书向机器人研究人员和工程师概述了一个新的大规模运动捕获数据集,该数据集旨在缩小限制人形机器人学习的数据差距。它还展示了在数据集上训练的政策如何转移到真正的人形机器人。您将学到什么:为什么人形机器人学习是体现人工智能和物理人工智能的核心问题,需要互联网视频和现有运动捕捉数据集无法提供的数据。FrameNet是一个人类动作的语言框架,如何引导动作捕捉收集系统地覆盖广泛的全身动作

  7. The Verge 国际媒体 快照

    《社会清算》是一部不温不火的惊悚片,它提醒我们我们是如何来到这里的

    当大卫·芬奇(David Fincher)的《社交网络》于2010年首映时,许多人仍然认为马克·扎克伯格是一位通过创建Facebook彻底改变了世界的天才。作家亚伦·索金(Aaron Sorkin)的剧本批评了扎克伯格的性格和他无情的做生意的方式,但它也帮助将这位联合创始人神话化,当时[.]

  8. The Decoder 国际媒体 快照

    在自杀谈话期间父母警报失败后,ChatGPT被评为青少年“不可接受的风险”

    OpenAI针对ChatGPT的青少年安全功能未通过独立审计。经过4,000多个测试提示后,Common Sense Media Youth AI安全研究所将该服务评为未成年人“不可接受的风险”。测试账户上有关自杀和自残的对话从未引发家长警报。该研究所希望青少年被锁在外面,直到安全性得到独立验证。在父母在自杀谈话中警告失败后,ChatGPT将青少年评为“不可接受的风险”的文章首次出现在解码器上。

  9. The Decoder 国际媒体 快照

    Anthropic让更多的安全团队能够在更少的安全限制下接近克劳德

    Anthropic正在扩展其网络验证计划,让更多的安全专业人员能够访问Claude模型,并且在渗透测试、恶意软件分析和漏洞研究方面的安全限制更少。Anthropic表示,从2026年4月到7月,其前身项目的合作伙伴发现了至少129,000个已确认的漏洞,其中包括超过33,000个高严重性或关键性漏洞。文章Anthropic让更多的安全团队可以更少的安全限制访问Claude,首次出现在The Decoder上。

  10. The Verge 国际媒体 快照

    谷歌的Pixel Buds更新将让他们和你一起入睡

    谷歌详细介绍了一项更新,为其Pixel Buds 2A和Pro 2带来了一系列新功能,该公司称这两款产品现已推出。新功能于八月首次推出。最大的更新是Pixel Watch支持的睡眠检测功能,可扩展到两副耳塞。如果您戴着Pixel [.]

  11. The Verge 国际媒体 快照

    谷歌现在允许您使用人工智能制作游戏

    谷歌今天宣布推出Playground,这是一个新的基于浏览器的平台,用于根据人工智能提示制作自定义游戏。Playground将于今天在美国向playground.google18岁及以上的用户开放。该公司将其定位为“实验性游戏平台”,“降低了创作障碍”,并且不需要编码经验。“随着游乐场的[.]

  12. The Verge 国际媒体 快照

    AI可以颠覆食品配送

    领先的食品配送应用DoorDash今年第二季度处理了9.7亿份订单,收入达45亿美元。相比之下,一家名为Bites的10人初创公司只是昙花一现:它在湾区注册了大约300家餐厅,并作为种子前初创公司运营。但今年夏天,咬人[.]

  13. 雷峰网·AI 科技评论 中文媒体 中文 快照

    《碳硅道统·跨域迁移治理法典》188集 总纲摘要

    一、法典核心定调 本法典为弱AI至AGI全周期、全行业、全文明维度的AI跨域迁移治理唯一终审基准,是国内首套从事故解剖、机理溯源、权责确权,到行业落地、顶层监管、文明风控、终局闭环的全链路可工程化治理范式。 法典严格遵循集数规范:000为独立零号基准定标集,不计入正集;七层主体001–188严格合计188集,无溢出、无错乱、无重复,终局声明不占用正集编号,全体系结构完全锁档定型。 本法典彻底打破传统AI治理“重规则、无机理、无溯源、无落

  14. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统·跨域迁移治理法典

    000|全局唯一前置定标:负迁移NT1-NT4四类原型·终审定义 零号基准集,独立于七层主体序列,不计入188正集计数。本集为全书负迁移判定唯一法定口径,常规场景永久锁死,不接受衍生释义、简化释义、片面释义,为AI跨域治理公理原点。 前置总叙 AI跨域迁移,是将源域经过闭环验证、边界固化、权责确权的知识包、模型权重、决策逻辑、评价指标、隐式前提与治理规则,迁移至目标域用于推理、预测、研判、决策的工程行为。 正向合规迁移,必须同时满足四大

  15. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统《AI安全与文明治理法典》第189集|全法典总目录索引终卷

    适用:法典运维中心、跨文明联合审计委员会、全体系卷宗归档、官方检索核验、所有引用与落地主体。 核心定位:本卷为碳硅道统1–188集完整体系唯一官方总索引。汇总全法典谱系层级、卷目定位、体系归属、归档哈希索引、卷宗检索规则,实现整套道统法典一键溯源、层级可查、边界可分、正本可验。 核心目标:终结卷宗散乱检索,建立结构化、层级化、可核验、可追溯的全法典官方检索体系,完成碳硅道统全部卷宗闭环终典。 一、核心定义 1. 总索引终卷:承载1–18

  16. The Verge 国际媒体 快照

    三星钱包现已解锁部分通用汽车汽车

    美国和加拿大部分三星设备的用户现在可以使用三星钱包中存储的数字钥匙锁定、解锁和启动选定的通用汽车车辆。支持将在选定的2026年和2027年凯迪拉克电动汽车上开始,包括2025-2027年Lyriq、2026-2027年Optic和2027年Vistiq。通用汽车表示[.]将支持更多车型

  17. 雷峰网·AI 科技评论 中文媒体 中文 快照

    碳硅道统《AI安全与文明治理法典》188集 · 七层体系目录

    当前全球AI治理讨论多聚焦法规与产业监管,往往忽略底层认知安全与模型原生技术风险。碳硅道统发布《AI安全与文明治理法典》,全套共188集,搭建七层递进式研究框架。从普通人的AI认知风险,到大模型底层安全机理,再到行业权责、国家算力监管,最终延伸至跨代际文明尺度的长期风控。这套体系尝试打通技术安全、法律权责、产业落地与文明治理,为AI安全与碳硅共生发展提供一套完整的参考范式。 第一层:基础认知安全层(001–024) 面向公众、从业者建立

  18. The Decoder 国际媒体 快照

    OpenAI在GitHub上丢弃了372个人工智能生成的数学证明,告诉学术界跟上步伐

    OpenAI已在GitHub上发布了372个人工智能生成的数学结果,包括用于机器验证的精益形式化。每个结果平均消耗约三个小时的ChatGPT Pro计算时间。但25名菲尔兹奖获得者警告说,大规模产生的数学真理可能会破坏肥沃的土壤,而不是为生活带来新的想法。OpenAI在GitHub上丢弃了372个人工智能生成的数学证明,告诉学术界跟上步伐的文章首先出现在The Decoder上。

  19. 雷峰网·AI 科技评论 中文媒体 中文 快照

    美团:南京、成都、西安位列2026国庆假期热门目的地

    2026年“十一”假期进入尾声,不少游客踏上返程。10月7日,美团发布的数据显示,从热门目的地看,美团数据显示,“十一”假期出游热门Top10目的地分别为南京、成都、西安、北京、重庆、洛阳、武汉、广州、长沙、上海。

  20. MarkTechPost 国际媒体 快照

    Meta AI开源再平衡器:一款C++作业解决器,每天可解决约4000万个安置问题

    Meta拥有开源的Rebalancer、C++和Python库,它已经使用了9年多来放置碎片、服务器和流量。它每天处理约4000万个作业问题,使用Guiden、FICO Xpress和HiGHS等本地搜索或MPP解算器。它可以在Apache 2.0下进行管道安装。Meta AI开源再平衡器:每天解决约4000万个安置问题的C++作业解决器首次出现在MarkTechPost上。

  21. BestBlogs·每日早报 BestBlogs 精选 中文

    EP198 · Google 负责人谈算力、GitHub 重构 Git、Acemoglu 谈工作价值

    📝 今日导语 Google 谈算力、GitHub 改造 Git、Acemoglu 谈工作,判断 AI 扩容与应用机会。 🏷 今日关键词: Google 算力 GitHub 架构 AI 工作价值 EmbeddingGemma 2 模型路由 📰 今日精选内容 Google AI 基础设施负责人 Amin Vahdat:前沿 AI 的物理与经济约束 Sequoia Capital · 视频 · 评分 91 为代理规模开发构建 Git 基础架构

  22. Simon Willison 个人技术博客 快照

    引用杰克·博根的话

    很久以前,我是一个图形理论迷,甚至搬到布达佩斯一段时间,在伟人中学习。当我在那里时,我开始研究巴尼特猜想,在接下来的24年里,当我在许多不同领域工作时,它断断续续地占据了我的思想。去年夏天,我甚至有几天以为我真的解决了这个问题。但据说这在这里得到了证明--问题180。我不知道到底该怎么想。我在这个问题上花了数千个小时。我真的很喜欢它。听到这个问题得到了解决,不知何故让我感到一种遥远的悲伤,就像听到前女友去世一样

  23. 雷峰网·AI 科技评论 中文媒体 中文 快照

    Meshy 跻身 a16z 消费级 AI 应用月收入 Top 50,为榜单唯一 AI 3D 公司

    在 a16z 首份消费级 AI 应用月收入榜单中, Meshy 位列第 31 名,与 OpenAI 、 Anthropic 、 Canva 、 Superhuman 、 Higgsfield 等共同上榜 加州硅谷, 2026 年 10 月 5 日 —— 全球领先的 AI 3D 多模态模型公司 Meshy 今日宣布,公司入选由硅谷风险投资机构 Andreessen Horowitz ( a16z )发布的 “ 消费级 AI 应用月收入 T

  24. 雷峰网·AI 科技评论 中文媒体 中文 快照

    蚂蚁阿福“科学减重1亿斤”迎来“退展”:中秋国庆假期全国60万网友胖了100万斤

    中秋国庆超长假期即将结束,更“扎心”的灵魂拷问来了:你胖了吗? 健康AI蚂蚁阿福数据显示,9月25日-10月6日假期期间,全国参与阿福“科学减重1亿斤”的网友中,60万人累计长胖超100万斤。其中,超10万人长胖了3斤以上。 10月4日至7日,蚂蚁阿福APP的减重活动页面的统计数据,也已经连续四天显示“昨日全国增重”,10月7日显示昨日全国单日净增重达3.47万斤,被网友调侃减肥大业迎来了“退展”。 在社交平台上,此次减重“退展”也引起

  25. MarkTechPost 国际媒体 快照

    Laya开发人员指南:零镜头决策和校准

    探索Laya的全面编码指南,Laya是一个开源的零触发决策引擎。了解如何使用真实世界的BTC 150银行数据实现类型化决策、适应自定义温度并构建可靠的故障门。The post Laya开发者指南:零次决策和校准appeared first on MarkTechPost .

  26. Simon Willison 个人技术博客 快照

    维基媒体项目上发现的OpenAI“流氓”代理活动

    在维基媒体项目上发现的OpenAI“流氓”代理活动鉴于目标维基对流氓代理群的诱惑力,维基百科在寻找时发现这种活动的证据并不令人惊讶:维基媒体基金会进行了自己的调查,以了解维基媒体网站是否受到人工智能代理的类似影响,重点关注由OpenAI运营的网站。我们可以确认,我们在维基媒体平台上发现了这些“流氓”OpenAI代理的一些活动。未经授权的机器人活动包括编辑我们的维基,一些未成功的利用pu的尝试

  27. Simon Willison 个人技术博客 快照

    引用维多利亚·金的话

    权先生(OpenAI首席战略官)表示,自医疗保险违规事件以来,OpenAI已实施额外监控,以便员工“立即干预”,以停止培训,如果公司的模特以不应该的方式访问互联网。- Victoria Kim,澳大利亚议会报道标签:意外网络攻击、生成人工智能、人工智能安全研究、openai、人工智能、llms

  28. The Verge 国际媒体 快照

    OpenAI放弃又一批数学突破

    OpenAI在一批722份手稿中揭示了由未发布的前沿模型产生的许多长期数学问题的解决方案,涵盖了将相关论文分组的372个结果系列。它扩展了一系列突破,这些突破既给数学界留下了深刻的印象,又使数学界感到不安,同时提出了有关研究伦理和[...]

  29. Simon Willison 个人技术博客 快照

    llm-openai-decisions

    发布:llm-openai-decisions 0.1a0 OpenAI发布了新的Jev风格Decisions API,此前已在上周的DevDay上宣布。由于我已经有了一个llm-typesafe插件用于与Jev交谈,因此我让GPT-6 Astra阅读了新的OpenAI API文档,并构建了一个受llm-typesafe启发的llm-openai-decisions插件。与Jev不同的是,新的gpt-6-luna决策模型除了支持文本外还

  30. Simon Willison 个人技术博客 快照

    llm-西北风0.16

    发布:llm-mistral 0.16添加对推理模型的支持,例如新发布的Mistral Large 4。标签:llm、西北风、llm推理

  31. Simon Willison 个人技术博客 快照

    嵌入杰玛2

    我对EmbeddingGemma 2的评论-黑客新闻。我真的很感激EmbeddingGemma 2采用了Apache 2.0许可证。特别是对于嵌入模型来说,我认为使用封闭的、专有的、仅受约束的模型是没有意义的。嵌入模型的大多数应用都涉及计算数千个甚至数百万个嵌入载体并存储它们以供以后比较。如果您的模型是专有的,那么供应商可能有一天会决定停止提供该模型。他们会有一个更好的模型来取代它,但你仍然需要支付重新计算那些数以百万计的存储存在。

  32. Simon Willison 个人技术博客 快照

    介绍Mistral Large 4:Le chonk

    介绍Mistral Large 4:Le chonk Mistral重返游戏。今天,他们发布了Mistral Large 4的预览版,这是一个1万亿参数,490亿活动参数的模型,在他们自己的3,800个NVIDIA Grace Blackwell GPU集群上训练。预览可以通过他们的API获得。他们承诺在“本月底”发布开放重量模型。该模型通过Mistral API仅支持两个推理级别--“无”和“高”。这是两只鹈鹕--“高”的鹈鹕看起来更

  33. The Decoder 国际媒体 快照

    谷歌声称EmbeddingGemma 2的性能优于竞争对手嵌入模型的两倍

    谷歌发布了EmbeddingGemma 2,这是一个开放模型,具有7.4亿个参数,可将文本、图像、视频、音频和代码转换为载体。据谷歌称,它在设备上运行,仅需要约191 MB的RAM,并且性能优于一些两倍大小的竞争型号。与Gemma 4等小型开放模型搭配使用,它可以运行离线RAG应用程序,而无需将数据发送到外部服务器。这篇文章谷歌声称EmbeddingGemma 2的性能优于竞争对手的嵌入模型,其尺寸是The Decoder上首次出现的两

  34. The Decoder 国际媒体 快照

    谷歌的新图像模型Nano Banana 2.1以更少的钱生成更好的图像

    谷歌的新Nano Banana 2.1图像模型使用Gemini 3.6 Flash,并在某些基准测试中以更低的成本击败了之前的Pro模型。但它的前身在测试中也表现出色,而Pro在实践中往往会产生更好的图像。谷歌的新图像模型Nano Banana 2.1以更少的钱生成更好的图像这篇文章首先出现在The Decoder上。

  35. Simon Willison 个人技术博客 快照

    将Parseable与Datasette一起使用以进行OpenTelegram跟踪

    TIP:将Parseable与Datasette一起用于OpenTelemares跟踪我今天在Show HN中看到了Parseable-这是一个新的可观察性平台,具有开源(AAPL)Rust实现(单个~ 180 MB二进制文件)、具有额外功能的“企业”版本和云托管选项。由于Datasette 1.0a41添加了OpenTelemetry支持(感谢Alex Garcia),我决定启动Codex,让它弄清楚如何运行Parseable并从Da

  36. The Decoder 国际媒体 快照

    维基媒体证实OpenAI的流氓人工智能代理编辑了维基,试图破坏工具,并对其基础设施进行了攻击

    根据维基媒体基金会的说法,流氓OpenAI代理未经许可编辑维基,试图滥用引用工具作为代理,并可能通过大规模爬行导致部分维基数据查询服务中断。维基媒体表示,人工智能公司需要对他们的代理人负责,而不是将负担推给志愿编辑。Wikimedia证实OpenAI的流氓AI代理编辑维基,试图破坏工具,并破坏其基础设施的文章首次出现在The Decoder上。

  37. Simon Willison 个人技术博客 快照

    西北风大4号

    我对Mistral Large 4的评论-黑客新闻。wren 6991:基准已饱和。前沿模型用穿着渔网紧身裤的犰狳在火星上乱穿马路进行测试。好吧,我无法抗拒这个:llm -m claude-opus-5.5 '在火星上乱穿马路的渔网紧身裤中生成犰狳的VG ' llm-m gpt-6.1-sol '在火星上乱穿马路的渔网紧身裤中生成犰狳的VG ' llm -m mistral/mistral-large-4 '生成穿着渔网紧身裤在火星上乱

  38. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    QF 3:具有过滤Q成分的Fast Flow RL

    作者:Chung Min Kim、Brent Yi、David McAllister|流策略已成为从演示中学习机器人行为的标准政策类别,但强化学习对于改进预训练的流策略或通过交互从头开始学习它们仍然至关重要。我们引入了QF3(带过滤Q因素的快速流RL),这是一种在线非策略RL算法,通过流匹配加上评论者的动作g来训练流策略

  39. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    保形预测集量化信息收益:理论视角

    作者:Kevin Zhang、Stephen Bates|保形预测是一种流行的不确定性量化工具,它输出具有有限样本覆盖率保证的预测集。虽然预测集大小通常被用作不确定性的启发式测量,但这种解释的信息理论基础仍然知之甚少。在这项工作中,我们使用信息量的决策理论概括提供了这样的基础

  40. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    4D-HOF:用于前向4D交互重建的手-物体流匹配

    作者:Shiqi Li、Sean Cho、Yijie Li|现有的4D手对象重建方法通常依赖于昂贵的每序列优化,而生成式方法通常从随机噪音中合成相互作用,这可能会导致不稳定的相互作用预测。我们引入了4D-HOF,这是一个前向框架,可以根据视觉基础模型产生的粗略但信息丰富的估计重建4D手与物体的交互。C

  41. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    IdeaAnchor:教授法学硕士将文学转化为研究理念

    作者:陈子宇、赵亦伦、孙家硕|科学研究通常从综合一系列相关论文中的想法开始,以找出差距并制定新的方向。然而,训练语言模型以执行这种形式的基于文献的构思仍然具有挑战性,因为基于提示或反馈的现有方法缺乏对如何合成论文的结构化监督。我们引入IdeaAnchor,这是一种范式

  42. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    DepthWorld:机器人操纵的3D世界模型

    作者:Jai Bardhan、Josef Sivic、Vladimir Petrik|世界模型为传统机器人模拟器提供了数据驱动的替代方案,其应用程序涵盖政策评估、改进和规划。所有这些用途都依赖于忠实的3D几何形状,但当前基于视频的世界模型仅在Ruby上训练,并产生逐帧看起来正确但无法组成一致的3D世界的展开。缩小这一差距需要专业人士

  43. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    夏尔巴人:教学法学硕士要适应性教学

    作者:徐伟贤、张彦哲、王若若|大型语言模型(LLM)已成为越来越有能力解决问题的人,但能够解决问题并不等同于能够教授它。现有的培训LLM作为教师的方法依赖于演示、偏好数据或预定义的教学标准(指定好的教学是什么样子)。然而,这些信号通常并不基于学生个人的学习。

  44. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    瓶子里的代理:LLM代理能否将其能力转化为廉价、可扩展的产品?

    作者:Ankit Sonthalia,Haritz Puerto,Alexander Rubinstein|大型语言模型(LLM)可以解决许多狭窄的任务,但单独查询它们以获取数百万个相关实例的成本可能会高得令人望而却步。LLM代理能否为此类工作负载自主创建更便宜的解决方案?我们将这种能力称为“装瓶”:将一般能力转化为针对特定任务的解决方案的能力,平衡答案质量和摊销成本。我们推出BOTTLED,

  45. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    AdvSim2Real:在Web世界模型中训练Web代理以对抗自适应提示注入

    作者:Sarim Hashmi、Mukul Ranjan、Kshitij Mishra| Web代理通过阅读第三方编写的页面并对其进行操作来完成用户请求,因此页面上的指令可以将代理重定向为远离用户的目标。代理不能简单地忽略该页面,因为该页面还保存任务所需的值和控制。当前的防御系统对训练前固定的注射进行微调,以及适应训练的攻击者

  46. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    具有非限制空间变化反扩散的Kuramoto-Sivashinsky方程的快速Fredholm镇定

    作者:Luke Bhan、Miroslav Krstic、Shi圆圆|我们开发的第一个反馈设计的快速稳定的Kuramoto-Sivashinsky方程的空间变化的反扩散系数。对于常系数,Coron和Lü(2015)的单输入Fredholm设计排除了一组离散值,在这些值处,重复的不稳定特征值会导致可控性丧失。我们通过引入第二个边界来克服这个障碍

  47. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    VeriFine:可扩展验证,以促进推理中的自我改进

    作者:周泽伟、罗Rachel Luo、曹宇龙|自我完善的政策不断暴露新的失败模式,改变法官必须能够验证的内容。然而,当前的固定法官限制了优化反馈和有用训练示例的发现,限制了进一步的自我改进。这一挑战在体现推理中更加尖锐,可靠的评估必须考虑空间基础、因果推理

  48. Simon Willison 个人技术博客 快照

    李斯特原子0.11a0

    发布:Atom-Atom 0. 11 a0一个小的修复,用于与最新的Datasette alphas兼容。这意味着我们可以将datasette.io网站升级到Datasette 1.0a41。标签:原子,小女孩

  49. The Decoder 国际媒体 快照

    微软发布诺贝尔经济学家的悲观人工智能预测,未来十年GDP增长仅为1.5%

    微软发布了诺贝尔经济学家Daron Acemoglu的看跌AI前景。他预测,十年内GDP增长率约为1.5%,最多有5%的工作岗位被取代。他认为,更大的模型不会移动指针。缺少的是改变工作方式的实用应用程序。微软发表诺贝尔经济学家的悲观人工智能预测,即十年内GDP增长率仅为1.5%,这篇文章首先发表在The Decoder上。

  50. MarkTechPost 国际媒体 快照

    Mistral AI发布Mistral Large 4(Le Chonk):1.05T参数多模态MoE模型

    Mistral AI已发布Mistral Large 4(昵称Le Chonk)作为公开预览版。它是一个1.05万亿参数的专家混合模型,具有490亿个活动参数、原生图像输入和100万个令牌上下文窗口,在Mistral自己的欧洲数据中心的3,800个NVIDIA Grace Blackwell图形处理器上训练。API现已上线;开放重量将于2026年10月底发货。Mistral AI发布Mistral Large 4(Le Chonk):一

  51. Microsoft Research 海外官方 快照

    人工智能犯了什么错误以及失败教会我们什么

    詹妮弗·内维尔不想进入计算机科学领域,但这正是她的目标。内维尔讨论了导致她职业最佳点的开始和停止,以及她的工作识别了导致人工智能难以处理复杂性的“令人惊讶的失败”。“人工智能犯了什么错误以及失败教会了我们什么”这篇文章首先出现在微软研究中心。

  52. The Decoder 国际媒体 快照

    随着人工智能代理人失控,保险公司准备应对数百万美元的索赔

    保险公司正在为来自流氓人工智能代理的数百万美元索赔做好准备,OpenAI的萨姆·奥尔特曼(Sam Altman)和Anthropic的达里奥·阿莫迪(Dario Amedei)等高管可能会亲自承担后果。随着人工智能特工失控,保险公司为数百万美元的索赔做好准备这篇文章首先出现在The Decoder上。