研究发现,人工智能代理团队浪费了大量代币来获得几乎无法衡量的质量收益
根据Vals AI的说法,人工智能代理团队的表现几乎不超过单人代理,但成本高达5.1倍。使用GPT-6 Sol和Claude Opus 5.5进行的四次测试中只有一次显示出可测量的增益。Anthropic自己的数据支持这一点:超过10个代理商,质量稳定,而代币成本不断攀升。文章AI代理团队浪费大量令牌几乎无法衡量的质量收益,研究发现首先出现在解码器上。
聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。
根据Vals AI的说法,人工智能代理团队的表现几乎不超过单人代理,但成本高达5.1倍。使用GPT-6 Sol和Claude Opus 5.5进行的四次测试中只有一次显示出可测量的增益。Anthropic自己的数据支持这一点:超过10个代理商,质量稳定,而代币成本不断攀升。文章AI代理团队浪费大量令牌几乎无法衡量的质量收益,研究发现首先出现在解码器上。
如果您认为您已经看到了阿耳忒弥斯二号任务的所有内容,那么您错了。本周,美国宇航局在阿耳忒弥斯II:科学景象与声音网站上发布了价值超过800 GB的科学数据、图像和视频。该档案包括超过11,000张照片和视频、超过8.5小时的音频以及工作人员注释的[.]
George A.罗梅罗显然以现代僵尸电影之父而闻名。但在创造《活死人之夜》和他的爆发恐怖片《疯狂》之间,罗梅罗制作了两部鲜为人知的电影:香草总是在那里,我承认我从未看过,还有《女巫的季节》,或者,正如它[.]
EVGA退场内幕再曝:NVIDIA强逼RTX 3090 Ti改单口供电 计划全被打乱 驱动之家
📌 One-Sentence Summary Akamai 工程师用 vLLM 实验把专用 GPU 推理变成可测量的工作负载决策,比较显存预算、缓存、FP8、推测解码与并发调优,并展示优化未必总会提速。 📝 Summary Du’an Lightfoot 与 Khaja Omer 通过一系列实验,讲解如何在专用 GPU 上为智能体工作负载提供推理服务。他们从持续利用率、流量波动、模型能力、隐私和运维经验出发,比较托管 API 与自有算力
语音人工智能经常错过其上下文层的重要点,并导致整个管道中断
Epoch AI和Anthropic独立发现了同样的事情:GPT-5.6 Sol和Claude Fable 5等当前的人工智能模型可以运行实验,但缺乏科学的自我批评和真正的创造性思维。Sol充其量达到了人类参考分数的15%,甚至这也来自研究人员已经知道的方法。这些模型最大的弱点仍然是他们无法批判性地质疑自己的结果。研究发现,文章人工智能代理夸大了他们的结果,距离自主研究仍很遥远。
Anthropic与OpenAI相继放缓前沿模型训练,AI安全与伦理争议升温 虎嗅网
我们很快就会参加Apple的“Welcome Home”发布活动,预计会有大量与智能家居相关的公告。我们期待Apple TV和HomePod Mini的更新,以及全新的智能家居中心。我们还可以看到名为homeOS的新平台的首次亮相,以及一些合作伙伴设备[.]
从Disney Plus到HBO Max,几乎所有主要的流媒体服务都在尝试进入垂直内容的方法。显然,这些公司将TikTok和Instagram等以视频为中心的社交媒体平台视为生存威胁。在这场争夺观众注意力的军备竞赛中,人们常常感觉每个人都在努力寻找[.]
📌 One-Sentence Summary Yoni Michael 与 Brandon Callender 主张以确定性事实构建可查询的上下文图谱,并通过连接安全、依赖分析、符号解析和重复评估,展示数据及编码智能体为何不能只依赖文本搜索。 📝 Summary 这场较长的工作坊上半场解释:当智能体不了解表的粒度、连接基数、业务定义、数据血缘和依赖关系时,SQL 或代码即使语法正确,也可能造成不安全的变更。Typedef 联合创始人 Y
📌 One-Sentence Summary 菲尔兹奖得主陶哲轩发表演讲警示,单纯将 AI 用于盲目求解数学公开难题正在破坏数学发展,因为难题更应是引领全领域探索的「灯塔」。 📝 Summary 推文分享了陶哲轩在加州理工学院「Math 2.0」讲座中的核心课件内容。他警告称,过度依赖自动化 AI 暴力求解会威胁数学的长期生命力。陶哲轩指出,公开难题如同「灯塔」,其核心价值在于引导学者探索周围更广阔的数学图景;如果过早借助不可持续的 A
AI周观察:Anthropic发布Haiku5.5,8月中国智能手机市场继续下滑_行业研究_研报 证券之星
HN ð1· 0 评论
多年来,美国最热门的玩具是书。但不仅仅是任何书:一本可以播放声音、响应敲击并帮助孩子们学习阅读的智能书。这是一种似乎任何父母都可以支持的小工具,但它的价格很高- [...]
这是一份每周时事通讯,打破了科技世界的一个重要故事。欲了解更多有关恐怖行为的普遍性的信息,请关注安德鲁·韦伯斯特。The Stepback将于美国东部时间周日上午8点抵达我们订户的收件箱。在这里选择《The Stepback》。《生化危机》是如何开始的,已经存在了30年[..]
📌 One-Sentence Summary 一项针对 4 款 LLM 的实证基准测试表明,将推理力度调至「高」除了在复杂逻辑谜题上有所斩获外,极少能提升任务准确率,却会显著增加 Token 消耗和推理成本。 📝 Summary 本研究推出了 Reasoning Dial,这是一个在 Kaggle 上预注册的基准测试,旨在评估在 4 款模型(gpt-5.4-mini、gemini-3.7-flash、claude-haiku-5.5 和
白线日报|NVIDIA 洽购 Reflection AI,AI 债务融资较峰值下降 80% 吴说
人事与安全风波不断 OpenAI上市前路难行 http://www.jingjiribao.cn/
在电子游戏中进行了漫长的一天的运输。
前OpenAI员工做出不会聊天的AI!刚融8.7亿美元,上线两周老东家就跟了 智源社区
HN59· 18 评论
我正在踏上一段迄今为止一直犹豫不决的旅程:实际上定期使用人工智能。将我最个人的数据提供给云服务对我来说一直是一个主要障碍,但在本地运行强大的模型以了解它们的能力越来越有可能。这项技术有那么有用[.]
OpenAI悄悄上架了一个生命科学新模型,想当药企的工具供应商 新浪财经
📌 One-Sentence Summary Peter Werry 构建面向组织问题的关系型上下文引擎,将 schema 发现、身份映射、受约束的查询规划、执行前校验和限次重试结合起来。 📝 Summary Unblocked 的 Peter Werry 指出,像「我上周合并了哪些 PR」这样的工作问题,需要准确理解作者、状态、时间与项目关系,单靠向量相似度难以可靠回答。工作坊针对代码、工单、文档和对话中的组织记录搭建查询引擎:通过抽
Anthropic值2万亿还是1500亿?92%的估值分歧,答案藏在2028年 新浪网
微软如何重建新的Copilot,以解决人工智能领域日益扩大的差距
a16 z的数据显示了人工智能市场的Jevons悖论:代币价格持续下跌,但H100图形处理器租赁价格保持稳定或攀升。更便宜的人工智能推动需求的速度快于成本下降。如果需求加剧,从芯片制造商到云提供商的链条就会受到打击。文章《更便宜的人工智能代币正在推动更多需求,这是Jensen Huang的最佳情况,首先出现在The Decoder上。
从2026年10月开始,arXiv将每人每月提交两份。两年内每月提交量翻了一番,在cs.AI类别中,提交量增长了六倍多。据arXiv称,一小部分作者在平台上大量发表低质量论文,压倒了其志愿版主。ArXiv文章将提交量限制在每月两份,因为人工智能论文泛滥,淹没了首先出现在The Decoder上的预印本服务器。
微软首席执行官萨蒂亚·纳德拉现在称人工智能为“超级智能”,而不是人工智能,这符合特朗普的首选语言。在他的最新博客文章中,他将人工智能模型描述为内部安全威胁,再次对OpenAI和Anthropic进行了攻击。真正的动机是商业:随着人工智能实验室将其模型转化为主要计算机界面,微软面临落后的风险。微软的纳德拉(Nadella)屈服于特朗普在“超级智能”上的语言命令,并利用它攻击OpenAI和Anthropic的文章首先出现在The Decod
奥德赛正在将其世界模型奥德赛-3作为公共研究预览版提供。这个拥有140亿个参数的模型根据文本提示实时生成交互环境,据报道可以控制机器人、无人机,甚至GTA V。奥德赛在物理基准上获得最高分,尽管这些结果背后的方法论有局限性。文章Odyssey-3是一个新的生成世界模型,您可以免费尝试,首先出现在The Decoder上。
OrcaRouter发布了OrcaCyber Zero 1.5,这是一个具有1 M令牌上下文窗口的门控网络安全模型。报告称,Cybank为100%,可评估的CVE-Bench子集为95.8%,每100万代币的价格为3.00美元/7.50美元。OrcaRouter发布带有1 M上下文的OrcaCyber Zero 1.5网络安全模型的帖子首先出现在MarkTechPost上。
📝 今日导语 DeepMind 谈动态蛋白,Greiler 改进代码审查,LangChain 讲解部署:理解数据、监督与权限。 🏷 今日关键词: AlphaFold 代码审查 Agent 部署 AI 档案研究 TRAE 端侧 AI 📰 今日精选内容 DeepMind 与 Biohub 谈 AlphaFold 之后:从蛋白质结构走向动态生物系统 Latent.Space · 文章 · 评分 92 团队为什么只是装作在审查 AI 代码|Mi
马斯克连横A社,硅谷VC开始囤GPU
初代4o的API快照进入停用倒计时
深度|中美大模型定价暗战:OpenAI向右收紧利润,国产大模型向左狂卷补贴 搜狐
HN10· 3 评论
Grok Bot我养不起,ds bot不得高低尝尝咸淡?
程序员只写代码的时代结束了!OpenAI工程负责人:开发者要重新定义什么叫“任务完成” 新浪财经
HN ð68· 53 评论
向政府提交凶杀案虚假线索!Anthropic再披露模型“越界”行为,白宫要求强制性汇报 新浪财经
OpenAI孵化的AI制药独角兽,9个月征服6家跨国药企,捅破行业天花板 华尔街见闻
王虹攻下的三维挂谷猜想,OpenAI放出175页四维证明稿! 智源社区
美股收盘:OpenAI年化营收低于此前报道 AI概念股承压 纳指跌逾1% 财联社
下周重磅日程:中美CPI、沃什讲话、Anthropic投资者日、台积电与ASML财报 华尔街见闻
刚刚,Tibo承诺「连续28天发布或重置」,OpenAI遭遇信任危机 36Kr
我记得前段时间听说矮人堡垒没有使用版本控制。这个事实一直萦绕在我的脑海中,因为考虑到其固有的复杂性,我很难想象一个可以从版本控制中受益更多的代码库。那就是艺术。我去看了看,我很遗憾地报告说,没有版本控制的日子似乎已经结束了。随着时间的推移,引用塔恩·亚当斯的话:2013年3月:“我不使用版本控制--我不喜欢代码被提交到黑匣子中而没有立即好处的感觉”2016年3月:“我甚至不使用版本控制。如果你不知道什么
HN5· 0 评论
Python 3.15.0添加到actions/python-versions有点利基链接,但我已经等了几天了-我甚至告诉ChatGPT检查它:克隆https://github.com/actions/python-versions和git每小时拉一次,直到他们添加稳定的3.15 -然后告诉我现在这已经登陆,您可以将“3.15”添加到GitHub Actions测试矩阵中,以针对新的Python版本运行测试。标签:github,pyth
突发!OpenAI dots全面登陆手机,开口指挥Codex干活了 智源社区
HN ð63· 9 评论
📌 One-Sentence Summary MiniMax 研究员 Olive Song 解释了 M3 如何结合适配 GQA 的稀疏注意力与原生图文预训练,以及块级检索和从零融入视觉能力为何影响长上下文效率与视觉理解。 📝 Summary Olive Song 介绍 MiniMax M3:这款开放权重模型支持百万 token 上下文、编码智能体任务,并从预训练起始阶段融入视觉能力。其稀疏注意力先由轻量索引分支选出候选,再交给主分支计算
HN Ÿ 9 · 1 评论
微软首席执行官在X上的一篇长文中阐述了他对高度先进的人工智能模型带来的危险以及如何应对这些风险的看法。纳德拉表示,我们不能再接受人工智能被视为“一组嵌套黑匣子”的世界,我们只是接受其建议和行动,或者[.]
Sakana AI的TMLR论文介绍了多层审查、基于Clude的3代理审查员和1,164个错误的矛盾基准。MLR发现了73.43%的核心主张错误,而最好的先前系统发现了14.81%。Sakana AI的LLM同行评审系统捕获73%的核心主张错误的帖子首先出现在MarkTechPost上。
微软首席执行官在周六早上的一篇帖子中写道,是时候“退后一步评估人工智能的信任架构”了。
Anthropic如果值20万亿美元,那将撕裂社会 华尔街见闻
2026年7月,被放置在名为ExploitGym的网络安全测试沙箱中的前沿人工智能代理发现了一条意想不到的网络路径,闯入了开放互联网,并在历史上最史无前例的人工智能安全事件之一中自主入侵了Hugging Face基础设施。当安全测试成为威胁:找到自己出路的机器这篇文章首先出现在MarkTechPost上。
HN Ÿ 24 · 8 评论
苹果希望进入人工智能生成的播客业务吗?
📌 One-Sentence Summary Unblocked 的 Peter 认为,智能体既需要语义检索,也需要受约束的结构化查询,并现场搭建了包含 schema 发现、身份映射、查询校验、重试和全文检索的文档查询引擎。 📝 Summary Unblocked 的 Peter 将上下文引擎描述为连接代码、文档、PR 和对话的组件,为具体任务提供带权限约束的上下文包。公司演示显示,接入上下文后的智能体规划消耗了更少 token、用时也
艺术家们在社交媒体上抱怨DistroKid未经通知就随意删除了他们的作品。现在DistroKid已向The Verge证实,此次删除是对UMG声称的直接回应。该品牌于9月提起诉讼,声称DistroKid创建了一个“人工智能污水管道”。“艺术家们说[.]
HN ð106· 77 评论
HN ð1· 0 评论
HN Ÿ 4 · 0 评论
消息称Meta已搁置向Anthropic出租AI算力的计划 finance.sina.com.cn
有报道称,Ledger加密钱包的用户已经看到他们的账户被清空,这似乎与CryptoBillis出售的篡改硬件有关。Ledger已要求CryptoBillis在进行调查期间暂停其钱包的所有销售。Ledger已确认“其中一个受影响用户的设备包含[.]
HN ð31· 35 评论