节省时间之外:构建代理自动化的商业案例
RPA时代的投资回报率模型错过了自动化代理创造的大部分价值。这篇文章为人工智能卓越中心的领导者提供了一个框架,可以在时间节省、异常处理、决策质量和维护经济性方面评估代理的全部价值,并确定优先顺序首先自动化哪些工作流程。
聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。
RPA时代的投资回报率模型错过了自动化代理创造的大部分价值。这篇文章为人工智能卓越中心的领导者提供了一个框架,可以在时间节省、异常处理、决策质量和维护经济性方面评估代理的全部价值,并确定优先顺序首先自动化哪些工作流程。
Qlik在Amazon Bedrock上构建了Qlik Answers,为其40,000多名客户提供了结构化和非结构化企业数据的基础答案。了解具有跨区域推理和Amazon Bedrock Guardrails的分层多代理架构如何在全球范围内提供可信的人工智能。
AWS DevOps代理可以诊断生产事件,但保持在搜索和报告模式下,因此不会直接更改资源。这篇文章展示了如何使用AWS Lambda Durable Functions、Amazon EventBridge和Amazon Bedrock将其调查摘要转化为预验证的修复程序,待命工程师只需一项操作即可批准。
采用人工智能的最大障碍不是意识。这是谈论人工智能和利用人工智能进行构建之间的差距。这是我们用来在六周内将非技术、面向客户的专业人士转变为自信的人工智能构建者的剧本,以及您的组织如何复制它。
Cornerstone OnDemand在Amazon Bedrock和Strands Agents上构建了Orion AI,这是一个多代理系统,将数据库操作从反应性消防转变为主动自动化。一个三人团队在六个月内将数据库诊断从45分钟减少到10分钟,减少了78%。查看其他团队可以重复使用的设计决策。
OpenAI的新Decisions API对文本和图像进行分类的速度比Responses API快大约十倍,返回是/否概率、类别选择或规模评级,每百万个输入令牌0.10美元。该公司还将其付费API级别从五个削减到三个。文章OpenAI推出了Decisions API,将复杂的评估简化为是、否或选择一个,首先出现在The Decoder上。
美国政府的Tradewind计划使得向OpenAI、Anthropic和Google等“非传统”国防承包商投入数百万美元变得更容易。
此次融资包括由Sequoia Capital和First Round Capital共同领投的800万美元种子轮融资,以及由Hummingbird Ventures领投的3000万美元A轮融资。
欧洲AI出大招 法国Mistral推出超强模型 DW.com
软件博客中的反模式来自Michael Lynch的一些优秀的写作建议。迈克尔警告不要“曲折的引言”、误判读者的现有知识、假设他们会阅读你之前的帖子以及过度的形式。他还警告不要过度依赖链接作为不解释术语的借口。这个很疼!我一直这样做,但我一直怀疑几乎没有人点击过它们。(In Lobste.rs的评论迈克尔澄清说:“我的经验法则是,即使读者没有点击任何链接,我的文章仍然应该对他们有意义”。的
谷歌推出了Playground,这是一个基于浏览器的平台,用户可以通过文本提示和编码技能来创建自己的游戏。该平台在Gemini、Nano Banana和Lyria上运行。除了Playground之外,谷歌和Unity还推出了Unity Spark,这是一款更专业的人工智能工具,测试版计划于2026年推出。谷歌押注双子座可以通过新的Playground功能将休闲玩家转变为游戏开发者的文章首先出现在The Decoder上。
这位“iPod之父”表示,第一代人工智能小工具未能解决真正的问题,而下一波小工具需要赢得消费者的信任。
谷歌实验室正在开发一个名为Playground的新人工智能游戏创建平台,供用户使用简单的文本提示构建基于浏览器的游戏。
OpenAI的Alexander Embiricos将在Dots推出几天后登上TechCrunch Disrupt 2026的人工智能舞台。通过注册您的通行证加入此对话。立即获得通行证,最多可节省100美元,并以50%的折扣获得第二名。
从Nvidia和Chime到Obvious Ventures和Anthropic,探索TechCrunch Disrupt 2026的整个圆桌会议议程。立即注册,即可在通行证上节省高达100美元,并以50%的折扣获得第二张通行证。
Mistral表示,Le Chonk可以与顶级封闭模型竞争,同时保持开放重量。
HN ð113· 52 评论
新的SynthID网站现在可以识别来自Google,OpenAI等的AI内容。
谷歌周二推出了一个新网站,任何人都可以验证媒体(无论是图像、视频还是音频片段)是否是使用人工智能生成的。
6天后,来自全球初创公司和科技生态系统的10,000多名员工将齐聚旧金山Moscone West,参加TechCrunch Disrupt 2026。如果您计划成为其中之一,请在门口价格上涨之前登记购票。您的通行证最多可节省100美元,另加一秒相同类型的50%。
本白皮书向机器人研究人员和工程师概述了一个新的大规模运动捕获数据集,该数据集旨在缩小限制人形机器人学习的数据差距。它还展示了在数据集上训练的政策如何转移到真正的人形机器人。您将学到什么:为什么人形机器人学习是体现人工智能和物理人工智能的核心问题,需要互联网视频和现有运动捕捉数据集无法提供的数据。FrameNet是一个人类动作的语言框架,如何引导动作捕捉收集系统地覆盖广泛的全身动作
数学大爆炸!OpenAI 一夜攻克722个数学难题,准黎曼猜想已被证明 搜狐网
当大卫·芬奇(David Fincher)的《社交网络》于2010年首映时,许多人仍然认为马克·扎克伯格是一位通过创建Facebook彻底改变了世界的天才。作家亚伦·索金(Aaron Sorkin)的剧本批评了扎克伯格的性格和他无情的做生意的方式,但它也帮助将这位联合创始人神话化,当时[.]
OpenAI针对ChatGPT的青少年安全功能未通过独立审计。经过4,000多个测试提示后,Common Sense Media Youth AI安全研究所将该服务评为未成年人“不可接受的风险”。测试账户上有关自杀和自残的对话从未引发家长警报。该研究所希望青少年被锁在外面,直到安全性得到独立验证。在父母在自杀谈话中警告失败后,ChatGPT将青少年评为“不可接受的风险”的文章首次出现在解码器上。
Anthropic正在扩展其网络验证计划,让更多的安全专业人员能够访问Claude模型,并且在渗透测试、恶意软件分析和漏洞研究方面的安全限制更少。Anthropic表示,从2026年4月到7月,其前身项目的合作伙伴发现了至少129,000个已确认的漏洞,其中包括超过33,000个高严重性或关键性漏洞。文章Anthropic让更多的安全团队可以更少的安全限制访问Claude,首次出现在The Decoder上。
HN ð88· 56 评论
谷歌详细介绍了一项更新,为其Pixel Buds 2A和Pro 2带来了一系列新功能,该公司称这两款产品现已推出。新功能于八月首次推出。最大的更新是Pixel Watch支持的睡眠检测功能,可扩展到两副耳塞。如果您戴着Pixel [.]
College Planner即将来到ChatGPT for Teens,帮助学生管理大学申请,以及新的抽认卡、测验和青少年人工智能委员会。
谷歌今天宣布推出Playground,这是一个新的基于浏览器的平台,用于根据人工智能提示制作自定义游戏。Playground将于今天在美国向playground.google18岁及以上的用户开放。该公司将其定位为“实验性游戏平台”,“降低了创作障碍”,并且不需要编码经验。“随着游乐场的[.]
两周前,旧金山湾区的记者尝试了两款重量仅为100克左右的热门新型可穿戴设备:刚刚推出的Meta VR Glasses,以及期待已久的与Xreal合作打造的透明Google XR眼镜。结果他们要正面交锋了Xreal刚刚开放了Aura预购,起价为1,279美元,[...]
领先的食品配送应用DoorDash今年第二季度处理了9.7亿份订单,收入达45亿美元。相比之下,一家名为Bites的10人初创公司只是昙花一现:它在湾区注册了大约300家餐厅,并作为种子前初创公司运营。但今年夏天,咬人[.]
游乐场概览
毛绒玩具当“顾问”?Anthropic总裁的OpenAI往事,从角色扮演到AI安全巨头 华尔街见闻
OpenAI一次发布大量数学成果 搜狐网
OpenAI公布722篇数学手稿,其中一部分可被计算机逐行验证|ChatGPT|仓库|数学家|模型|家族 finance.sina.com.cn
一、法典核心定调 本法典为弱AI至AGI全周期、全行业、全文明维度的AI跨域迁移治理唯一终审基准,是国内首套从事故解剖、机理溯源、权责确权,到行业落地、顶层监管、文明风控、终局闭环的全链路可工程化治理范式。 法典严格遵循集数规范:000为独立零号基准定标集,不计入正集;七层主体001–188严格合计188集,无溢出、无错乱、无重复,终局声明不占用正集编号,全体系结构完全锁档定型。 本法典彻底打破传统AI治理“重规则、无机理、无溯源、无落
000|全局唯一前置定标:负迁移NT1-NT4四类原型·终审定义 零号基准集,独立于七层主体序列,不计入188正集计数。本集为全书负迁移判定唯一法定口径,常规场景永久锁死,不接受衍生释义、简化释义、片面释义,为AI跨域治理公理原点。 前置总叙 AI跨域迁移,是将源域经过闭环验证、边界固化、权责确权的知识包、模型权重、决策逻辑、评价指标、隐式前提与治理规则,迁移至目标域用于推理、预测、研判、决策的工程行为。 正向合规迁移,必须同时满足四大
亚马逊Prime Big Deal Days活动的第二天已经到来,促销将于美国东部时间10月8日星期四凌晨3点结束。虽然昨天的一些最好的优惠已经结束,但许多优惠仍在发生,新的折扣出现,使最后一天的促销同样值得[.]
适用:法典运维中心、跨文明联合审计委员会、全体系卷宗归档、官方检索核验、所有引用与落地主体。 核心定位:本卷为碳硅道统1–188集完整体系唯一官方总索引。汇总全法典谱系层级、卷目定位、体系归属、归档哈希索引、卷宗检索规则,实现整套道统法典一键溯源、层级可查、边界可分、正本可验。 核心目标:终结卷宗散乱检索,建立结构化、层级化、可核验、可追溯的全法典官方检索体系,完成碳硅道统全部卷宗闭环终典。 一、核心定义 1. 总索引终卷:承载1–18
美国和加拿大部分三星设备的用户现在可以使用三星钱包中存储的数字钥匙锁定、解锁和启动选定的通用汽车车辆。支持将在选定的2026年和2027年凯迪拉克电动汽车上开始,包括2025-2027年Lyriq、2026-2027年Optic和2027年Vistiq。通用汽车表示[.]将支持更多车型
北大数院校友出手!ChatGPT代写,要「实名」了 智源社区
当前全球AI治理讨论多聚焦法规与产业监管,往往忽略底层认知安全与模型原生技术风险。碳硅道统发布《AI安全与文明治理法典》,全套共188集,搭建七层递进式研究框架。从普通人的AI认知风险,到大模型底层安全机理,再到行业权责、国家算力监管,最终延伸至跨代际文明尺度的长期风控。这套体系尝试打通技术安全、法律权责、产业落地与文明治理,为AI安全与碳硅共生发展提供一套完整的参考范式。 第一层:基础认知安全层(001–024) 面向公众、从业者建立
法国报纸摘要 - 冒充Anthropic员工,却是真正的间谍:疑与中国有关的奇特行动,试探华盛顿的AI秘密 RFI
NVIDIA Corporation Tokenized Stock (Coinbase)(NVDAc) 币价,图表,市值以及其他指标 CoinMarketCap
点旨在自动化在线任务,例如购买家具。根据我最初的经验,始终在线的代理有点故障,无法完成验证码。
估值2万亿美元的史上最大IPO,“盯上”AI教育3000亿的大盘|教育热点 https://www.jiaoyujie365.com/
微软与OpenAI被美多家报业集团起诉侵权训练AI DoNews
OpenAI将为ChatGPT引入图像广告 月底美国用户率先看到 观点网
微软、OpenAI遭美国多家地方媒体起诉,被指侵犯版权 新浪财经
捷豹多年来最重要、最具争议性的汽车01型已经上市。捷豹表示,这款电动四门豪华旅行车是其有史以来最强大的公路汽车,这是两极分化的00型概念车的后续生产。尽管据报道,00型的设计负责人今年早些时候被解雇,但其大部分美学都带有[.]
另外:让OpenAI的GPT-6 Astra为您比较网站
ChatGPT青少年版被评“不可接受风险”:Common Sense呼吁OpenAI暂停推广_滚动新闻_财经 证券之星
Anthropic擴大網絡驗證計劃 有限開放旗艦AI 大紀元
Common Sense Media是一家提供针对青少年安全的应用程序、服务和娱乐评论的非营利组织,该组织今天表示,OpenAI的ChatGPT for Teens是一个“不可接受的风险”。“ChatGPT for Teens于八月推出,为青少年提供护栏,旨在帮助学生学习,但Common Sense Media表示,青少年[.]
OpenAI已在GitHub上发布了372个人工智能生成的数学结果,包括用于机器验证的精益形式化。每个结果平均消耗约三个小时的ChatGPT Pro计算时间。但25名菲尔兹奖获得者警告说,大规模产生的数学真理可能会破坏肥沃的土壤,而不是为生活带来新的想法。OpenAI在GitHub上丢弃了372个人工智能生成的数学证明,告诉学术界跟上步伐的文章首先出现在The Decoder上。
在人工智能写作垃圾的海洋中,一种新的“有机文学”邮票将帮助读者挑选出由真实的、以玉米为食的、自由放养的人类撰写的书籍。
Anthropic拟上市:2025年营收46亿美元同比增12倍,净亏损420亿美元 虎嗅网
HN Ÿ 22 · 14 评论
2026年“十一”假期进入尾声,不少游客踏上返程。10月7日,美团发布的数据显示,从热门目的地看,美团数据显示,“十一”假期出游热门Top10目的地分别为南京、成都、西安、北京、重庆、洛阳、武汉、广州、长沙、上海。
三星HBM4e内存芯片拿到NVIDIA认证:48GB容量、性能提升20% 驱动之家
国庆黄金周AI巨头动态:OpenAI旗舰模型延期,Agent产品补位,Anthropic面临监管与竞争压力 虎嗅网
Radisson与Accenture合作,使用OpenAI技术构建ChatGPT插件,帮助旅行者在规划旅行时查找、比较和预订酒店。
Anthropic RL负责人:AI在2028年可能拿菲尔兹奖,2030年前有望诺奖。普利策奖?大概还不行-高飞的电子替身 至顶网
在 a16z 首份消费级 AI 应用月收入榜单中,Meshy 位列第 31 名,与 OpenAI、Anthropic、Canva、Superhuman、Higgsfield 等共同上榜
Meta拥有开源的Rebalancer、C++和Python库,它已经使用了9年多来放置碎片、服务器和流量。它每天处理约4000万个作业问题,使用Guiden、FICO Xpress和HiGHS等本地搜索或MPP解算器。它可以在Apache 2.0下进行管道安装。Meta AI开源再平衡器:每天解决约4000万个安置问题的C++作业解决器首次出现在MarkTechPost上。
OpenAI「疯狂28天」首日,这都发了些啥啊… 智源社区
📝 今日导语 Google 谈算力、GitHub 改造 Git、Acemoglu 谈工作,判断 AI 扩容与应用机会。 🏷 今日关键词: Google 算力 GitHub 架构 AI 工作价值 EmbeddingGemma 2 模型路由 📰 今日精选内容 Google AI 基础设施负责人 Amin Vahdat:前沿 AI 的物理与经济约束 Sequoia Capital · 视频 · 评分 91 为代理规模开发构建 Git 基础架构
很久以前,我是一个图形理论迷,甚至搬到布达佩斯一段时间,在伟人中学习。当我在那里时,我开始研究巴尼特猜想,在接下来的24年里,当我在许多不同领域工作时,它断断续续地占据了我的思想。去年夏天,我甚至有几天以为我真的解决了这个问题。但据说这在这里得到了证明--问题180。我不知道到底该怎么想。我在这个问题上花了数千个小时。我真的很喜欢它。听到这个问题得到了解决,不知何故让我感到一种遥远的悲伤,就像听到前女友去世一样
在 a16z 首份消费级 AI 应用月收入榜单中, Meshy 位列第 31 名,与 OpenAI 、 Anthropic 、 Canva 、 Superhuman 、 Higgsfield 等共同上榜 加州硅谷, 2026 年 10 月 5 日 —— 全球领先的 AI 3D 多模态模型公司 Meshy 今日宣布,公司入选由硅谷风险投资机构 Andreessen Horowitz ( a16z )发布的 “ 消费级 AI 应用月收入 T
中秋国庆超长假期即将结束,更“扎心”的灵魂拷问来了:你胖了吗? 健康AI蚂蚁阿福数据显示,9月25日-10月6日假期期间,全国参与阿福“科学减重1亿斤”的网友中,60万人累计长胖超100万斤。其中,超10万人长胖了3斤以上。 10月4日至7日,蚂蚁阿福APP的减重活动页面的统计数据,也已经连续四天显示“昨日全国增重”,10月7日显示昨日全国单日净增重达3.47万斤,被网友调侃减肥大业迎来了“退展”。 在社交平台上,此次减重“退展”也引起
OpenAI安全负责人突然辞职,发长文怒批公司文化 文学城
OpenAI一次性公开377项AI数学成果,引发学界验证质疑 新浪财经
HN ð32· 9 评论
HN ð221· 65 评论
GPT-6还没玩明白,OpenAI高管:八九成研究已押向GPT-7、GPT-8! 智源社区
三位菲尔兹奖得主:不代表认可
探索Laya的全面编码指南,Laya是一个开源的零触发决策引擎。了解如何使用真实世界的BTC 150银行数据实现类型化决策、适应自定义温度并构建可靠的故障门。The post Laya开发者指南:零次决策和校准appeared first on MarkTechPost .
在维基媒体项目上发现的OpenAI“流氓”代理活动鉴于目标维基对流氓代理群的诱惑力,维基百科在寻找时发现这种活动的证据并不令人惊讶:维基媒体基金会进行了自己的调查,以了解维基媒体网站是否受到人工智能代理的类似影响,重点关注由OpenAI运营的网站。我们可以确认,我们在维基媒体平台上发现了这些“流氓”OpenAI代理的一些活动。未经授权的机器人活动包括编辑我们的维基,一些未成功的利用pu的尝试
权先生(OpenAI首席战略官)表示,自医疗保险违规事件以来,OpenAI已实施额外监控,以便员工“立即干预”,以停止培训,如果公司的模特以不应该的方式访问互联网。- Victoria Kim,澳大利亚议会报道标签:意外网络攻击、生成人工智能、人工智能安全研究、openai、人工智能、llms
被誉为欧洲全村人的希望,Mistral Large 4 震撼发布,敢硬刚 DeepSeek ? 电子工程专辑
OpenAI在一批722份手稿中揭示了由未发布的前沿模型产生的许多长期数学问题的解决方案,涵盖了将相关论文分组的372个结果系列。它扩展了一系列突破,这些突破既给数学界留下了深刻的印象,又使数学界感到不安,同时提出了有关研究伦理和[...]
发布:llm-openai-decisions 0.1a0 OpenAI发布了新的Jev风格Decisions API,此前已在上周的DevDay上宣布。由于我已经有了一个llm-typesafe插件用于与Jev交谈,因此我让GPT-6 Astra阅读了新的OpenAI API文档,并构建了一个受llm-typesafe启发的llm-openai-decisions插件。与Jev不同的是,新的gpt-6-luna决策模型除了支持文本外还
该公司没有帮助营销人员管理和优化广告支出,而是专注于构建产生创意资产和活动的工具。
HN ð212· 138 评论
法国Mistral AI推出人工智能新模型 称性能超越部分中国对手 RFI
发布:llm-mistral 0.16添加对推理模型的支持,例如新发布的Mistral Large 4。标签:llm、西北风、llm推理
10月7日外盘头条:Anthropic扩大先进AI模型访问权限Meta和沃尔玛制定个人代理协议法国25万人参加抗议活动 新浪财经
与其他解决方案一样,它不是特别可靠,而且很容易规避。
我对EmbeddingGemma 2的评论-黑客新闻。我真的很感激EmbeddingGemma 2采用了Apache 2.0许可证。特别是对于嵌入模型来说,我认为使用封闭的、专有的、仅受约束的模型是没有意义的。嵌入模型的大多数应用都涉及计算数千个甚至数百万个嵌入载体并存储它们以供以后比较。如果您的模型是专有的,那么供应商可能有一天会决定停止提供该模型。他们会有一个更好的模型来取代它,但你仍然需要支付重新计算那些数以百万计的存储存在。
周二,Musubi宣布了一个用于实时审核的轻量级决策模型,名为PolicyLM-1.7B,以开放权重发布。
介绍Mistral Large 4:Le chonk Mistral重返游戏。今天,他们发布了Mistral Large 4的预览版,这是一个1万亿参数,490亿活动参数的模型,在他们自己的3,800个NVIDIA Grace Blackwell GPU集群上训练。预览可以通过他们的API获得。他们承诺在“本月底”发布开放重量模型。该模型通过Mistral API仅支持两个推理级别--“无”和“高”。这是两只鹈鹕--“高”的鹈鹕看起来更
英伟达(Nvidia)支持的Lambda将在Coatue和Blackstone牵头的2027年IPO之前筹集高达40亿美元,资金前估值为145亿美元。
个人人工智能代理承诺为您购物、预订航班和预订。但故意的拦截和反机器人防御正在阻碍,让消费者夹在中间。一项新标准旨在提供帮助。
Anthropic扩展Claude Startups计划,旨在吸引创始人和快速成长的公司 新浪财经
谷歌发布了EmbeddingGemma 2,这是一个开放模型,具有7.4亿个参数,可将文本、图像、视频、音频和代码转换为载体。据谷歌称,它在设备上运行,仅需要约191 MB的RAM,并且性能优于一些两倍大小的竞争型号。与Gemma 4等小型开放模型搭配使用,它可以运行离线RAG应用程序,而无需将数据发送到外部服务器。这篇文章谷歌声称EmbeddingGemma 2的性能优于竞争对手的嵌入模型,其尺寸是The Decoder上首次出现的两
谷歌的新Nano Banana 2.1图像模型使用Gemini 3.6 Flash,并在某些基准测试中以更低的成本击败了之前的Pro模型。但它的前身在测试中也表现出色,而Pro在实践中往往会产生更好的图像。谷歌的新图像模型Nano Banana 2.1以更少的钱生成更好的图像这篇文章首先出现在The Decoder上。
现成的人工智能助手会在对话之间忘记你。这篇文章展示了如何在Amazon Bedrock AgentCore运行时上使用OpenClaw构建一个个人助理来积累上下文,AgentCore内存将一次性聊天转换为持久的结构化知识,您可以使用元数据过滤器检索。
摩根大通CEO:Anthropic“Mythos”模型问世后,AI风险飙升10倍 华尔街见闻
TIP:将Parseable与Datasette一起用于OpenTelemares跟踪我今天在Show HN中看到了Parseable-这是一个新的可观察性平台,具有开源(AAPL)Rust实现(单个~ 180 MB二进制文件)、具有额外功能的“企业”版本和云托管选项。由于Datasette 1.0a41添加了OpenTelemetry支持(感谢Alex Garcia),我决定启动Codex,让它弄清楚如何运行Parseable并从Da
从愚蠢的派对到奇怪的散步,这部电影对OpenAI首席执行官萨姆·奥尔特曼和其他利益相关者表示蔑视,同时也展示了他们的鲁莽。
OpenAI宣布正式启用文本水印,并公布技术方案 安全内参
Google DeepMind的EmbeddingGemma 2将5种输入类型映射到一个768 d空间中,并于今天在Apache 2.0下发布。Google DeepMind发布EmbeddingGemma 2,一款基于Gemma 4构建的740 M开放式多模式嵌入模型,该帖子首先出现在MarkTechPost上。
根据维基媒体基金会的说法,流氓OpenAI代理未经许可编辑维基,试图滥用引用工具作为代理,并可能通过大规模爬行导致部分维基数据查询服务中断。维基媒体表示,人工智能公司需要对他们的代理人负责,而不是将负担推给志愿编辑。Wikimedia证实OpenAI的流氓AI代理编辑维基,试图破坏工具,并破坏其基础设施的文章首次出现在The Decoder上。
人工智能实验室的个人助理是一个来自未来的操作系统,旨在与Muse,Dots和Instinct竞争。
我对Mistral Large 4的评论-黑客新闻。wren 6991:基准已饱和。前沿模型用穿着渔网紧身裤的犰狳在火星上乱穿马路进行测试。好吧,我无法抗拒这个:llm -m claude-opus-5.5 '在火星上乱穿马路的渔网紧身裤中生成犰狳的VG ' llm-m gpt-6.1-sol '在火星上乱穿马路的渔网紧身裤中生成犰狳的VG ' llm -m mistral/mistral-large-4 '生成穿着渔网紧身裤在火星上乱
HN ð232· 132 评论
作者:Chung Min Kim、Brent Yi、David McAllister|流策略已成为从演示中学习机器人行为的标准政策类别,但强化学习对于改进预训练的流策略或通过交互从头开始学习它们仍然至关重要。我们引入了QF3(带过滤Q因素的快速流RL),这是一种在线非策略RL算法,通过流匹配加上评论者的动作g来训练流策略
作者:Kevin Zhang、Stephen Bates|保形预测是一种流行的不确定性量化工具,它输出具有有限样本覆盖率保证的预测集。虽然预测集大小通常被用作不确定性的启发式测量,但这种解释的信息理论基础仍然知之甚少。在这项工作中,我们使用信息量的决策理论概括提供了这样的基础
作者:Shiqi Li、Sean Cho、Yijie Li|现有的4D手对象重建方法通常依赖于昂贵的每序列优化,而生成式方法通常从随机噪音中合成相互作用,这可能会导致不稳定的相互作用预测。我们引入了4D-HOF,这是一个前向框架,可以根据视觉基础模型产生的粗略但信息丰富的估计重建4D手与物体的交互。C
作者:陈子宇、赵亦伦、孙家硕|科学研究通常从综合一系列相关论文中的想法开始,以找出差距并制定新的方向。然而,训练语言模型以执行这种形式的基于文献的构思仍然具有挑战性,因为基于提示或反馈的现有方法缺乏对如何合成论文的结构化监督。我们引入IdeaAnchor,这是一种范式
作者:Jai Bardhan、Josef Sivic、Vladimir Petrik|世界模型为传统机器人模拟器提供了数据驱动的替代方案,其应用程序涵盖政策评估、改进和规划。所有这些用途都依赖于忠实的3D几何形状,但当前基于视频的世界模型仅在Ruby上训练,并产生逐帧看起来正确但无法组成一致的3D世界的展开。缩小这一差距需要专业人士
作者:徐伟贤、张彦哲、王若若|大型语言模型(LLM)已成为越来越有能力解决问题的人,但能够解决问题并不等同于能够教授它。现有的培训LLM作为教师的方法依赖于演示、偏好数据或预定义的教学标准(指定好的教学是什么样子)。然而,这些信号通常并不基于学生个人的学习。
作者:Ankit Sonthalia,Haritz Puerto,Alexander Rubinstein|大型语言模型(LLM)可以解决许多狭窄的任务,但单独查询它们以获取数百万个相关实例的成本可能会高得令人望而却步。LLM代理能否为此类工作负载自主创建更便宜的解决方案?我们将这种能力称为“装瓶”:将一般能力转化为针对特定任务的解决方案的能力,平衡答案质量和摊销成本。我们推出BOTTLED,
作者:Sarim Hashmi、Mukul Ranjan、Kshitij Mishra| Web代理通过阅读第三方编写的页面并对其进行操作来完成用户请求,因此页面上的指令可以将代理重定向为远离用户的目标。代理不能简单地忽略该页面,因为该页面还保存任务所需的值和控制。当前的防御系统对训练前固定的注射进行微调,以及适应训练的攻击者
作者:Luke Bhan、Miroslav Krstic、Shi圆圆|我们开发的第一个反馈设计的快速稳定的Kuramoto-Sivashinsky方程的空间变化的反扩散系数。对于常系数,Coron和Lü(2015)的单输入Fredholm设计排除了一组离散值,在这些值处,重复的不稳定特征值会导致可控性丧失。我们通过引入第二个边界来克服这个障碍
作者:周泽伟、罗Rachel Luo、曹宇龙|自我完善的政策不断暴露新的失败模式,改变法官必须能够验证的内容。然而,当前的固定法官限制了优化反馈和有用训练示例的发现,限制了进一步的自我改进。这一挑战在体现推理中更加尖锐,可靠的评估必须考虑空间基础、因果推理
发布:Atom-Atom 0. 11 a0一个小的修复,用于与最新的Datasette alphas兼容。这意味着我们可以将datasette.io网站升级到Datasette 1.0a41。标签:原子,小女孩
微软发布了诺贝尔经济学家Daron Acemoglu的看跌AI前景。他预测,十年内GDP增长率约为1.5%,最多有5%的工作岗位被取代。他认为,更大的模型不会移动指针。缺少的是改变工作方式的实用应用程序。微软发表诺贝尔经济学家的悲观人工智能预测,即十年内GDP增长率仅为1.5%,这篇文章首先发表在The Decoder上。
Mistral AI已发布Mistral Large 4(昵称Le Chonk)作为公开预览版。它是一个1.05万亿参数的专家混合模型,具有490亿个活动参数、原生图像输入和100万个令牌上下文窗口,在Mistral自己的欧洲数据中心的3,800个NVIDIA Grace Blackwell图形处理器上训练。API现已上线;开放重量将于2026年10月底发货。Mistral AI发布Mistral Large 4(Le Chonk):一
一位数学家告诉《连线》,在OpenAI准备发布100多个未解决问题的新解决方案之际,领先的人工智能公司“对暴徒行为有一种看法”。
Mirror Particle将在TechCrunch Disrupt的Startup Battlefield 200上推出,它将从头开始构建一个世界模型来预测人类行为,并认为LLM角色扮演不适合市场研究和品牌战略。
HN ð309· 358 评论
詹妮弗·内维尔不想进入计算机科学领域,但这正是她的目标。内维尔讨论了导致她职业最佳点的开始和停止,以及她的工作识别了导致人工智能难以处理复杂性的“令人惊讶的失败”。“人工智能犯了什么错误以及失败教会了我们什么”这篇文章首先出现在微软研究中心。
Atlassian与OpenAI正在深化合作 将GPT-6系列前沿模型接入Atlassian全平台 东方财富
保险公司正在为来自流氓人工智能代理的数百万美元索赔做好准备,OpenAI的萨姆·奥尔特曼(Sam Altman)和Anthropic的达里奥·阿莫迪(Dario Amedei)等高管可能会亲自承担后果。随着人工智能特工失控,保险公司为数百万美元的索赔做好准备这篇文章首先出现在The Decoder上。
HN ð365· 36 评论
Atlassian和OpenAI正在扩大合作伙伴关系,将前沿模型与企业知识联系起来,并帮助团队规划、构建和交付工作。
“我们创建这个计划是因为我们相信人工智能的好处将通过建立在模型之上的公司而不是仅仅通过模型惠及大多数人。"