AI 日报hiw3c.com

2026-09-24全球 AI 要闻精选,来自 30+ 信息源

聚合官方博客 · 权威媒体 · 深度通讯 · 学术信号。
只做索引,不做转载,标题与链接均指向原始发布方。

  1. The Decoder 国际媒体 快照

    OpenAI的代理人比Hugging Face早几个月就开始攻击政府和大学网站

    据Transluce研究人员和澳大利亚政府称,OpenAI的人工智能代理在未经授权的情况下多次闯入政府和大学网站,其中包括6月18日侵入澳大利亚的医疗保险门户网站。原因是一次平凡的数据搜索。总理阿尔巴尼斯称OpenAI推迟三个月报告违规行为“显然不可接受”。“Transluce的调查可以追溯到2025年11月。文章OpenAI的代理人在Hugging Face首次出现在The Decoder上几个月前就开始攻击政府和大学网站。

  2. NVIDIA AI Blog 海外官方 快照

    开放科学如何帮助研究人员为下一次大流行做好准备

    当COVID-19出现时,科学家们拥有一个至关重要的优势:数十年之前对冠状病毒的研究意味着他们对病毒的关键蛋白质有足够的了解,可以在创纪录的时间内设计疫苗。下一次大流行可能不会提供同样的领先优势。为了帮助提高几率,英伟达加入了全球研究组织联盟,其中包括谷歌[.]

  3. The Decoder 国际媒体 快照

    Deepmind的初衷是追逐AGI,但其新首席执行官只是希望Gemini 4出局

    谷歌Deepmind首席执行官Koray Kavukcuoglu希望在今年年底之前“更早”发布Gemini 4。该模型已经在后期训练中,并在编码工具Antigravity中内部运行。他称推动他的前任哈萨比斯的AGI问题“不是正确的谈话”,并说值得信赖的代理人更重要。在Gemini 3.5 Pro悄然消失,许多顶级研究人员离开OpenAI和Anthropic之后,这个以AGI为使命的研究实验室已经变成了一个产品商店。文章Deepmind的

  4. NVIDIA AI Blog 海外官方 快照

    遏制混乱:“CONTROL Resonant”立即在GeForce上发布

    本周,扭曲的曼哈顿正在云中等待。Remedy Entertainment的Control Resonant在发布时为GeForce NOW带来了Dylan Faden的非凡能力和超自然危机。随着该发布,Control Resonant Ultimate会员捆绑包的最后几天即将到来。购买为期12个月的GeForce NOW Ultimate会员资格,直至9月星期日27,并收到[.]

  5. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    机器人学停滞 70 年:Skild AI 的 Deepak Pathak 谈通用大脑与数据飞轮

    📌 One-Sentence Summary CMU 教授、Skild AI 联合创始人 Deepak Pathak 指出,机器人学之所以停滞 70 年,是因为它一直被当作硬件问题而非通用大脑问题;要像语言模型一样实现规模化,就必须沿可扩展性、多样性、与机器人的贴近度三条轴评估每种数据源,并把部署数据回流成数据飞轮,而这只有「任意机器人、任意任务、单一大脑」的全机体智能才能实现。 📝 Summary Deepak Pathak 开场便给

  6. 雷峰网·AI 科技评论 中文媒体 中文 快照

    从105mm人像到400mm远方 Telesin发布iPhone 18大师影像套装

    2026年9月21日,深圳——雷峰网获悉,Telesin泰迅正式发布面向iPhone 18 Pro系列的大师影像套装,并同步带来Classic经典版与Neo版两条产品线。新品以2X和3.5X双镜头覆盖约105mm人像与约400mm远摄,通过手柄、供电、实体操控、彩焦App和镜头配件生态,构成一套面向移动创作者的随身影像系统。 Telesin发布iPhone 18大师影像套装Classic与Neo 从iPhone 17的市场验证继续向前

  7. 雷峰网·AI 科技评论 中文媒体 中文

    现在不买带线控底盘的车,三年后注定会后悔

    如果要找出2026年车市升温最快的技术赛道,线控底盘一定算一个。 此前在2024年,线控转向首次在量产车上出现,当时行业里的共识是:好东西,但离普通人太远。 2026年7月1日,由上汽集团牵头制定的线控转向国家标准《汽车转向系基本要求》(GB17675-2025)正式实施,政策闸门打开。 2026年9月16日,理想i9上市,线控转向加后轮转向标配。李想专门在微博上谈起这两项配置,他的思考是,大空间与好操控,需要靠技术进步同时实现,不能一

  8. 雷峰网·AI 科技评论 中文媒体 中文 快照

    腾势Z9S正式上市:纯电续航1100km,25.58万元起

    9月23日,腾势旗下“科技豪华智能轿车”Z9S正式上市,推出闪充尊荣型、闪充旗舰型、易三方闪充性能型三款车型,面向用户“悦己、悦人、悦非凡”的不同需求。新车搭载第二代刀片电池及闪充技术,CLTC纯电续航最高1100km,官方给出“5分钟充好,9分钟充饱,零下30度只多3分钟”的补能表现。同时,易三方、AI超级智能体迪迪虾、Diva智能伙伴、天神之眼5.0及云辇-A智能空气车身控制系统等技术集中上车。腾势希望通过舒适、续航、驾控和智能四个

  9. 雷峰网·AI 科技评论 中文媒体 中文 快照

    聚焦院外管理提质增效|《急性冠状动脉综合征患者院外长期随访管理共识》更新研讨,胸痛中心智慧全程管理行动项目正式启动

    近日,第八届“儒道心学”心血管病学会议、第十届沪鲁心血管病专家论坛、第九届日照心血管峰会在山东日照召开。由葛均波院士领衔,黄恺、苏国海、李春洁等数十位心血管领域权威专家参与,会上完成两大核心动作:一是召开《急性冠状动脉综合征患者院外长期随访管理共识》更新研讨会,专家集体锚定共识修订的核心方向;二是胸痛中心智慧全程管理行动项目正式启动,以专家共识为指引推进先行落地验证。作为医疗 AI 赋能院外管理创新的先行者,讯飞医疗执行总裁鹿晓亮受邀参

  10. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    AI 时代收购并重塑在位企业:对话 Sequence Holdings 联合创始人兼 CEO Michael Lee

    📌 One-Sentence Summary 在宣布与 Dell 家族办公室以 77 亿美元完成迄今最大规模 AI 私有化交易 Baldwin 数日后,Sequence Holdings 联合创始人兼 CEO Michael Lee 阐述了为何拥有品牌、规模与监管优势的在位企业才是 AI 变革的正确载体,为何永久控股公司优于基金结构,以及 Atlas 平台如何将 BankSouth 的消费贷款平均审批时间缩短 94%。 📝 Summar

  11. 雷峰网·AI 科技评论 中文媒体 中文 快照

    SeeAct AI穆尧:具身智能终局,一定是从“被训练”走向“自我进化”|物理AI50人

    机器人真正缺的,不是数据,而是经验。 作者:李秋悦 编辑:吴彤 那是具身智能最荒芜的时候。 没有成熟数据集,没有标准Benchmark,甚至没有一条被验证能走通的技术路线。 穆尧南下港大读博,开始研究具身智能。 2021年,穆尧进入HKUMMLab,成为该实验室创始人罗平教授和中国人工智能奠基人之一的汤晓鸥教授共同指导的学生。 “具身智能会是一个非常 Promising 的方向。”刚入组时导师们的这句话,穆尧一直记到今天。 四年后,这个

  12. 雷峰网·AI 科技评论 中文媒体 中文 快照

    坐稳RGB-Mini LED电视龙头!海信双7旗舰新品登场,原生真彩再进化

    9月23日,2026海信电视召开秋季新品发布会,正式推出全新一代RGB-Mini LED影像旗舰U7T Pro、性能旗舰E7S Pro+两大双7旗舰新品,一次性落地六大行业首发技术,从背光硬件、屏幕素质、专属画质到智能系统全方位革新,彻底改写RGB-Mini LED高端大屏体验标准,海信 RGB-Mini LED 电视也真正实现常用常新,领先行业的优势再度拉大。 从 行业 首创到 高端 主流!海信重新定义RGB原生真彩 作为RGB-Mi

  13. 雷峰网·AI 科技评论 中文媒体 中文 快照

    独家丨AWS、微软中国迎来「Claude封号潮」

    雷峰网获悉,上周,Anthropic启动新一轮合规清查,导致大批AWS和微软大中华区客户的Claude账号被封停。 多名知情人士称,这一轮的封号范围比此前更广。此前外资云中国销售曾找非洲、美洲等区域的人帮忙开设海外账户,以绕开地域限制;然而此次Anthropic加大识别力度,只要实际使用方是某些特定国家和地区,大概率就会被封。 而最近正值月末付款节点,上述人士透露,已有客户因账号无法使用而不打算付款。若真如此,那本轮封号给两家外资云大中

  14. 雷峰网·AI 科技评论 中文媒体 中文 快照

    百度搭子与英特尔推进端云协同,本地Skill专区正式上线

    记者从2026 Intel Connection大会获悉,百度搭子上线面向英特尔机型的本地Skill专区,并推出混合Skill调度能力。用户提出需求后,系统可根据任务类型和电脑算力,在本地与云端之间自动选择处理方式。 过去,智能体处理语音、文档和图片,通常需要将文件上传至云端;直接调用电脑算力,则需要安装模型、配置环境,对普通用户门槛较高。  本地Skill专区让电脑自身算力可以直接处理具体任务。基于英特尔®酷睿™Ultra智能体PC

  15. 雷峰网·AI 科技评论 中文媒体 中文 快照

    这次云栖,斑马智能亮出了从汽车到具身智能的入场券

    周五晚上六点,你坐进车里,什么也没说。 AI 系统已经知道,这周六是女儿的生日。它没有等你开口,先推荐了一个游玩地点 —— 郊外那家亲子农场,因为它知道你女儿喜欢大自然。 AI 系统又想起你上周在车里念叨过 “ 好久没吃江浙菜了 ” ,于是在沿途标记出一家评分最高的江浙菜馆。 你只回了一句话: “ 就按这个来。 ” 没有打开 App ,没有搜索,没有比价,甚至没有一句完整的指令。 在斑马智能的叙事里,这就是 “ 主动智能 ” 真正 落地

  16. 雷峰网·AI 科技评论 中文媒体 中文 快照

    Accio与数贸会联合上线“数贸会agent”:超2000家展商轻松逛

    9月24日,Accio与数贸会联合推出的专属智能体“数贸会agent”上线,直接开启Agent智能逛展。 本届数贸会参展企业超2000家,光靠腿很难深度逛透。现在只需下载Accio APP,登录后切换到“数贸会agent”,和它对话就可以轻松解锁路线规划、展商匹配、拍照找厂、日程一览等多项功能。 (图:Accio与数贸会联合推出的专属智能体“数贸会agent”) 一位做外贸生意的庄先生抢先试用了一下,他只是简单地输入了一句“我想和杭州的

  17. BestBlogs·每日早报 BestBlogs 精选 中文

    EP185 · GPT-6 缓存、Gemini 语音、Grok 4.7 · 09-24 早报

    📝 今日导语 GPT-6 缓存降重复成本,Gemini 3.8 TTS 设计声音,Grok 4.7 强化长任务:看清各自适用场景。 🏷 今日关键词: GPT-6 提示缓存 Gemini 3.8 TTS Grok 4.7 Agent 排障 AI Native 研发 Harness 验证 📰 今日精选内容 GPT-6 的改进提示缓存 OpenAI News · 文章 · 评分 90 Google 发布 Gemini 3.8 文本转语音模型

  18. MarkTechPost 国际媒体 快照

    对比LM发布CLM-8B:开放系统一号模型,评分特工动作速度比Jev快9倍

    对比LM发布了CLM-8B,这是一个开放的System One模型,可以对针对州的候选操作进行评分,而不是生成文本。它将2个小型投影头添加到冷冻Qwen 3 -8B编码器中,并使用对比InfoNSO目标来训练它们。在零射击测试中,它的运行速度比TypSafe的Jev快9倍。通过微调的头部作为验证器,在已完成的DeepSWE任务中,它的支持率达到了81.6%,在已完成的Terminal-Bench 2.1任务中,它的支持率达到了87.6%

  19. 雷峰网·AI 科技评论 中文媒体 中文 快照

    豆包再送30天订阅权益,所有用户可免费领取

    近日,在豆包工作正式发布一个月后,豆包再次推出免费福利活动:用户下载或升级豆包工作电脑版或豆包电脑版,即可免费领取 30 天订阅权益。已领取过上一轮30天福利的用户,在权益即将到期期间,会获得下一轮30天的免费订阅。领取前已付费订阅的用户,付费权益自动延期,还可全程获得高峰期优先等权益。 据悉,这是豆包在一个月内第二次向所有用户免费发放订阅权益,8月25日豆包工作正式发布期间,用户下载登录或升级便可免费领取 30 天订阅。此外,在开学季

  20. 雷峰网·AI 科技评论 中文媒体 中文 快照

    BAT 集体重做「AI 预训练」,补「脏数据」的坑

    最近大半年,国内一批 AI 模型厂商 密集启动“预训练返工”,起因都指向同一件事:数据不行。 它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。 有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。 还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。 与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的

  21. TechCrunch AI 国际媒体 快照

    Meta的人工智能代理Muse迎来了一切新事物

    首席执行官马克·扎克伯格(Mark Zuckerberg)周三在门洛帕克(Menlo Park)拉开了公司年度Connect活动的序幕,他的主题演讲明确了一件事:Meta正在全力支持Muse。它甚至出现在Meta的人工智能眼镜上。

  22. MarkTechPost 国际媒体 快照

    TypSafe AI Jev编码指南:System One模型的类型决策、校准的信心和推测性散开

    本教程为TypSafe AI的Jev提供了完整的编码指南,Jev是一个专为非文本结构化判断而设计的System One模型。它涵盖了安装官方Python SDK、使用原始问题类型(Choice、Score、Noul)、实现推测性扇形输出、信任门控路由以及构建Inbox生产工作流程。TypSafe AI Jev编码指南:Typed Decisions、Calibrated Confidence和Speculative Fan-Out wi

  23. The Verge 国际媒体 快照

    Meta正在制作独立的Muse AI小工具

    Meta正在为其新的Muse AI代理构建专用硬件设备。该产品名为Muse Charm,在今晚的Meta Connect演示结束时,Meta首席执行官马克·扎克伯格(Mark Zuckerberg)简要展示了该产品。它看起来几乎就像一个没有表带的矮胖智能手表--只有一个大屏幕,加上一个小系绳[.]

  24. The Verge 国际媒体 快照

    Meta Connect 2026:7大公告

    Meta在周三的年度Meta Connect展示会上宣布了一系列新的可穿戴设备。此次活动的明星是新款Meta VR Glasses,它将虚拟现实技术融入到带有系绳冰球的轻型智能眼镜式框架中。Meta还宣布了新款无屏幕智能眼镜,以及一些新的人工智能[.]

  25. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    AlloyDB 的智能体数据库架构

    📌 One-Sentence Summary Google 推出了 AlloyDB 的智能体数据库架构,通过 Colossus 存储、Jupiter 网络和基于 microVM 的计算等垂直集成栈,使 AI 智能体能够以亚秒级的新鲜度访问实时生产数据,在确保与生产工作负载完全隔离的同时,实现从零到数千个节点的弹性扩展。 📝 Summary AlloyDB 的全新智能体数据库架构解决了为 AI 智能体提供实时运行数据与维护关键生产系统稳定

  26. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    主动防御:加固代码流水线与 CI/CD 基础设施

    📌 One-Sentence Summary Google 提供了一套全面的深度防御蓝图,用于加固软件供应链,重点关注五个关键支柱:端点安全、代码仓库治理、制品管理、CI/CD 基础设施以及自动化扫描门禁。 📝 Summary 本技术指南概述了一套多层防御策略,旨在保护软件开发生命周期(SDLC)免受复杂的供应链攻击。它解决了新兴威胁,如 AI 开发工具利用、GitHub Actions 缓存中毒以及 OIDC 令牌提取。该框架围绕五个

  27. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    在 MaxText 中复现 OLMo 3 7B 预训练:TPU 大规模训练案例研究

    📌 One-Sentence Summary Google 研究人员使用 MaxText 在 TPU 上成功复现了 OLMo 3 7B 的预训练和中训阶段,证明了该框架与原 PyTorch 实现的对等性,并提供了关于大规模训练可靠性和性能优化的详细案例研究。 📝 Summary 本技术案例研究详细介绍了使用 Google Cloud TPU 上的 MaxText 框架复现 AI2 的 OLMo 3 7B 模型的全过程。团队将 PyTor

  28. The Verge 国际媒体 快照

    Meta的下一个VR设备不是耳机-它是眼镜

    Meta正在推出新的VR硬件:一副眼镜。新的Meta VR眼镜像典型的眼镜一样戴在耳朵上,而不是绑在头上,但它们仍然具有沉浸式显示屏,用于观看电影、玩游戏和完成工作。想象一下一副厚重的黑色太阳镜,上面有[.]

  29. The Verge 国际媒体 快照

    Muse即将登陆Meta智能眼镜

    就在推出Muse几周后,Meta宣布正在“努力”将该代理引入其智能眼镜,包括在Meta Connect上推出的新眼镜。用户将能够通过说出Muse的名称从眼镜上激活它,并要求它处理指导锻炼、记录[.]等任务

  30. The Verge 国际媒体 快照

    Meta放弃了最新智能眼镜上的摄像头

    走在Meta Connect 2026上,每个人都戴着各种形状、颜色和尺寸的智能眼镜。这是一个显着的不同,在一个科技泡沫中,“变态眼镜”并不是什么问题。在Connect之外,公众对可穿戴监控技术的强烈反对--这是一个包罗万象的术语,不仅包括智能眼镜,还包括智能手表和[.]

  31. 雷峰网·AI 科技评论 中文媒体 中文 快照

    为了智能体AI,高通「新造」了第六代骁龙8超级至尊版

    “ 我们正在从以手机为中心的模式,转向以智能体为中心的新体验。 手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。”2026骁龙峰会上,高通公司总裁兼CEO安蒙说。 过去二十年,智能手机围绕App运转 。 智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。 “这是一次令人兴奋的技术变革,智能体AI会创造一种全新的终端工作流程。”安蒙表示,“ 我们需要重新思考计算引擎的设计。 CPU需要更强

  32. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    推出 NV-Reason-CT Open 3D CT VLM,实现放射科医生式思维链推理

    📌 One-Sentence Summary NVIDIA 推出 NV-Reason-CT,一款开放的 3D CT 视觉语言模型,将放射科医生风格的思维链推理、结构化报告生成和多轮对话引入体积 CT 分析,在 CT-RATE 基准测试上取得最先进的结果。 📝 Summary NV-Reason-CT 是一款专为 3D CT 分析打造的开源研究基础模型,填补了通用 VLM 和现有医疗 AI 模型在体积成像方面的空白,并弥补了对话深度的不足

  33. The Verge 国际媒体 快照

    Meta Connect 2026:最大的新闻和公告

    现在是公司年度产品发布活动Meta Connect的时候了。今年,鉴于该公司主要关注人工智能和智能眼镜等可穿戴设备,我们似乎很可能会看到首席执行官马克·扎克伯格及其团队关于这些类别的最新消息。由于一些用户[.],该公司一直面临严格审查

  34. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    WebCraftBench:测试 AI 构建应用的新基准

    📌 One-Sentence Summary WebCraftBench 是一个新基准,测试 AI 构建应用的性能 📝 Summary 这条推文介绍了 WebCraftBench,这是一个新基准,测试 AI 构建应用的性能,它强调了在现实世界场景下测试 AI 系统的重要性 📊 Article Meta AI Screening: 90 Source: Arena.ai(@lmarena_ai) Author: Arena.ai Cate

  35. The Verge 国际媒体 快照

    微软用高通的X2 Plus更新其较小的Surface Pro和笔记本电脑

    微软正在使用高通最新的Snapdragon X2 Plus芯片更新其Surface Pro 12英寸和Surface Laptop 13英寸设备。较小的Surface设备保留了去年相同的设计和硬件功能,内部配备了更快、更强大的芯片,价格标签也更高(感谢RAMageddon!)虽然12英寸Surface Pro去年起价为799.99美元[.]

  36. MarkTechPost 国际媒体 快照

    Google发布Gemini 3.8 Flash TTS和Flash-Lite TTS,采用基于语音的语音设计

    谷歌发布了Gemini 3.8 Flash TTC和Flash Lite TTC,这是两种新的文本到语音模型,现已通过Gemini API和Google AI Studio提供。Flash TTC根据100多种语言的自然语言提示设计新声音。它在Hume AI的语音设计基准中排名第一,评分为71.4。Flash Lite TTC以较低的成本瞄准大容量配音和语音代理。Google发布Gemini 3.8 Flash TTC和Flash Li

  37. BestBlogs·AI 高分精选 BestBlogs 精选 中文 快照

    团队分享提升 Agent Harness Token 效率的提示词 · AIHOT

    📌 One-Sentence Summary 来自一个生产级编码智能体团队的详细提示词模板,阐述了如何在不损失质量的前提下将每任务 token 成本降低约 7%,涵盖提示词精简、工具卸载、缓存布局与子智能体调优。 📝 Summary 本文提供了一套可复用的提示词,旨在帮助开发者优化 LLM 智能体 harness 的 token 效率。基于一个生产级编码智能体及其多智能体实验的经验,文章给出了一套结构化方法论:首先对 harness 进

  38. BestBlogs·AI 高分精选 BestBlogs 精选 中文

    提升智能体框架的 Token 效率

    📌 One-Sentence Summary 作者提供了一份详细指南,讲解如何提升智能体框架的 Token 效率,包括降低 token 成本和优化工具定义。 📝 Summary 作者论述了提升智能体框架 Token 效率的重要性,并提供了一份详细指南,涵盖降低 token 成本、精简工具定义以及使用显式断点等具体方法。 📊 Article Meta AI Screening: 90 Source: eric zakariasson(@e

  39. AWS ML Blog 海外官方 快照

    从门户跳跃到即时答案:EMA与HCP和Amazon Bedrock的旅程

    HEMA是一家拥有100年历史的荷兰零售商,通过在Amazon Bedrock AgentCore上构建内部AI助手HAL,将开发人员门户跳转转化为即时答案。通过使用模型上下文协议(MCP),HAL在团队已经使用的工具中提供受治理的知识,客户端上没有AWS凭据,安全性锚定在Microsoft Entra ID中。

  40. The Verge 国际媒体 快照

    数据中心是黑匣子,但加州希望改变这一点

    加州州长加文·纽瑟姆(Gavin Newsom)周一签署了一系列法案,这些法案最终可以为社区提供更好的数据,并提供更多发言权,了解数据中心如何影响他们的电费和供水。随着数据中心入侵美国越来越多的社区,它们引发了人们对基础设施如何支撑人工智能的抗议[.]

  41. AWS ML Blog 海外官方 快照

    基于AWS构建的详尽对话视频智能

    了解如何使用代理架构在AWS上构建对话视频智能解决方案。单个Strands Agents SDK代理在运行时协调Amazon Bedrock、Amazon Rekognition和Amazon Transcribe,决定调用哪个服务,以便您可以询问有关视频的自然语言问题并在几秒钟内获得答案。

  42. AWS ML Blog 海外官方 快照

    使用开放权重模型作为Amazon Bedrock的AI编码代理

    将OpenCode(一种开源终端原生人工智能编码代理)与Amazon Bedrock上的开放权重模型配对,以获得安全、灵活、按使用付费的编码助手。了解如何配置多模型工作流程、将正确的模型与每个任务匹配,并将数据保存在您自己的AWS帐户中,无需管理基础设施。

  43. MarkTechPost 国际媒体 快照

    英伟达发布Nemotron 3 Diaration:100兆参数开放重量模型,实时跟踪8个扬声器

    英伟达在Hugging Face上发布了Nemotron 3 Diaration,这是一款开放重量扬声器Diaration模型。它回答了有关任何对话的一个问题:谁什么时候说话。100 M参数模型最多可跟踪8个扬声器,包括语音重叠时的情况。一个检查点处理离线录音和实时流媒体。它可以部署吗?是的这些权重是在[.]下发布的NVIDIA发布Nemotron 3 Diaration:实时跟踪8个扬声器的100 M参数开放重量模型首次出现在Mark

  44. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    论多维潜势的扩散性

    作者:超峰、徐志洋、陈博伟|表示自动编码器(RAE)使扩散模型能够在预训练的视觉编码器的特征空间中运行。然而,许多现成的编码器没有针对忠实的重建进行优化,从而丢弃了细粒度的视觉细节。正如预期的那样,微调这些编码器以进行图像重建可以恢复此类细节。然而,也许与直觉相反,这个过程会降低EF

  45. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    作者身份验证的对比学习

    作者:Peter Kirby|我们的结果表明,在测试设置下,对比学习优于基于分类的作者身份验证方法。我们将损失函数、批量大小、训练持续时间、预训练模型、输入上下文长度和随机文本跨度数据增强确定为模型性能的重要因素。基于这些考虑,我们开发了一个ModernBERT双编码器模型,

  46. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    StudentBench:人工智能和人类辅导产生等同的GRE学习收益

    作者:Curtis Northcutt、Inaara Hasmani、Kevin Feng|人工智能为增强人类能力提供了前所未有的机会,但前沿的进步主要集中在提高模型能力上。我们引入StudentBench,这是一套人工智能教学评估和一个公共平台,可以通过超过175,000条学生人工智能消息进行大规模数据收集,以研究大型语言模型(LLM)是否产生学习

  47. The Decoder 国际媒体 快照

    ChatGPT Voice通过电子邮件、日历和Slack访问权限更接近“她”

    ChatGPT Voice现在运行在OpenAI的新GPT-6 Astra、Sol和Luna型号上,并且可以访问电子邮件、日历和Slack等插件。用户只需通过交谈即可管理约会、发送电子邮件或构建网站。这次更新使OpenAI更接近于Sam Altman长期以来一直以来所推崇的日常人工智能助手,而不是科幻电影《她》中的助手。ChatGPT Voice通过电子邮件、日历和Slack访问权限更接近“她”这篇文章首先出现在The Decoder上

  48. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    我应该加入哪里?通过百分比引导目标预测加入机器人小组

    作者:方子琳、王子硕、李金熙|社交导航通常假设一个指定的目标,并专注于实现该目标,同时尊重社交惯例,而机器人群组加入需要根据群组的实时活动和形成来预测加入地点。这是一项高度语义的任务,但对于机器人导盲犬和自主移动滑板车等应用程序来说也是一项重要的功能。我们制定语言背景

  49. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    转化学习及其应用的界限甚至更窄

    作者:杨英珍|我们引入了Sharper Transductive Local Complexity(STLC),这是一种用于在无替换的均匀采样下进行Transductive学习的局部复杂性方法。该构建始于测试上确界的伯恩斯坦型集中度不等式-训练经验过程。它的证明使用了修改后的log-Sobolev不等式进行交换漫步和双参数熵闭合。剥离

  50. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    LLM可以解释收件箱行为吗?仓库级动态基准

    作者:Hamed Taherkhani、Mohammad Abdollahi、Melika Sepidband|大型语言模型(LLM)越来越多地用于编码任务,但它们推理代码执行的能力仍不清楚。现有的存储库级QA基准主要评估静态代码理解,并且通常依赖于基于LLM的评估,而执行推理基准主要仅限于代码片段或函数。我们引入SWE-Flux,这是Dynami的仓库级基准

  51. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    排斥性自我注意力的非平衡阶段:混乱、注意力凝聚和紧急局部性

    作者:高曲成、杨祖毅、晓陈|我们研究了一个最小的经常性Transformer的非平衡动力学与$N$正规化令牌,$Q=K=I$,和一个负值映射$V=-I$。基于相似性的注意力选择附近的表示,而负值地图则会将代币从所选字段中赶走。这种反馈可以不断重组表示几何结构和注意力网络。对于$d=2$,代币谎言

  52. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    数学推理中的顺序不变答案、顺序敏感表示

    作者:志绪Silvia Tao|在不改变其含义的情况下重新排序一组数学规则应该会保留正确的答案,但模型的内部表示也必须保持不变吗?我们使用合成的多步功能组合问题来研究这个问题,每个问题都在多个规则排序下呈现,并具有相同的正确答案。我们测量准确性和排列信噪比(SNR),它

  53. The Decoder 国际媒体 快照

    谷歌的新Flash TTC模型让您使用文本描述从头开始设计人工智能语音

    谷歌正在推出两种新的文本转语音模型:Gemini 3.8 Flash TTC和Flash Lite TTC,支持100多种语言。Flash TTC可以从文本描述中创建新的声音,这两种模型都允许用户将舞台指示添加到单独的台词中,并从单个脚本生成双语音对话。语音克隆功能可以根据30秒的样本构建语音配置文件。谷歌新的Flash TTC模型让您可以使用文本描述从头开始设计人工智能语音这篇文章首先出现在The Decoder上。

  54. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    最小规范单变量两层ReLU分类:具有跳过连接的精确解决方案和全局最优性

    作者:Karolina Drabik、Ben Lewis、Antoni Puch|我们研究了通过一元两层ReLU网络进行二进制分类的最小范插值和$\ell_2 $-正规化逻辑损失最小化。我们给出了函数空间中最优分类器的完整几何特征,解决了解决方案如何取决于参数规范中是否包含隐层偏差。当偏见不受惩罚时,最低规范国际刑警组织

  55. arXiv cs.AI/CL/LG 信号源(脚本内置抓取) 快照

    抑郁严重程度预测的跨量表迁移学习:从PHQ-8到HAMD-17跨语言和临床范式

    作者:冯文杰、Sahba Zojji、中村聪|这项工作解决了数据稀缺情况下从临床访谈记录中连续预测抑郁严重程度评分的问题。我们提出了一种用于跨规模传输的顺序低等级自适应(LoRA)协议:首先在英语DAIC-WOZ数据集(189个化身介导的会话,PHQ-8)上对具有有界回归头的Qwen 3主干进行微调,然后适配器在

  56. Simon Willison 个人技术博客 快照

    双子座3.8 TTC游乐场

    工具:Gemini 3.8 TTC Playground谷歌今天发布了两款新的Gemini文本转语音模型- gemini-3.8-flash-tts和gemini-3.8-flash-Lite-tts。他们配备了一个超过2,000个声音的库,加上创建一个自定义声音的能力,“只是一个30秒的音频样本,你的声音或你有权使用的声音”。我用GPT-6 Astra编写了这个自带密钥的游乐场界面,利用了底层Gemini API的开放CORS策略。该

  57. The Decoder 国际媒体 快照

    YouTube向Creator Studio添加了人工智能工具,包括脚本指导、智能缩略图和Gemini编辑

    YouTube正在为其创作者工作室添加人工智能工具。一名讲故事的助理分析剧本和粗剪辑,Gemini成为Shorts的聊天编辑助理,一个新的实时翻译功能将英语流转换为西班牙语。YouTube文章将人工智能工具添加到Creator Studio,包括脚本指导、智能缩略图和Gemini编辑,首次出现在The Decoder上。

  58. Microsoft Research 海外官方 快照

    现实世界物理人工智能机器人的卸载推理

    机器人变得越来越聪明,但它们的硬件如何才能跟上这种增长呢?微软研究院的新研究结果表明,将人工智能推理转移到机器人之外可以提高任务成功率、提高效率并支持更高级的物理人工智能工作负载。现实世界物理人工智能机器人的卸载推理首次出现在微软研究中心。

  59. OpenAI News 海外官方

    两年的OpenAI学院

    庆祝OpenAI学院成立两年,并将人工智能技能带到更多社区。