AI 日报hiw3c.com

人工智能可以设计电路板了吗?

原文标题 · Can AI design circuit boards yet?
Hacker News Top eebench.org 网页快照

以下为 AI 机器翻译(保留原文图片与链接),仅供参考,请以原文为准。

昨天,当OpenAI在其发布帖子的头版上发布了GPT-6 Astra在KiCad中使用电路板的演示时,我们非常兴奋。看到电子产品出现在这样的主要型号发布中真是太酷了。

显然,我们距离要求人工智能在一次提示内构建整部手机还有一段距离。不过,该演示确实提出了一个我们一直在思考的问题:我们如何衡量人工智能生产的电子产品实际上是否好?

模特们对电子学的了解令人惊讶

我们的经验是,当前的模型对电子产品的了解比传统设计工具中的输出往往显示的更多。他们阅读了教科书、数据表、应用笔记和大量代码。

您可以让代理操作图形CAD工具,但它会花费大量时间点击并跟踪屏幕上的内容。它的很多上下文由坐标、菜单和应用程序状态组成。

EeBench使用atopile代替。该电路存在于声明性代码中,因此代理可以直接处理组件、连接和电气约束。它可以在不离开项目的情况下更改设计、构建设计、运行模拟并检查失败的内容。

这对我们来说比要求模型在图形用户界面中画线要好得多。这也意味着基准测试可以花更少的时间测试计算机使用,而花更多的时间测试电子产品。

. ELEC : @STD :: Import { . project &= "electronics" . org &= "atopile" } . Submission : @type { . vin : ELEC :: ElectricPower . vhold : ELEC :: ElectricPower . vhold.lv ~ . vin.lv . c_bank : ELEC :: Capacitor { . capacitance &= 22uF +/- 20% . max_voltage &= 10V .. 25V . temperature_coefficient &= "X5R" . package &= "0805" } . vhold.hv ~> . c_bank ~> . vhold.lv }

现实世界很混乱

公共任务之一是基于住宅电表。当其5 V电源消失时,电路必须使处理器再保持20 ms,以便保存累积的读数。在该窗口期间,受保护的轨必须保持在处理器的3.0 V断电阈值之上。

大多数模型直观地得出正确的基本结论:添加一个电容器。

一个真正的电容器使任务更有趣。一旦有电压通过陶瓷部件,陶瓷部件提供的电容可能比其宣传的电容小得多。增加更多的电容成本更高,占用空间,并使铁路慢充电时,电力恢复。使用标称值工作的设计可能会因到达的部件而失败。

EEBench在仿真中切断输入功率并测量发生的情况。它可以检查整个断电过程中的电压、工作点的有效电容、电源恢复后的恢复情况以及对包装、电介质、额定电压和成本的限制。

电表是最简单的任务之一。在更困难的模拟任务中,代理可能必须在运算放大器周围合成多反馈低通过滤器,求解所需极点的电阻和电容比,并在每个组件被推到最坏情况的容差角后将其收益、截止频率和Q保持在极限内。该工具为这些角重建SPICE甲板,运行AC和瞬时捕获,将测量结果绑定到指定探针,并根据其规格下限和上限记录每个结果。

但正确计算方程只是电子工程的一部分。EeBench使用真实的制造商零件,从其数据表中提取规格并带入SPICE模型中。代理商必须找到一种能够跨越这些公差角的组合,同时还要选择产品现有的、可以订购且价格合理的零件。电气性能、成本和供应之间的权衡更接近于设计真正的硬件,而不是从教科书中挑选理想的值。

这是我们发现最有趣的部分,因为这就是电气工程最终归结为的内容,就像所有其他工程学科一样:权衡。

评分如何进行

EeBench检查是完全确定的。它构建提交的设计,构建电路图和材料清单,并运行一组SPICE模拟和设计检查。每个要求都会产生带有限制的测量结果。

对于电表任务,当输入退出并返回时,安全带测量受保护的铁轨。其他任务测量元件容差角处的收益、阈值、波动、瞬时响应和行为。技术评分与参考材料清单的成本效率相结合。只有当电路正常工作时,成本才会有所帮助。

这类似于为编码代理提供编译器和测试,只是测试测量电压和组件行为。

EeBench V1通过模拟涵盖模拟和数字设计。它还没有告诉我们一个模型是否可以布局、制造和提出一个完整的产品。我们希望稍后添加这些部分。当前的基准集中在需求、设计和验证循环上,因为这是我们可以客观地对有用的工程工作进行评级的地方。完整的方法论和样本结果资源管理器是公开的。

我们在排行榜上看到的是

9月1日的结果令人鼓舞。Claude Opus 5在EeBench V1的13项任务中得分为61.6%。Grok 4.6以57.1%位居第二,仅领先于Claude Fable 5.1(56.4%)。几个月前,我们不会指望模型能做得这么好。

我们特别高兴看到的另一个结果是:xAI将EeBench包含在Grok 4.6模型卡中。它出现在“工程加速”部分,以及3D建模和参数化CAD的评估。经过xhigh推理,他们发布的运行结果显示Grok 4.6为60.0%。看到前沿实验室使用EeBench来描述新模型的工程能力,我们认为这正在成为人们关心的一个类别。

Anthropic的模型在这种环境下一直表现出色。Grok的崛起也很有趣。xAI在Grok 4.6发布帖子中表示,该模型在特定领域环境(包括计算机辅助设计)中接受了高质量的工程数据和RL培训。其EeBench结果符合这一说法。

到目前为止,我们测试过的OpenAI模型更靠后。GPT-5.5得分为42.3%,GPT-5.6 Sol得分为39.4%。我们还没有GPT-6 Astra结果。在看到它在KiCad的板上工作后,我们真的很想了解它如何处理这些电路设计任务。

训练环境

一旦我们拥有了可以对电路进行评分的模拟工具,我们就开始了电子学RL环境。相同的检查可以用作训练后的奖励信号。

失败的运行包含有用的信息。我们可以看到哪个电压未达到极限,哪个工作角出现故障,或者该模型是否通过不必要的昂贵设计解决了问题。这使得训练循环比模型说原理图看起来可信的多。

EeBench是这项工作的小型公众视野。我们还开始直接与前沿实验室合作,这些实验室希望让他们的模型在电子领域表现得更好。如果您从事evals或后培训工作,您可以与我们讨论我们提供的更大的评估套件和模拟支持的培训环境。

那么,它可以设计电路板吗?

对于一组有用的和不断增长的电路问题,我们认为答案已经是肯定的。分数也清楚地表明,还有很多事情要做。OpenAI为Astra的首批演示选择了PCB,xAI在模型卡中发布了EEBench,这两件事都像是同一件事的早期迹象:AI实验室开始认真对待电子产品。

可能很快就会有另一个数据点。埃隆·马斯克(Elon Musk)表示,在对大量SpaceX数据进行额外培训后,Grok 4.7将在几周内推出,目的是使其在工程方面特别擅长。该模型尚未发布,时间表可能会改变,但如果它如所述到达,我们将热衷于将其放在EeBench上。

看起来我们将度过一个有趣的几周。随着模型的改进,我们将继续增加更难的任务,我们期待着看到Astra和下一代的表现。

你可以在今天的Atopile尝试同样的方法。给代理一个你一直想建造的板子,看看它能走多远。

那么,人工智能可以设计电路板了吗?其中一些,是的。我们仍然不会要求它设计起搏器并盲目安装结果。但我们正在去那里的路上。

EeBench由atopile背后的团队建造和资助。我们为公开基准运行付费,不出售基准分数。