AI 日报hiw3c.com

前OpenAI员工做出不会聊天的AI!刚融8.7亿美元,上线两周老东家就跟了 - 智源社区

Google News AI hub.baai.ac.cn 网页快照

前OpenAI员工做出不会聊天的AI!刚融8.7亿美元,上线两周老东家就跟了

新智元报道

10月9日,TypeSafe AI宣布完成A轮融资,估值直接冲到75亿美元。a16z领投,红杉、DCVC等机构参投。

TypeSafe AI三位联合创始人合影,左起依次是Erik Gafni、Sasha Sheng、Diogo Almeida。

Erik Gafni是连续创业者,曾是Invitae和Freenome的早期员工;Sasha Sheng则曾在Meta/FAIR担任研究工程师。

仅仅两周后,OpenAI就宣布推出Decisions API的有限预览,并在10月6日直接推向公开Beta。

以邮件筛选为例,开发者可以用自然语言写清楚标准:这封信是否涉及即将到期的账单?是否需要本人紧急回复?是否包含时间地点的变动?

Jev读取内容后,会直接向应用返回判断结果和对应概率。软件再按预设规则,自动归类或发出提醒。

Jev直接返回选项或概率,不用生成长篇回答。程序可以直接读取结果,不必再从一大段文字里提取结论。

据TypeSafe介绍,Jev还能并行回答多个问题,并以结构化格式返回结果,供软件直接读取和使用。

9月18日,Vercel披露,Jev接入其AI Gateway后,首个24小时内,就有接近13%的付费团队使用过。

Jev接入Vercel AI Gateway后的首个24小时内,近13%的付费团队使用了它。

据他在LinkedIn上的回忆,他曾琢磨过一个问题:如果AI真的改变了经济,未来大量调用AI的,究竟会是人,还是自动运行的代码?

后来,Almeida与Erik Gafni、Sasha Sheng共同创办TypeSafe。经过两年研发,Jev终于公开亮相。

在Latent Space访谈中,Handa提到,Jev推出后,OpenAI的用户和内部团队纷纷提出需求:他们也需要更快的分类系统。

OpenAI没有从零训练新模型,而是改造现有的GPT-6 Luna:让它直接给出判断结果,同时处理多个问题,再加快后台运算,让第一个结果更快返回。

Jev主打专门的模型与训练方法;OpenAI先把现有Luna模型用起来,将其用于快速判断服务。

开发者可以把商品照片和检查要求一起发给Decisions API,比如判断物品有没有裂痕、撕裂或凹痕。

GPT-6 Luna根据图片作出判断,并返回损坏概率,应用据此筛出需要提醒或人工复核的商品。Jev目前只支持文本输入。

价格方面,Decisions API的基础输入价为每百万token 0.10美元,输出同样免费。

至于OpenAI宣称的「最高快10倍」,比较的是通过自家Responses API调用同一模型时的表现。

他们在37个数据集上测试Jev 1.13.0,完成346,009次请求,总花费不到10美元。

Jev在8个选择题数据集上的选择性预测:只回答最有把握的问题时,准确率更高;回答范围扩大后,准确率整体下降。

测试覆盖了分类、阅读理解、内容审核和评分等任务。不过,这个成本对应的是特定评测,不能直接换算成任何工作都这么便宜。

研究也发现,Jev在选择题上的概率校准表现较好,但处理二元判断时,直接套用固定的0.5阈值,效果并不总是理想。在部分任务上,根据训练数据调整阈值,结果明显改善。

错把广告邮件当成重要通知,可能只是多打扰你一次。漏掉一封当天必须回复的消息,代价就大得多。

计数不够可靠,日期先后比较可能出错,多层推理容易遇到困难。输入里一旦混入大量无关内容,也会影响判断。

Jev适合接手哪些步骤,还需要一项项验证。算术交给普通程序,复杂问题交给更强的模型,重要又拿不准的判断,留给人来复核。

TypeSafe把杰文斯悖论的逻辑写进了AI应用:当调用AI的成本足够低,更多琐碎小事就值得交给AI处理。

邮箱先筛出值得提醒的消息,写作工具先标出需要检查的句子,助手处理简单请求时快速响应,遇到复杂问题再调用更强的模型。

8.7亿美元融资,给了TypeSafe继续研发的资金。OpenAI的快速跟进,也让竞争迅速升温。

接下来,Diogo和TypeSafe需要用实际表现证明:开发者为什么愿意继续选择Jev。

评论列表

评论