JEV只下判断不说话,低延时是被低估的变量:工程AI社群超40人讨论精华

TypeSafe发布只输出判断和置信度的JEV模型后,AI4ELAB邀请建筑AI团队Reer担任主场嘉宾,与建筑师、设计院和制造业从业者讨论它的能力边界、低延时价值,以及在打标、检索、合规检查和AI建模工具中的落点,整理出46条判断。

就在刚刚,9月22日早上,AI4ELAB组织了一场JEV模型的内部研讨。

起因是,前几天,TypeSafe发布首个「System One」模型JEV,不输出文字,只输出带置信度的判断,官方号称比LLM快上百倍、也便宜百倍。在国内外引起一阵讨论的热潮。我们想搞明白JEV模型的本质,带来的长期影响,以及它跟工程AI有哪些值得结合的点。

活动中,我们特别邀请到硅谷知名AI创业团队Reer担任主场嘉宾,CEO Connie以及CTO阿深,分享Reer从Rhino MCP到独立桌面端的产品实践,和对JEV的判断;还有新老朋友,Leo、Vence等国内外建筑师、海外设计院和制造业的从业者也参与了讨论,话题覆盖模型本质、能力边界、产业落点和建模工具走向。

JEV只下判断不说话,低延时是被低估的变量:工程AI社群超40人讨论精华

以下是这场讨论的观点精华整理,代表讨论时的个人判断,不代表任何机构或企业的官方立场。部分表述经过整理和提炼,原始发言者未对本文进行审核确认。

JEV把大模型从「说话」改成了「下判断」

1. JEV的输出单位是「选项+置信度」,它不生成token序列。同样问「营收是否受影响」,LLM要逐字生成一句话,JEV直接给出「受影响,confidence 0.85」这种结构化结果。架构没有公开,但业内普遍猜测它保留了Transformer前端,拿掉了自回归解码,直接从中间层输出判断。

2. JEV针对的是RLHF留下的三个毛病:模式丢失、过度自信和不可靠。人类偏好优化的chat模型会讨好用户,把本来有多种可能的问题收敛成最常见的答案,还会一本正经地说错话。这类输出适合给人看、由人纠错,没法直接交给机器做自动化决策。JEV的定位更多是「给机器看、机器决策」。

3. 两个名字说明了团队的判断。System One出自卡尼曼《思考,快与慢》里的快系统,对应日常大量的直觉判断;JEV取自杰文斯悖论:蒸汽机提高了煤的使用效率,煤的总消耗反而上升了。JEV团队押注的是,智能单价降几个数量级之后,会冒出多几个数量级的新调用需求。

4. 并行是它最直接的地方:问1个问题和问100个问题,耗时差不多。LLM每多一个判断,就要多生成一段token,耗时线性增长;JEV一次性并行输出所有判断。所以它的价值在于「同一份输入下同时回答很多个结构化问题」,成本与效率性能明显。

5. 官方数字要看口径。视频里的说法是输入每十亿token 42美元,也就是每百万token 0.042美元,输出免费;博客对比表里写的是快190多倍、便宜400多倍;社群成员在自己的终端上实测大约快10到200倍。三组数字的对比对象和运行环境都不一样,只能看量级。

6. 「零幻觉」的宣传听听就好。confidence衡量的是模型自己有多确定,不等于答对的概率。但也有观点认为,JEV输出被限制在给定选项之内,至少杜绝了LLM「编一个不存在的链接」这类幻觉。官方Wikipedia跳转赛里,对手LLM就因为编造了页面上并不存在的链接,不得不回退重跑。准确率到底如何,要重新设计实验才能验证。

低延时才是被低估的变量

7. 延时降一个数量级,产品形态会跟着变。早年网速慢,加载一张图片都要等,直播和短视频根本做不起来;带宽问题解决之后,抖音这类原生应用才出现。JEV对AI应用的意义与此类似。现在智能还处在「拨号上网」阶段,很多交互因为太慢太贵,一直没进入可用状态。

8. computer use和browser use是最直接的受益者。网上一大半JEV用例都在操控电脑和浏览器,因为这类任务的瓶颈正好是延时和成本。已经有人把类似模型放在一台Mac上本地运行,用户话音刚落,打开设置、切换页面就执行完了。

9. 做进操作系统之后,它可能成为Siri一直缺的那块「小脑」。这类模型体积小,可以在端侧安全运行,不需要复杂推理,只负责对日常指令做出即时反应。如果手机和电脑内置这一层,很多点击操作和快捷菜单都会消失,交互直接变成「说一句就做完」。

10. 官方的Doom演示是低延时的样板。模型每处理一批问题大约需要100毫秒,每秒能做10次决策,足够追踪敌人、开火和躲避弹道。每一帧游戏状态被结构化成文字,模型回答「现在要不要按住扳机」「最高优先级目标是什么」这类小判断,再组合成下一步动作。官方把这种做法叫做「AI原语的组合」。

11. 但也有观点认为,省下的时间在很多场景里不值钱。给文章打标签,1.5秒和0.1秒的差别不会改变日常工作,用户也不会为这1秒付费。产品层面要找的是「延时降低后体验变好100倍」的环节。那个环节可能很小,比如建模时预判下一步操作,但它能撬动整体体验。

它的能力边界:选项有限,并且能用文字描述

12. JEV本质上是一个可泛化的分类器,只适合解空间有限的问题。开放式问题、没有清晰定义的问题、标签边界模糊的问题,都会让它不可靠。判断一个场景适不适合用JEV,就看输出能不能事先列成一张选项清单。

13. 它目前只接受文字输入,空间智能不在它的scope里。图片、视频和复杂空间都要先结构化成文字才能喂进去。模拟机械臂开关微波炉、抽屉的演示,是把xyz坐标写成文字输入,每次只输出一个移动判断。简单任务能控制,复杂空间关系处理不了。

14. 用「大脑与小脑」来理解它最贴切。大脑负责「这件事做还是不做」这种慢决策;伸手够杯子这种事由小脑下意识完成,不经过推理。JEV对应的是下意识的零延时决策层,在人的系统里,这一层的调用频次远高于深度思考。

15. 具身智能可能是它影响最大的外部行业。现在的VLA模型用视觉语言直接输出机械臂动作,一是太慢,二是在真实环境里不稳定。如果JEV这条「快判断」路径能泛化,VLA可以把高频的底层动作决策交给它,让整条链路走得更远。

16. 放到建筑行业,最先可能用上的是施工现场的机器人。施工场地是有规范、有边界的空间,状态可以完整结构化,适合高频实时纠偏。有建筑师在学校里做过机械臂砌砖,判断是:建筑设计大部分时间在做长链路思考,只有机械臂实时修正这种高频场景,才能把JEV的价值用满。

大厂会很快把它吸收掉

17. 护城河薄,是JEV不公开技术细节的主要原因。如果架构真是「Transformer去掉自回归头」,OpenAI、Anthropic、Google以及国内几家头部厂商复刻起来没有太大壁垒,数据和工程积累也都现成。一旦看到足够多的应用场景,大厂很可能在下一代模型里内置一个类似的子模型。

18. coding agent的自动审批是现成的落点。现在编程智能体都有一个「自动批准agent操作」的开关,这本质上就是一个分类器。把JEV这类模型接进去,就能智能判断哪些操作可以直接放行。大厂在这个场景里已有技术积累,很可能最先跟进。

19. 对大公司来说,它更现实的用途是控制token成本。在agent harness里做一层路由,按prompt把任务分配给最省时、最便宜的模型或agent。美国设计院已经在为AI账单头疼,一个实习生一天就能烧掉几千美元的图像生成token,这层路由能直接省钱。

JEV只下判断不说话,低延时是被低估的变量:工程AI社群超40人讨论精华

先落在打标、检索与合规检查

20. 打标实测:判断越多,JEV的优势越明显。取100篇文章,每篇输入标题和前1000字。只打一个标签时,JEV每篇耗时0.1秒,Sonnet 5低思考档1.5秒;标签增加到20多个维度(栏目、国内外、赛道等)后,JEV仍是0.1秒,Sonnet升到3.7秒。以此前旗舰模型的打标结果为基准,JEV的准确率还略高一点。

21. 置信度可以直接变成工作流里的闸门。实测中置信度在0.9以上的这部分直接放行,低于阈值的转人工复核。前提是输入端的分类规则和判断标准写得完整、边界清楚。同样的机制可以用在文稿质检上,比如检查大模型产出有没有违禁句式、语气是否一致。

22. 项目资料检索很适合用JEV做底层。事务所手里有100个项目,新需求进来时,要快速找出相关的几个项目和对应文件。用LLM逐个过,太慢也太贵;这类模糊检索只需要「相关/不相关」的判断,正好在JEV的能力范围内。

23. CAD命令的auto completion技术上可行。Cursor的成名作是代码自动补全。CAD操作本质上是输入命令,命令集合是有限的,一串连续操作背后有明确意图。模型只要够快,就能在用户发prompt之前预判下一步。现在所有copilot都要等用户发prompt才启动,这等于改变了智能被触发的时机。但也有人怀疑,大家已经习惯指挥agent干活,以后还会不会手动输入命令,本身就是问题。

24. 做compliance check,瓶颈在输入端,模型能力是次要的。标注类检查已经比较好解决,麻烦在于2D图纸上看不到的问题:上下层管道有没有对齐,喷淋头和结构有没有冲突。做QAQC的初创公司,大部分工作量花在图纸自动对齐、构件关联这些输入侧处理上。可行的链路是先用LLM把图纸信息抽成结构化文本,再交给JEV判断,但空间类问题仍然很难靠语言表达。

25. 工厂和制造业的工程场景同样适用。CAD/CAM、结构仿真、快递安检这类场景,和建筑业用的是同一套能力。安全隐患整改单的分级、整改责任人的判定,这类判断题可以交给JEV;前面「现场照片识别出了什么」这一步,仍然要靠视觉模型先把图片转成文字。

MCP不适合CAD这类有状态的软件

26. MCP适合无状态查询,CAD是长期运行的有状态环境。用谷歌地图规划A到B的路线,一万个人问,答案都一样,调一次工具就够了。CAD文件可能一用就是十年,每一步操作都依赖当前模型状态,用通用接口去接,是错配。

27. 在MCP架构下,LLM不知道用户在软件里干了什么。agent要根据用户的操作给出建议或规划,就必须实时感知软件状态,纯MCP很难做到。更具体的问题是:同时打开多个Rhino文件时,每个server对应一个文件,Claude或ChatGPT分不清指令该发给哪一个。

28. 做成产品级agent,就得自己搭integration和harness。有团队从2025年3月开源Rhino MCP起步,折腾半年之后推倒重来,新版本完全不用MCP,从头自建连接层和harness,后来又从插件转型为独立桌面端,同时支持Rhino和Revit。但也有从业者认为,在Revit上用MCP没有那么糟,具体取决于场景和实现方式。

AI建模只做完了一半,剩下的是空间context和项目记忆

29. vibe modeling能解决50%以上的问题,最后10%到12%可能永远解决不了。一次性建模的演示很好看,但实际项目里不存在「建一次甲方就通过」的情况。一进入反复修改,就涉及空间context:「这根柱子离那个东西太近了」「立面弧度再不一样一点」,这些要求在语言层面很难说清楚。

30. 一个简单测试就能暴露语言模型的空间短板。让模型建柱子、建空间都没问题,但如果问它「模型里哪个构件离哪个更近、两者是什么空间关系」,在现有的语言模型和多模态框架下都很吃力。这也是世界模型方向还在不断出现新创业公司的原因。

31. 真正用AI建模并完成产品转化的用户,比例不足30%。建筑师的工作里,建模只是中间媒介:决策要依据模型推敲,再导出图纸、做数据分析。单点提升建模速度,撬动不了整个工作流。

32. 80%以上的工作发生在模型完成之后,一直延续到建成落地。协调、沟通、审批、施工对接,现在都卡在「软件是死的」这件事上:图纸画错了要返回去查,现场对不上要返工,还要派驻场。下一个机会在于让智能以模型为核心媒介,承担协调层和沟通层。

33. 未来十年最值钱的是项目知识和项目智能。一个项目有十来个参与方,甲方、乙方、施工方混在一起,过去没人能统筹。语言模型本身是静态的,不管叫context管理还是记忆层,都记不住十年前做过的项目细节。在这项能力补上之前,项目记忆的积累会越来越稀缺。

临时脚手架会被拆掉,业务沉淀会留下来

34. 模型每升一代,上一代的harness就会被拆掉一批。早期GPT-5、Claude 4.6时代,做web modeling要搭大量脚手架才能跑起来;GPT-6一出,很多问题一下子消失了。已经有建筑师用GPT-6交付了三个小项目并收回了费用。所以真正要问的是:一两年后,哪些工作不会被下一代模型直接覆盖。

35. 能留下来的,是特定业务里积累的workflow、skill和认知。业内已经出现覆盖RFP、设计、场地分析的端到端事务所开源skill。通用能力会被自动化,但做超高层还是做小住宅、在细分domain里摸出来的流程和判断,是模型拿不到的。

36. 最后盖章的仍然是人。AI可以快速审查出哪里有问题,但社会的规则和法制建立在对人的问责之上,审批签字的责任主体短期内不会变。这个结构决定了建筑业里的人不会被整体替代,人的角色会向判断和担责集中。

37. 职业边界扩张的速度,可能快过岗位消失的速度。UX设计是在软件时代从平面设计里长出来的新职业,底子是心理学和以人为本的设计理论。AI时代也会长出新角色。观察到的规律是:主导把AI工具引入企业的人,把建模时间省下来之后,转去跟客户沟通、做更多方案版本、接更多项目,职业晋升也更快。

38. 但也有观点更彻底:只要知识能被完整结构化,人就可以被替代。一位制造业工程师的看法是,行业知识都可以用图结构和向量表征。把知识、判断甚至审美写清楚之后,自己就可以离开这个行业,换下一条赛道,继续提升的应该是审美,不再是coding能力。在他看来,AI首先拓宽的是个人能触达的领域边界,过去要找导师团队才能碰的结构仿真,现在一个人就能做。

39. 「只要我学得够慢,就不用学」,说出了软件技能贬值的现实。这是某建筑AI产品在小红书上收到最多的评论。当熟练使用软件、交付模型都不再是壁垒,时间应该花在哪里就成了每个人要回答的问题。在当前的语言模型范式下,会跟AI沟通协作本身就是一项硬技能。

40. 小团队和一人公司反而能接住没被满足的需求。有人用AI把行业信息做成定向管道:按每个人关注的公司和人物精准推送,并说明推荐理由;还有人读完一批上市公司半年报,做成实时追踪的榜单。这些在过去一个人根本做不了。初期可能没人理,做深了需求就会自己找上门。

智能层不必等BIM 2.0

41. 重做一遍建模软件,可能是AI时代的错误问题。由前Autodesk高管创办的Motif在做「BIM 2.0」,另一些团队走浏览器原生路线。反方观点是:AI写代码、操控软件越来越准、越来越便宜之后,限制就不在软件本身了。到那时要做的是全新的东西,没必要把整套界面和逻辑再实现一遍。

42. 如果软件的使用者大多不再是人,它还算软件吗?编程的演进是参照:从machine code到高级语言,再到用自然语言指挥coding agent,已经没人在意底层是什么语言、什么编译器。用AI写文档时,也没人在意它打开的是哪家的办公软件,人只需要审核输出。建模软件大概率会走同一条路。

43. 智能层应该先打进现有生态,再慢慢独立出来。Revit已经30年了,但它仍然是行业支柱:在建项目在里面,大企业的数据沉淀、插件生态和自定义工具也在里面。直接做agentic native的替代品,首先要追上Revit的水准。Motif上线当天,创始人发文称其为「unfinished project」,本身就说明了这条路有多长。

44. 最终目标是把「操控层」和「输出格式」拆开。智能层做成独立的操控层之后,模型最终是什么format、落在哪个文件、归谁所有,都可以重新定义。这个方向要回答的关键问题是:用户不打开Rhino和Revit的时候,这个产品存在的意义是什么。

45. 国内有一种打法偏向嵌入大平台。腾讯、阿里等办公软件厂商正在抢AI入口,不少创业公司选择把能力嵌进更大的办公生态。两条路的共同点是先低调发育,把AI操控能力握在自己手里、持续积累用户,再根据市场变化长出自己的形态。

46. AI时代的工具更适合交付乐高积木。建筑师这个群体有审美、有创意,也对技术感兴趣。与其给用户一个固定的最终产品,不如交付一个可配置、可以继续往上搭建的foundation,让每个人把自己的工作方式搭成新的工作流。

上,如果觉得不错,随手点个赞、在看、转发三连吧,也欢迎给AI4ELAB个星标⭐,以便您第一时间收到推送~谢谢阅读,下篇内容再见,也欢迎咨询加入AI4E会员社区的众多权益(say-amazing)。
JEV只下判断不说话,低延时是被低估的变量:工程AI社群超40人讨论精华

本文为 AI4ELAB 编辑或原创,作者:Connor 秦明。转载请注明出处:https://ai4elab.com/9174.html

(0)
Connor 秦明的头像Connor 秦明

发表回复

登录后才能评论
联系我们
加入社群