大家好,我是秦明,昨天在我们采集系统中,我们关注到,Handoff的创始人兼CEO Dmitry Alexin在领英上的一个帖子,7月24日发的:「当年2019年我们走上这条路、跟别人说我们要自动化施工算量时,所有人都觉得我们是疯子。看来当个疯子还是有回报的」。

我很好奇背后是有什么事件推动,就沿着这条线看了下。
原来三天前,他刚发布了公司自研的算量模型H1,把最强模型claude fable甩开了二十分。这条帖子是回望。

Handoff是家美国公司,我们之前也写过用AI做装修报价,这家团队融资超2千万美元,YC与多家建筑巨头投资。2019年成立,给住宅改造承包商做AI估算。承包商把图纸、照片甚至现场视频传上去,几分钟后拿到一份带报价的估算书和方案,目前全美五十个州有一万多家建造商在用。投资方有欧洲AEC软件巨头Nemetschek,和美国最大的建材消费品集团之一Masco。
7月21日发布H1时,Handoff同时放出了一套自建的算量基准测试,叫TakeoffBench-V1。规则是给模型一套完整的住宅施工图,让它算出各工种的工作范围和材料量,再跟专家核定过的标准答案比对。
TakeoffBench综合分。图:Handoff官方博客
H1拿了81.6分,带算量软件的人类估算师是77.6分,通用模型这边最高的Claude Fable 5是61.4分,往下依次是GPT-5.6的58.6、Claude Opus 4.8的54.6、Kimi K2.6的54.5、Claude Sonnet 4.6的53.9、GLM 5.2的41.6,最后是DeepSeek V4 Pro的34.7。国产三家模型都在这张榜上,位置都靠后。
81.6对77.6,意味着AI在施工算量上第一次压过了手里有专业软件的资深估算师。81.6对61.4,意味着它把当下最强的通用模型甩开了二十分。
看到这个,我第一反应怀疑。这套尺子是Handoff自己造的,他自己拿了第一。放在任何行业,这都值得多问两句。
我继续往下扒了扒,详细看了下。
基准用的是真实住宅施工图,做了脱敏和授权,每套图配一份专家共识核定的答案,覆盖主要工种。评分方式也写在图上:综合分由「覆盖率」和「精确度」加权合成,精确度占的权重更高,为0.6,也就是说宁可漏,不可错。
这两个词各自怎么算,官方一个字都没定义。,博客正文没写。
AI4ELAB是这样解读的:
覆盖率大致是「查全」——一套图纸里该算的工作项和材料项,模型找出来了多少。少算一个门窗五金、漏掉一道内墙的石膏板,扣的是这一项。
精确度大致是「查准」——已经算出来的那些项,数量对不对。墙面积算成142平米而标准答案是138平米,扣的是这一项。
但把他们自己公布的另一张图拆开看,故事就没那么干净了。
分工种得分,带黑框的是该工种第一名。图:Handoff官方博客
81.6是个综合分。按工种拆开,H1赢得最漂亮的是框架(82对71)、石膏板(85对61)、保温(76对62)、屋面(79对69);可外墙板上它只有65分,人类估算师是82分,差了17分;电气81对85、门窗88对89,也都还输着;混凝土72分打平。换句话说,九个工种里人类还领先三个,另有一个持平。「AI超过人类估算师」这句话在总分上成立,落到具体工种就得分着看。

欢迎大家加入我们会员社区,一起链接成长
还有两点也得说。
一是样本太小,Handoff技术博客写的是10套图纸,81.6和77.6之间那4分差距摊在10套图上,能说明的东西相当有限。
二是只测了住宅,商业、公建、工业这些复杂度高一个数量级的场景,一张没测——这对国内读者尤其要紧,真正头疼的算量,多半不在独栋住宅上。
如果分数是真的,那这活到底难在哪儿,为什么偏偏通用大模型啃不动?
Handoff的创始人在播客Bricks & Bytes里给了答案:你把一张施工图丢给地球上最聪明的模型,它能把这张图描述得非常漂亮,然后在「有几扇窗」这种事上数错。读懂一张图,和数清一张图上的东西,是两种能力。
大模型本质上读的是文本,做不了精确测量,而算量恰恰要高精度;它分不清一道墙是内墙还是外墙,判断不了一扇门往左开还是往右开;最要命的是一次只读一页。可施工图是一整套互相引用的语言,A2平面图上的那道墙,做法定义在A8的大样里;损耗系数从来不写在图上,全靠估算师的经验往上加。一个真正的估算师,是把整栋楼同时装在脑子里的。

H1的解法是照着估算师的分工来,每个工种配一个专门的agent,整套PDF一起进,跨图纸关联尺寸和规格,损耗系数自动套。
至于训练数据从哪来,Dmitry的原话是这样的:「一开始我们是自己用手做的。我们自己就是估算师。别人把图纸发给我们,我们给他们做算量。我们的第一批数据集就是这么标出来的——自己收集了几千套施工图纸,手工标注,做成训练数据。」
回头看那句「所有人都觉得我们是疯子」,被当疯子的其实有两层。一层是2019年就说要自动化算量,另一层是为了这个目标,真的去干了几千套图纸手工标注这种笨得不像话的活。不过,从这个月起,AI算量这件事有分数了。
https://www.linkedin.com/feed/update/urn:li:activity:7486074563726819329/
https://handoff.ai/blog/handoff-h1-ai-takeoffs
https://www.ycombinator.com/launches/RdZ-handoff-h1-a-takeoff-model-that-outperforms-human-estimators
https://www.prnewswire.com/news-releases/handoff-launches-h1-the-first-ai-model-for-autonomous-blueprint-takeoffs-302830287.html
https://www.handoff.ai/blog/handoff-raises-5-8m-for-residential-construction

主题测试文章,只做测试使用。发布者:Connor 秦明,转转请注明出处:https://ai4elab.com/8155.html