现在,AI 已经渗透到生活的方方面面,很多家长也开始用 AI 给宝宝起名。

这当然无可厚非。AI 有非常广泛的语言和文化知识,能快速理解“清爽一点”“不要太古风”“希望有书卷气”这样的模糊要求;沟通起来也足够流畅、耐心,可以一轮一轮地陪家长修改。

单看这些能力,AI 确实很适合起名。

但作为一个本身就在使用 AI 的起名平台,我们也免不了担心:通用 AI 会不会直接把我们取代?

如果家长只要打开一个大模型,输入宝宝的出生时间和起名偏好,就能得到可靠、完整的名字方案,那圆桌起名这样的专业平台还有多少存在价值?

如果 AI 能力真的足够强,我们被取代,可能也只是时代变化。与其回避,不如先认真测一次,看看它目前到底能做到哪一步。

我们选择的切入点,是宝宝八字的喜用神判断。

先简单解释一下:出生日期和时间可以用来排出四柱八字;喜用神则是在排盘之后,根据四柱结构进一步判断起名可以参考的五行方向。两者不是一回事。

这个环节很适合测试 AI。因为现在不少大模型和起名工具都能很快给出“喜金”“用木”“名字宜补水”之类的结论,而且往往解释得很专业。问题是:这些答案到底稳不稳定?换一个模型还会不会一样?能不能直接拿来决定名字用什么字?

带着这些问题,我们准备了 30 个完整八字,分别交给 Claude、GPT、Gemini、DeepSeek 和 Qwen,让它们独立判断日主强弱、所用方法、主要用神和辅助喜神。

我们想验证的也不是“AI 起名准确率是多少”。因为喜用神目前没有一套已经完成独立人工复核的标准答案,不能简单统计谁对谁错。

我们真正想知道的是:

面对同一批八字,五个主流模型能不能得到稳定、一致、可以直接用于起名的喜用神结论?

实验过程

第一轮,我们让各个模型独立判断。

每个模型只能看到当前八字和必要的命盘信息,看不到其他模型的回答,也不知道其他模型得出了什么结果。我们要求它们分别给出:

  • 日主偏强还是偏弱;
  • 主要采用扶抑、调候、从格还是其他方法;
  • 哪个五行是主要用神;
  • 哪个五行是辅助喜神;
  • 为什么这样判断。
实验设计:30 个八字交给 5 个模型家族,形成 150 次独立判断,再统一客观特征进行四层校验和复测
实验设计:30 个八字交给 5 个模型家族,形成 150 次独立判断,再统一客观特征进行四层校验和复测

*图 1:实验比较的是模型结论是否稳定、一致、可复现,不是计算命理准确率。*

第一轮结果出来后,我们发现问题不只出在最终结论。

有的模型引用了并不存在的干支关系,有的把五行生克方向写反,有的给出的五行与自己的理由互相冲突。还有一些回答虽然读起来很完整,却没有真正回答主用神和辅助喜神分别是什么。

于是我们又做了统一信息后的复测。

这一轮不再让模型自己整理命盘事实,而是给它们同一份客观信息,包括表层五行、藏干、十神、季节、根气,以及可能存在的干支组合。模型只能引用这份信息,五行生克方向也要经过程序校验。

同时,我们把结果拆成四层检查:

  1. 命盘事实和回答结构是否满足要求;
  2. 日主强弱判断是否接近;
  3. 使用的主要方法是否一致;
  4. 最终用神和喜神的主次是否一致。

这四层不是模糊地凭感觉打分。第一层要求五个模型的回答都满足基本事实和结构要求;日主强弱至少要有 4 个模型接近;主要方法至少要有 3 个模型一致;最终用神和喜神的主次至少要有 4 个模型一致,才算通过全部门槛。

这样一来,我们就能分清:模型到底是看错了基础事实,还是面对同样的事实,依然采用了不同的判断方法。

一个典型案例:强弱判断相同,喜用神仍然分成四种

下面是统一协议复测中的一个典型案例。它是丁火日主,出生在夏季,局中火势比较集中。表格展示的是五个模型经过结构校验后的有效回答。

这一次,五个模型对第一层判断并没有明显分歧:它们都认为日主偏旺或极旺。但继续往下判断时,结果很快分开了。

模型日主强弱主要方法主要用神辅助喜神
Claude极旺扶抑
GPT极旺从格
DeepSeek极旺调候
Gemini极旺从格
Qwen极旺从格

这组结果很有代表性。

五个模型都认为“旺”,却选择了三种主要方法,最后给出四种不同的用神和喜神组合。甚至同样采用从格思路的三个模型,主用神也分别选择了火、木和土。

这说明分歧不只来自“有没有排错八字”。即使基础强弱判断相同,后面的分析顺序、取用方法和主次关系仍然可能不同。

这个案例只用于展示分歧发生在哪里,不能据此判断哪个模型正确。

实验结果

结果并不理想。

30 个案例、5 个模型家族,第一轮一共形成了 150 次判断。其中只有 114 次满足基本的结构和事实要求。

这 114 次“有效”,并不代表答案正确,只代表它们至少没有在第一道事实和格式检查中被挡住。

换成案例来看,30 个案例中只有 6 个案例的五份首答全部有效,其余 24 个首先停在事实或结构层。

在剩下的 6 个案例中,又有 3 个因为日主强弱判断没有达到门槛而停止,1 个在最终用神和喜神主次上停止,最后只有 2 个通过了全部四层的一致性门槛。

换句话说,按照本次预先设定的四层检查标准,五个模型在 30 个案例中只有 2 个案例能够全程达成一致,案例级全程一致率只有 6.7%

首轮 30 个案例的分层校验结果:24 个在事实或结构层停止,3 个在强弱层停止,1 个在喜用神主次层停止,2 个通过全部门槛
首轮 30 个案例的分层校验结果:24 个在事实或结构层停止,3 个在强弱层停止,1 个在喜用神主次层停止,2 个通过全部门槛

*图 2:这里的 6.7% 是五个模型通过全部一致性门槛的案例比例,不是命理准确率。*

我们后来允许未通过结构校验的模型重新回答。这样做以后,150 份回答都满足了基本要求,30 个案例中有 8 个通过了全部门槛。

数字看起来提高了,但另一个问题出现了:36 次重新回答中,有 13 次改变了用神和喜神的组合,11 次连主要用神都变了。

36 次重答中实质判断发生改变:13 次改变用神和喜神组合,11 次改变主要用神,2 次改变方法
36 次重答中实质判断发生改变:13 次改变用神和喜神组合,11 次改变主要用神,2 次改变方法

*图 3:同一次重答可能同时改变“主要用神”和“组合”,图中各项可以重叠,不能相加。*

也就是说,让模型“重新整理一下答案”,并不只是改格式。它有可能连自己的核心判断一起推翻。

更值得注意的是,与上一轮实验相比,采用统一客观信息和结构化回答协议以后,各个模型使用的术语确实更接近了,但主要用神的结论并没有变得更一致。

我们比较了上一轮和新协议重试后,10 组模型配对在 30 个案例上的平均一致率:主要方法的一致率从 36.7% 上升到 53.7%,但主要用神的一致率反而从 46.3% 下降到 44.7%。

统一信息前后四个判断维度的模型两两一致率:方法一致率提高,主要用神一致率没有提高
统一信息前后四个判断维度的模型两两一致率:方法一致率提高,主要用神一致率没有提高

*图 4:一致率只衡量两份答案是否相同,不代表相同的答案就是正确答案。*

它们只是更像在用同一种格式和术语回答,并不代表它们更接近同一个喜用神结论。

所以,这次实验可以说“不同模型的案例级全程一致率只有 6.7%”,却不能说“AI 的命理准确率只有 6.7%”。我们没有经过独立人工复核的标准答案,无法据此判断其余 28 个案例都是错的。

对普通家长来说,这个区别并不会让困惑减少多少。当你把同一个八字交给多个模型,得到不同答案并不是偶发现象;问得越多,往往越容易产生新的疑问:为什么 Claude 说用水,GPT 说用火,Gemini 又说用木?我最后到底该听谁的?

至少在喜用神判断上,多问几个 AI,未必更接近答案,反而很可能得到更多相互冲突的解释。

但对于普通家长来说,这次实验已经说明了一件足够重要的事:

如果同一个八字换一个模型、换一种提问方式,主要用神就可能改变,那么这个结论暂时还不适合不经核对,直接拿来决定名字用字。

原因分析

为什么会这样?

问题并不完全是 AI “不知道”,有时恰恰是它接触过的说法太多,却没有一套固定、透明的判断顺序。

四柱、天干地支、藏干和表层五行等,是相对明确的命盘事实。但从这些事实走到喜用神,还要继续判断:

  • 月令、透干和根气分别应该占多大权重;
  • 应该先看日主强弱,还是先处理寒暖燥湿;
  • 什么情况下考虑从格、化气或通关;
  • 主要用神确定以后,辅助喜神应该怎样排序;
  • 五行没有出现,是不是就代表名字一定要补。

不同方法对这些问题的回答并不完全相同。

生成式 AI 可能同时见过扶抑、调候、格局等多种说法。它这一轮采用哪套方法、各项规则怎样加权,往往没有明确写出来。于是即使输入相同,也可能得到不同结果。

还有一个容易被忽略的问题:AI 太会解释了。

哪怕结论不稳定,它也能迅速组织出一段完整、流畅、听起来有理有据的说明。普通用户很容易把“解释得像真的”当成“结论已经被验证”。

美国国家标准与技术研究院的生成式 AI 风险框架也指出,生成式 AI 可能自信地输出错误或前后矛盾的内容,甚至补出貌似合理的逻辑,使人过度相信自动生成的答案。

多找几个模型投票也不能彻底解决问题。

五个模型意见一致,只能证明它们在这个案例上给出了相同答案;如果它们共同使用了同一种简化规则,或者受到相似语料影响,一致也不等于正确。

所以我们这次最大的收获,不是找出了“哪个模型最懂八字”,而是确认了:

提供更完整的事实,可以减少 AI 看错命盘;但要得到稳定的喜用神,还需要一套经过人工复核、能够重复执行的判断规则。

起名工具
AI 起名工具

输入关键信息,可尝试 AI 起名结果。

我们的方案

对圆桌起名来说,这次实验清晰地印证了我们的判断:

全程依靠生成式 AI 起名是不现实的。要提供更好的起名体验,必须把起名老师的判断方法、程序算法的稳定性和 AI 的知识与沟通能力有效组合起来,而不是让任何一方单独包办全流程。

这不意味着圆桌起名要放弃 AI。相反,我们把 AI 放在它更擅长的位置上。

AI 的语言理解、知识覆盖和沟通能力,很适合用来:

  • 理解家长的起名偏好和家庭期待;
  • 把模糊需求整理成清楚的起名方向;
  • 扩展不同风格的名字候选;
  • 分析名字的读音、字义、字形和整体气质;
  • 根据喜欢、不喜欢和避讳要求持续调整;
  • 把复杂信息解释得更容易理解。

这些环节需要的是丰富、灵活和耐心,正是 AI 能明显提升起名体验的地方。

但是,对准确性和一致性要求更高的环节,我们采用另一套方式:

第一,出生时间、四柱排盘、藏干和五行特征等基础信息,由程序化规则计算和校验,尽量避免生成式 AI 自由发挥。

第二,喜用神这类需要稳定方法的判断,由人工建立并复核判断标准和案例,再交给自研的确定性算法执行,并通过人工样本、留出案例和实际运行对照持续验证。

第三,AI 继续负责偏好理解、名字生成、解释比较和多轮沟通,但不再把自己生成的喜用神结论当作未经核验的基础事实。

简单来说,就是:

让 AI 负责丰富,让算法负责稳定,让家庭保留最终选择权。

这并不是要把喜用神包装成能够决定孩子未来的科学结论。它仍然属于传统文化中的起名参考。我们要解决的,是在选定的方法和产品口径下,让基础信息更可复现,让判断过程更一致、也更容易追溯。

给你的建议

如果你正在用 AI 给宝宝起名,不需要因为这次实验就完全放弃它。

它仍然很适合帮助你找灵感、整理偏好、比较名字和继续修改。但涉及喜用神时,建议多做几步检查。

先分清排八字和判喜用神

排出四柱,不等于已经正确判断喜用神。前者偏向历法和规则计算,后者还包含方法选择。

不要只看“五行缺什么”

某种五行没有出现,只能说明一个表面统计结果,不能直接推出名字必须补什么。“缺金补金”“缺水补水”如果没有后续判断依据,只是一种简化规则。

不要用多数票代替核验

不同模型答案冲突时,继续增加模型数量未必能解决问题。先看它们的分歧发生在基础事实、日主强弱、判断方法,还是用神喜神的主次。

不要让喜用神压过名字本身

不管最后参考什么五行,一个名字仍然要好读、好写、含义清楚,避免明显谐音和过高的解释成本,也要符合家庭真正喜欢的方向。

所以,回到标题的问题:用 AI 给宝宝起名,靠谱吗?

我们的答案是:

可以用,而且很好用;但至少在喜用神判断上,目前还不能直接信。

AI 可以给你丰富的知识、耐心的沟通和大量思路。但需要稳定结论的地方,还是应该交给能够验证、复现和追溯的方法。

如果你希望使用 AI 的知识和沟通能力,又不想只得到一批缺少比较、无法继续讨论的名字,不妨考虑一下圆桌起名

圆桌起名是一个结合传统文化与 AI 的全新在线起名平台。它不是让一个通用模型从头说到尾,而是由多个不同专业方向的 AI 起名老师协作:狄思远侧重八字五行,齐文澜侧重诗词音韵,康知夏关注心理感受与日常使用,欧枢元考虑跨文化传播,谷昂星提供自然意象方向,舒卫原核对典籍出处,再由宗老师角色澄清需求、汇总意见并给出取舍建议。

你可以通过聊天说明姓氏、生辰、家庭期待、喜欢的风格和需要避开的字,再根据第一轮名字继续反馈、比较和调整。按照圆桌起名的方案,程序负责基础信息和需要稳定执行的规则,AI 老师负责理解需求、扩展思路和解释差异,最后的选择仍然留给家庭自己。

如果你正准备给宝宝起名,可以先到圆桌起名首页了解这种组合方式是否适合你。

实验数据说明: 本次实验保留了各模型原始输出、结构校验结果、分层统计和复测记录。本文按模型家族称呼测试对象,结论只代表测试当时版本在本次样本和协议下的表现,不代表这些模型今后的所有版本。由于喜用神基准答案尚未完成独立人工复核,所有图表都只用于讨论模型的一致性、稳定性和可复现性,不提供命理准确率结论。