想象一下:你正饱受负面情绪的困扰,在尝试自我调节无果后,终于鼓起勇气走进一间心理治疗室。治疗师看起来温和而专业,你们谈论了童年经历、人际关系和工作压力。你觉得自己被认真倾听,也隐约期待着生活会因此发生一些变化。
可是,几周过去了,你按时赴约,也支付着不低的费用,内心深处的阴霾却似乎并没有真正散去。现实中的治疗效果与预期并不相符,你不禁开始怀疑:我接受的治疗真的有效吗?治疗师真的运用了那些被认为有效的“心理治疗方法”吗?这会不会只是一场昂贵的闲聊?那些听起来专业的技术,比如认知重评、暴露疗法、情绪觉察、行为激活,是否真的出现在治疗过程中?又或者,治疗师是否在不自觉中偏离了既定的治疗方案?

这些疑问并不多余。心理治疗通常发生在私密的咨询室中,外界很难直接观察会谈过程中究竟发生了什么。这在一定程度上类似于医疗实践中的信息不对等:患者也许知道自己的症状有没有缓解,却未必清楚医生为什么作出这样的判断,又为什么选择这种治疗方案。当诊疗过程缺乏充分解释时,患者容易对医生的专业性和整个诊疗过程产生疑虑,甚至感到不安。同样,来访者可能记得自己谈了哪些事情,也能感受到治疗师是否温和、是否愿意倾听,却未必能够判断治疗师是否真正使用了特定的干预技术,或这些技术是否被恰当地实施。督导师、研究者和监管机构也很难仅凭治疗结果判断,治疗是否按照预定方案进行。
正因如此,心理治疗领域需要一种重要的过程质量评估工具:心理治疗忠实度(fidelity)。
所谓心理治疗忠实度,指的是心理治疗在多大程度上按照预定方案实施。
通俗地说,它关心两个问题:治疗师有没有做该做的事,以及做得够不够好。前者通常被称为依从性(adherence),指治疗师是否遵循治疗手册或干预方案,使用了规定的治疗成分,避免使用不合适或被禁止的做法。后者通常被称为胜任力(competence),指治疗师在实施这些技术时是否具备足够的专业水平,能否根据来访者的状态、治疗阶段和具体情境做出合适反应。

忠实度测量的重要性,首先体现在心理治疗研究中。假如一项新疗法从结果上看是有效的,研究者还需要进一步确认,这种效果是否真的来自该疗法所包含的核心机制。例如,症状改善可能与治疗师个人魅力、来访者期待、治疗关系、研究情境或自然恢复有关。若缺乏对治疗过程的忠实度评估,即使研究结果显示疗法有效,研究者也很难判断真正发挥作用的是治疗方案中的关键成分,还是其他与疗法本身无关的因素。相反,如果一项疗法没有取得预期效果,也需要进一步判断问题出在疗法机制本身、治疗师实施不到位,还是研究环境和来访者特征造成了影响。也就是说,忠实度测量帮助研究者回答一个更基础的问题:这种治疗方案到底有没有被真正执行。
忠实度测量同样关系到临床实践质量。心理治疗不像药物治疗那样,可以通过药片剂量、服药时间和用药频次进行相对直接的控制。治疗发生在连续互动中,包含语言、情绪、关系、理解和反馈。治疗师的一句话、一次追问、一次解释,都可能改变来访者对问题的理解,也可能影响治疗关系和后续干预方向。正因为心理治疗过程复杂、细腻,单纯用“是否好转”来评价治疗质量是不充分的。我们还需要更精细地记录和概括治疗过程中发生了什么,例如治疗师使用了哪些技术,技术出现在哪些阶段,是否围绕治疗目标展开,以及实施质量是否符合专业要求。
从这个意义上说,忠实度评估相当于为心理治疗过程提供一种结构化的“摘要”。它不需要还原每一句对话的全部细节,而要尽可能保留与治疗质量有关的关键信息。这样可以帮助督导师了解治疗师的实际工作方式,发现其优势和不足,也能帮助培训机构改进治疗手册和教学内容。换言之,忠实度测量让原本难以观察的治疗过程变得更容易评估,也更方便持续改进。
不过,要测量心理治疗忠实度并不容易。最直接的方法是观察性编码。研究者或评分者会查看治疗录像、录音或逐字稿,按照预先设定的标准判断治疗师使用了哪些技术,使用频率如何,执行质量如何。这种方法被认为是较为可靠的做法,因为它直接基于真实治疗材料。然而,它也非常耗时、耗力。评分者需要接受长期培训,还要保持较高的一致性。一次治疗可能只有一小时,但编码和评分往往需要更长时间。对于常规临床机构来说,这样的评估成本很高,难以长期普及。

因此,心理治疗忠实度测量长期面临着矛盾:越想测得准确,越需要投入大量人工;越想降低成本,测量结果的可靠性就越容易受到影响。高成本和低一致性,成为阻碍忠实度测量普及的重要原因。
大语言模型的优势在于,它可以根据清晰的指令和少量示例完成复杂的语言理解任务。相较于传统机器学习方法,它对大规模专门标注数据的依赖较低,应用范围也可能更广。这为心理治疗忠实度评估提供了一种有吸引力的方向:未来,人工智能或许可以承担部分初步筛查、编码辅助和一致性检查工作,让专业人员把更多精力放在临床督导上。

当然,AI辅助评估并不意味着可以让机器直接替代治疗师或督导师。心理治疗涉及高度敏感的个人信息,也涉及复杂的人际互动和伦理责任。模型可能受到训练数据和输出稳定性的影响,对微妙情境的理解也需要不断验证。因此,更合理的方向是将AI作为辅助工具,用于提高效率、减少重复劳动和提供初步参考,同时保留人类专家在最终判断中的核心作用。
从更长远的角度看,心理治疗忠实度测量反映的是一个更大的问题:心理治疗如何走向更加透明、规范和可信。来访者需要知道自己接受的服务是否有据可依;治疗师需要清楚哪些技术是核心成分,哪些调整属于合理灵活;研究者需要确认疗法在研究中被真正实施;行业也需要建立能够持续改进服务质量的机制。
心理治疗当然需要温度、理解和个体化回应。但温度不能代替专业,经验也需要接受证据的检验。忠实度测量的价值,正在于让治疗过程既保有人与人之间的细腻互动,也能够被科学地记录、评估和改进。