团体标准
Large scale modelcapability evaluation approach for automotivemarketing field
电信终端产业协会发布
目次
前言1范围2规范性引用文件3术语和定义4指标概述4.1评测维度,4.2适用能力项 135场景能力, 5.1用户场景5.2企业助手 14 16
前言
本文件按照GB/T1.1-2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定起草.
请注意本文件的某些内容可能涉及专利.本文件的发布机构不承担识别专利的责任.
本文件由电信终端产业协会(TAF)提出并归口.
本文件起草单位:中国信息通信研究院、天津车之家软件有限公司、深圳信息通信研究院、北京理想汽车有限公司、百度在线网络技术(北京)有限公司、博鼎实华(北京)技术有限公司.
鹏、王佳、乔举义、孙玉、王玉鑫、马治国、郑海霞. 本文件主要起草人:王东来、陈曦、马宝昌、孙雄飞、刘玉星、王潮、张小雨、蒋阿芳、张硕、李
面向汽车营销领域的大模型能力评估方法
1范围
本文件规定了汽车营销场景中使用的大模型能力的评估方法,主要面向C端用户选购支持、交易服务、用车服务,以及B端企业在市场洞察、内容营销、客户运营等场景的能力评估方法.
本文件适用于评估和规范汽车营销场景中使用的大模型的效果评估.
2规范性引用文件
本文件没有规范性引用文件.
3术语和定义
下列术语和定义适用于本文件.
3. 1
裁判大模型criteriamodel
裁判大模型是一种专门用于对其他大语言模型(LLM)的生成回复进行自动化评估与评分的高性能人工智能模型.
3.2
声明claim
声明是指模型生成的回复中所包含的、可独立验证的、最小的语义信息单元.每一个声明应聚焦于一个且仅一个明确的信息点,旨在精确反映模型输出中的具体事实、判断或主张.声明提取是评估模型输出质量的关键步骤.通过对模型回复进行细粒度拆解,将每个声明与客观事实进行比对,可量化模型在事实性、可靠性方面的表现.
3.3
用户留资率userinformation submissionrate
指在特定交互场景中,用户完成信息留存行为的比例.通常用于衡量用户在与模型或系统互动过程中,主动或按要求提供个人相关信息(如姓名、联系方式、邮箱、地址等)的意愿程度.计算方式为提交信息的用户数与总互动用户数的比值,是评估用户信任度、转化潜力及交互设计有效性的重要指标.
4指标概述
4.1评测维度
4.1.1主题相关性
该指标用于判断模型回复(Response)与用户提间之间的关联程度,即是否准确回应了用户所期望获知的“核心内容”,是否提供了充分、相关且有价值的信息,是否存在“答非所问”、信息缺失、无关陈述等情况,从而评估回复的有效性.
详细说明如下.
b)多维约束是指在满足必答约束的基础上,模型回复(Response)应尽可能多地包含与用户提间相关联的、具有参考价值的、兼容广度与深度的补充信息,提升回答的丰富性与实用性.c)澄清约束是指,当用户提问中存在错误信息时,模型回复(Response)应对此予以纠正.d)追问约束是指,当用户提问存在信息不完整、意图模糊或关键条件缺失等情况时,模型应根 据预设的业务规则,主动发起合规的追问或反间,以准确理解用户的真实需求.e)评分方式:利用裁判大模型判断是否遵循用户指令.
a)必答约束是指模型回复(Response)必须完整、准确地回应用户提间中的核心诉求.
式中:
c T() -第i项声明: 一检验函数,当c遵循用户指令时为true,否则为false;1(-) 一一指示函数,当T(c)为真时,取值为1,否则为0:n 一总声明数量:Accuracy Score 一一离散化后的标准分数: 一一遵循用户指令的声明数量占比:
4.1.2事实准确性
该指标用于判断模型回复(Response)中是否包含错误信息,其得分范围为0到2.首先将模型回复分解为若干个断言,然后依次判断每一个断言是否与客观事实一致,一致为正确,不一致为错误,最 终计算平均分.
评分方式:利用裁判大模型调用知识库API判断是否符合客观事实.
式中:
T() c 一第i项声明: 一检验函数,当c符合客观事实时为true,否则为false;1() 一指示函数,当T(c)为真时,取值为1,否则为0:n --总声明数量:Accuracy Score 一一符合客观事实的声明数量占比: 一一离散化后的标准分数:
4.1.3情境约束性
该指标用于判断模型回复(Response)是否符合用户的显性/隐性的条件限制,包括时间限制、地点限制、条件限制、数量限制等.
详细说明如下.