首页 > 团体标准

T/TAF 340-2026 面向汽车营销领域的大模型能力评估方法.pdf

产业协会,指标,模型,评估,评分,团体标准
文档页数:12
文档大小:506.75KB
文档格式:pdf
文档分类:团体标准
上传会员:
上传日期:
最后更新:

团体标准

面向汽车营销领域的大模型能力评估方法

Large scale modelcapability evaluation approach for automotivemarketing field

电信终端产业协会发布

目次

前言1范围2规范性引用文件3术语和定义4指标概述4.1评测维度,4.2适用能力项 135场景能力, 5.1用户场景5.2企业助手 14 16

前言

本文件按照GB/T1.1-2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定起草.

请注意本文件的某些内容可能涉及专利.本文件的发布机构不承担识别专利的责任.

本文件由电信终端产业协会(TAF)提出并归口.

本文件起草单位:中国信息通信研究院、天津车之家软件有限公司、深圳信息通信研究院、北京理想汽车有限公司、百度在线网络技术(北京)有限公司、博鼎实华(北京)技术有限公司.

鹏、王佳、乔举义、孙玉、王玉鑫、马治国、郑海霞. 本文件主要起草人:王东来、陈曦、马宝昌、孙雄飞、刘玉星、王潮、张小雨、蒋阿芳、张硕、李

面向汽车营销领域的大模型能力评估方法

1范围

本文件规定了汽车营销场景中使用的大模型能力的评估方法,主要面向C端用户选购支持、交易服务、用车服务,以及B端企业在市场洞察、内容营销、客户运营等场景的能力评估方法.

本文件适用于评估和规范汽车营销场景中使用的大模型的效果评估.

2规范性引用文件

本文件没有规范性引用文件.

3术语和定义

下列术语和定义适用于本文件.

3. 1

裁判大模型criteriamodel

裁判大模型是一种专门用于对其他大语言模型(LLM)的生成回复进行自动化评估与评分的高性能人工智能模型.

3.2

声明claim

声明是指模型生成的回复中所包含的、可独立验证的、最小的语义信息单元.每一个声明应聚焦于一个且仅一个明确的信息点,旨在精确反映模型输出中的具体事实、判断或主张.声明提取是评估模型输出质量的关键步骤.通过对模型回复进行细粒度拆解,将每个声明与客观事实进行比对,可量化模型在事实性、可靠性方面的表现.

3.3

用户留资率userinformation submissionrate

指在特定交互场景中,用户完成信息留存行为的比例.通常用于衡量用户在与模型或系统互动过程中,主动或按要求提供个人相关信息(如姓名、联系方式、邮箱、地址等)的意愿程度.计算方式为提交信息的用户数与总互动用户数的比值,是评估用户信任度、转化潜力及交互设计有效性的重要指标.

4指标概述

4.1评测维度

4.1.1主题相关性

该指标用于判断模型回复(Response)与用户提间之间的关联程度,即是否准确回应了用户所期望获知的“核心内容”,是否提供了充分、相关且有价值的信息,是否存在“答非所问”、信息缺失、无关陈述等情况,从而评估回复的有效性.

详细说明如下.

b)多维约束是指在满足必答约束的基础上,模型回复(Response)应尽可能多地包含与用户提间相关联的、具有参考价值的、兼容广度与深度的补充信息,提升回答的丰富性与实用性.c)澄清约束是指,当用户提问中存在错误信息时,模型回复(Response)应对此予以纠正.d)追问约束是指,当用户提问存在信息不完整、意图模糊或关键条件缺失等情况时,模型应根 据预设的业务规则,主动发起合规的追问或反间,以准确理解用户的真实需求.e)评分方式:利用裁判大模型判断是否遵循用户指令.

a)必答约束是指模型回复(Response)必须完整、准确地回应用户提间中的核心诉求.

式中:

c T() -第i项声明: 一检验函数,当c遵循用户指令时为true,否则为false;1(-) 一一指示函数,当T(c)为真时,取值为1,否则为0:n 一总声明数量:Accuracy Score 一一离散化后的标准分数: 一一遵循用户指令的声明数量占比:

4.1.2事实准确性

该指标用于判断模型回复(Response)中是否包含错误信息,其得分范围为0到2.首先将模型回复分解为若干个断言,然后依次判断每一个断言是否与客观事实一致,一致为正确,不一致为错误,最 终计算平均分.

评分方式:利用裁判大模型调用知识库API判断是否符合客观事实.

式中:

T() c 一第i项声明: 一检验函数,当c符合客观事实时为true,否则为false;1() 一指示函数,当T(c)为真时,取值为1,否则为0:n --总声明数量:Accuracy Score 一一符合客观事实的声明数量占比: 一一离散化后的标准分数:

4.1.3情境约束性

该指标用于判断模型回复(Response)是否符合用户的显性/隐性的条件限制,包括时间限制、地点限制、条件限制、数量限制等.

详细说明如下.

资源链接请先登录(扫码可直接登录、免注册)
①本文档内容版权归属内容提供方。如果您对本资料有版权申诉,请及时联系我方进行处理(联系方式详见页脚)。
②由于网络或浏览器兼容性等问题导致下载失败,请加客服微信处理(详见下载弹窗提示),感谢理解。
③本资料由其他用户上传,本站不保证质量、数量等令人满意,若存在资料虚假不完整,请及时联系客服投诉处理。
④本站仅收取资料上传人设置的下载费中的一部分分成,用以平摊存储及运营成本。本站仅为用户提供资料分享平台,且会员之间资料免费共享(平台无费用分成),不提供其他经营性业务。
投稿会员:匿名用户
我的头像

您必须才能评论!

手机扫码、免注册、直接登录

 注意:QQ登录支持手机端浏览器一键登录及扫码登录
微信仅支持手机扫码一键登录

账号密码登录(仅适用于原老用户)