Langfuse内置的LLM-as-a-Judge功能支持使用大语言模型自动评估Agent应用的输出质量。本文介绍如何为Langfuse配置公网访问能力、对接自定义模型端点,以及配置自定义模型价格。
背景信息
LLM-as-a-Judge是Langfuse提供的自动化评估功能,通过大语言模型对Agent应用的输入输出进行质量评估(如相关性、准确性等),帮助您持续监控和优化Agent应用的表现。更多信息,请参见Langfuse LLM-as-a-Judge文档。
使用LLM-as-a-Judge功能时,Langfuse需要访问模型API端点。若模型访问端点在公网,需要先配置公网NAT网关,公网NAT网关和弹性公网IP单独计费,计费请参见NAT 网关计费;若模型访问端点在VPC内网且与Langfuse网络连通,则无需配置。
配置公网访问(可选)
若模型API端点在公网(例如使用阿里云百炼的公网API),需要为Langfuse所在VPC配置公网NAT网关,使Langfuse服务能够访问公网。若模型端点在VPC内网且与Langfuse网络连通,可跳过本节。
步骤一:购买公网NAT网关和弹性公网IP
登录VPC控制台,在左侧导航栏选择NAT网关 >公网NAT网关。
单击创建公网NAT网关,选择Langfuse实例所在的地域和VPC。
在弹性公网IP配置中,选择已有的弹性公网IP或创建新的弹性公网IP。
说明弹性公网IP需与Langfuse实例在同一地域。
根据页面提示完成购买。
步骤二:配置SNAT条目
在公网NAT网关实例详情页,单击SNAT管理页签。
单击创建SNAT条目。
配置SNAT条目的粒度。
粒度
适用场景
VPC粒度
整个VPC内的资源均可通过NAT网关访问公网。
交换机粒度
仅指定交换机下的资源可访问公网,需选择Langfuse服务所在的所有交换机。
说明Langfuse服务所在的VPC和交换机信息可从Langfuse实例详情页获取。SNAT条目粒度的详细说明请参见公网 NAT 网关。
选择弹性公网IP,单击确定创建。
配置完成后,Langfuse服务即可访问公网。
配置LLM-as-a-Judge
步骤一:配置模型连接
登录Langfuse控制台,在左侧导航栏选择LLM-as-a-Judge。
单击Create Evaluator。
在弹出页面中,单击Set up配置模型连接。
填写模型连接参数。以阿里云百炼为例:
参数
说明
示例值
LLM adapter
请求格式
选择openai
API Key
模型服务的API Key
从阿里云百炼控制台获取
API Base URL
模型服务的API端点
https://dashscope.aliyuncs.com/compatible-mode/v1Enable default models
是否启用默认模型
选择true
Custom models
模型名称
说明阿里云百炼支持的模型名称请参见选择模型。
qwen3.6-flash单击Create connection。
单击Save保存模型配置。
说明保存时Langfuse会向配置的模型端点进行一次连通性测试,大约需要10~30秒,请耐心等待。若等待时间过长,可能是模型默认开启了深度思考导致响应较慢。可在Default model configuration 弹窗,单击右上角
,在Additional options中填写以下配置关闭深度思考:{ "enable_thinking": false }
步骤二:配置评估器
Langfuse内置了多种默认评估器,您也可以自定义评估器。更多信息,请参见Langfuse LLM-as-a-Judge文档。
以默认的Relevance评估器为例:
选择Relevance评估器。
配置Variable mapping,将模型的输入输出渲染到Prompt中:
{{query}}的Object Field选择Input。{{generation}}的Object Field选择Output。
单击Execute完成评估器配置。
(可选)配置Run on live incoming observations,评估器将持续对新的请求自动执行评估。
配置自定义模型价格
Langfuse内置了常见模型的Token价格信息。对于其他自定义模型,需要根据不同模型供应商自行配置Token价格,以便Langfuse准确计算调用成本。Langfuse自定义模型价格的详细说明请参见Langfuse Token and Cost Tracking文档。
登录Langfuse控制台,在左侧导航栏选择Settings > Model Definitions。
单击Add Model Definition,填写模型名称和Token价格信息。
单击Submit保存配置。