使用日志服务采集器采集日志时,可能遇到正则解析失败、文件路径不正确、流量超过Shard服务能力等问题。日志服务提供诊断功能,帮助定位采集错误信息。如需实时监控采集器,可使用内置告警监控规则,通过钉钉等渠道接收到告警通知。
前提条件
-
已使用日志服务采集器采集日志。具体操作,请参见持续采集主机文本日志。
-
运行问题诊断
运行诊断包括高级版诊断和基础版诊断:
-
高级版诊断(推荐):提供异常诊断仪表盘,清晰展示采集器相关的异常信息,并且支持更长时间的异常信息查询。
-
基础版诊断:提供最近1小时内的采集异常信息。
适用场景
-
采集器状态异常:心跳失败、进程未运行或SSL证书异常。
-
日志采集异常:日志未采集、延迟过高或解析失败(如正则匹配错误)。
-
配置错误:文件路径不正确、机器组IP不匹配、跨账号权限问题。
-
性能瓶颈:采集速率接近或超过默认限制(如20 MB/s),导致日志丢弃。
-
容器日志采集问题:Pod频繁重启、日志轮转过快导致采集不全。
-
插件与自定义采集问题:自定义插件(如Grok解析)或HTTP数据源采集失败。
-
数据可靠性问题:日志丢失(如LoongCollector未运行或轮转速度过快)。
-
采集配置参数需修改:多行处理条件等日志解析参数无法在采集配置列表页直接编辑,需进入该采集配置的修改流程,在解析日志步骤中调整后保存。
-
单个配置采集多个路径:单个采集配置只支持一组日志路径与文件名匹配规则,不支持在同一配置中填写多个不同路径;如需采集多个路径,需为每个路径分别创建采集配置,并将这些配置应用到同一机器组。
-
通过 API 或 Terraform 创建采集配置时请求体校验失败:调用创建接口返回请求体参数校验错误(如
PostBodyInvalid)时,需检查inputDetail中各字段是否齐全且类型正确,其中localStorage须为布尔类型(true或false)。 -
与其他日志采集软件共存:服务器上同时部署 LoongCollector 与其他采集软件(如 Filebeat)时,出现端口占用、进程冲突或数据重复采集的排查。
-
无法确认日志的采集方式:同一 LogStore 中的日志来源不明,需要区分是由 LoongCollector/Logtail 采集写入,还是由应用通过 SDK 直写;可通过检查服务器上是否存在对应的采集配置,以及应用代码中是否有 SDK 写入逻辑来判断。
-
目标数据类型不在采集范围内:需要确认待采集对象(如应用性能指标、.NET 应用指标)是否属于 LoongCollector 支持的采集类型,避免因采集对象不受支持而误判为采集失败。
-
容器标准输入/标准输出日志未采集:ACK 集群中容器标准输入、标准输出日志采集不生效的排查。
-
通过 SDK 直写时内存积压或写入被限流:应用使用 Java SDK/Producer 直写日志时出现内存持续增长、数据积压或写入被限流,需要结合 LogStore 写入配额与应用侧日志产生速率排查。
操作步骤如下:
-
登录日志服务控制台。在Project列表中,单击目标Project。
-
单击
日志存储,在日志库中,将鼠标悬浮在目标LogStore上,然后单击目标LogStore右侧的
图标。 -
按需要单击高级版诊断或基础版诊断查看诊断信息。
-
查看诊断信息。
基础版诊断
日志采集错误面板中将展示该LogStore所对应的所有LoongCollector采集错误列表。您可以单击目标错误代码,查看错误详情。更多信息,请参见日志服务采集数据常见的错误类型。
高级版诊断
在LoongCollector/Logtail异常监控页面,查看活跃客户端数、全量错误信息等信息。采集异常监控仪表盘的更多信息,请参见查看数据报表。错误码的更多信息,请参见日志服务采集数据常见的错误类型。
-
处理问题完毕后,查看是否仍有报错。历史报错在过期前仍显示,请忽略这部分报错,仅确认在问题处理完毕的时间点之后是否有新的错误。其中LoongCollector上报错误信息的时间间隔为10分钟。
如果您需要查看解析失败而被丢弃的完整日志,可查看LoongCollector运行日志。路径为:
主机场景:在服务器的
/usr/local/ilogtail/loongcollector.LOG文件中。容器场景:在容器的
/usr/local/ilogtail/loongcollector.LOG文件中。
运行状况监控
日志服务提供了内置的告警策略协助实时监控采集器,若有以下监控需求时可进行内置告警策略的配置:
-
采集器心跳异常监控
通过查询
internal-diagnostic_log中__topic__:logtail_status日志,统计LoongCollector心跳正常机器数,并配置告警规则(如心跳数低于预期值时触发告警),用于排查宕机或网络异常的机器 。 -
采集器采集异常告警
执行
__topic__: logtail_alarm查询语句,分析15分钟内各类异常(如文件不可读、权限不足、解析失败)的发生次数,及时发现并修复配置问题,避免日志丢失 。 -
性能瓶颈预警
利用Logtail异常监控仪表盘(展示活跃LoongCollector数、重启列表、全量错误信息等),监控Logtail运行状态及资源使用(如CPU、内存),识别性能瓶颈或异常重启 。
-
中心化日志采集监控
通过LoongCollector文件采集监控仪表盘(展示采集文件数、平均延迟、解析失败率等),统一管理多账号或多地域场景下的日志采集状态,确保采集连续性 。
操作步骤如下:
-
配置行动策略:用于在监控告警状态发生变化时,定义如何发送通知。
-
新建告警规则:用于设置监控规则,当LoongCollector运行状况触发阈值时进行告警。
-
在告警中心页面,单击告警规则,单击新建告警右侧的
。 -
单击从模板新建,在从模板新建面板中,单击全部模板下的Logtail错误监控,在右侧面板中选择目标卡片后单击。
-
在新建告警面板中查看配置,内置告警监控规则已预设参数,请直接单击确定。关于配置参数的说明,请参见创建告警监控规则。
-