0

0

Java中利用正则表达式从复杂日志字符串提取KEY=VALUE对

聖光之護

聖光之護

发布时间:2025-10-21 08:55:26

|

847人浏览过

|

来源于php中文网

原创

Java中利用正则表达式从复杂日志字符串提取KEY=VALUE对

本文旨在提供一个java解决方案,利用强大的正则表达式从包含多种值类型(包括简单值、双引号字符串和嵌套json结构)的复杂日志字符串中准确提取出所有的key=value对,并将其存储到map中。文章详细解析了核心正则表达式的构成,并提供了完整的java代码实现及使用说明,帮助开发者高效处理非结构化日志数据。

在日常的系统维护和故障排查中,解析日志文件是必不可少的工作。然而,日志数据往往是非结构化的,尤其是当日志条目中包含大量以 KEY=VALUE 形式表示的配置或事件属性时,如何高效、准确地提取这些信息成为一个挑战。传统的字符串分割方法在遇到值中包含空格、引号或嵌套结构时,往往力不从心。本教程将展示如何利用Java的正则表达式功能,解决从复杂日志字符串中提取 KEY=VALUE 对的问题。

挑战与正则表达式的优势

考虑以下日志字符串示例:

String s0 = "DC696,\"/xi/ajax/remoting/call/plaincall/adhocReportBuilderControllerProxy.getRortList.dwr\",\"2222-11-10 08:32:22,351               PLV=REQ CIP=9.9.9.7 CMID=syairp CMN=\"\"Dub Airport Corporation Limited\"\" SN=sfv4_APM180885. DPN=dbPool66HFT01 UID=3862D04108 UN=91F6025D47F01D IUID=1931 LOC=en_GB EID=\"\"EVENT-UNKNOWN-UNKNOWN-ob55abe0118-201110083217-396080\"\" AGN=\"\"[Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/107.0.0.0 Safari/537.36 Edg/107.0.1418.35]\"\" RID=REQ-[7274545]  MTD=POST URL=\"\"/xi/ajax/remoting/call/plaincall/adhocRrtBuilderCoollerProxy.getRtList.dwr\"\" RQT=2835 MID=ADIN PID=ADMIN PQ=ADIN_PAGE SUB=0 MEM=2331036 CPU=2410 UCPU=2300 SCPU=110 FRE=10 FWR=0 NRE=2281 NWR=218 SQLC=43 SQLT=142 RPS=200 SID=60826A3FAB005A8A9B930177C5******.pc6bc1029 GID=e262dde6d0e040070b58afd4c8 HSID=ddc665538db779508d3213c0bb63bcb1c49fe8236d5f0884ae975915728e61 CSL=CRITICAL CCON=0 CSUP=0 CLOC=0 CEXT=0 CREM=0 STK={\"\"n\"\":\"\"/xi/ajax/remoting/call/plaincall/adhocReportBuilderControllerProxy.getrtList.dwr\"\",\"\"i\"\":1,\"\"t\"\":2835,\"\"slft\"\":2679,\"\"sub\"\":[{\"\"n\"\":\"\"SQL:select * from sfv4_HOUA180885.REPORT_DEF WHERE REPORT_DEF_ID IN (SELECT REPORT_DEF_ID FROM sfv4_HA80885.REPORT_DTASET WHERE REPORT_ID=?) AND DELETED=? ORDER BY REPORT_DEF_ID asc NULLS LAST\"\",\"\"i\"\":17,\"\"t\"\":40,\"\"slft\"\":40,\"\"st\"\":337,\"\"m\"\":220958,\"\"nr\"\":154,\"\"rt\"\":0,\"\"rn\"\":22,\"\"fs\"\":0}]}   \",\"2022-11-09T21:32:22.351+0000\",p66cf1029,\"dc606_ss_application\",1,\"/app/tomcat/logs/pef.log\",\"perf_log_yxx\",swsskix13";

其中,键(KEY)和值(VALUE)的格式多种多样:

  • 简单值:PLV=REQ
  • 双引号包裹的值:CMN=""Dub Airport Corporation Limited"" (注意双引号在字符串中表示为 "")
  • 嵌套的JSON-like结构:STK={"n":"...", "sub":[{"n":"SQL:..."}]}

由于值本身可能包含空格、等号,甚至嵌套的括号,简单的 String.split(" ") 无法正确识别键值对的边界。正则表达式则提供了强大的模式匹配能力,能够精确地定义和捕获这些复杂的结构。

立即学习Java免费学习笔记(深入)”;

核心正则表达式解析

我们将使用以下正则表达式来匹配 KEY=VALUE 对:

(\w+)=((?=\\{)(?:(?=.*?\\{(?!.*?\\3)(.*\\}(?!.*\\4).*))(?=.*?\\}(?!.*\\4)(.*)).)+?.*?(?=\\3)[^{]*(?=\\4$)|\"{2}(.*?)\"{2}|(\\S+))

这个正则表达式虽然看起来复杂,但可以分解为以下几个关键部分:

Avatar AI
Avatar AI

AI成像模型,可以从你的照片中生成逼真的4K头像

下载
  1. (\w+): 第1捕获组,用于匹配键(KEY)。\w+ 表示匹配一个或多个字母、数字或下划线。
  2. =: 匹配键和值之间的等号分隔符。
  3. (...): 第2捕获组,用于匹配整个值(VALUE)。这个组内部包含了三种不同的值匹配模式,通过 |(或)操作符连接:
    • (?=\\{)(?:(?=.*?\\{(?!.*?\\3)(.*\\}(?!.*\\4).*))(?=.*?\\}(?!.*\\4)(.*)).)+?.*?(?=\\3)[^{]*(?=\\4$): 这是一个用于匹配嵌套花括号结构(如 STK={...})的复杂模式。它通过前瞻断言 ((?=...)) 来实现对平衡括号的匹配,避免了简单贪婪匹配可能导致的错误。具体来说,它寻找一个以 { 开头并以 } 结尾的字符串,同时确保内部的 { 和 } 能够正确配对。\3 和 \4 是反向引用,用于辅助匹配平衡的括号。
    • *`\"{2}(.?)\"{2}`: 匹配双引号包裹的值**。
      • \"{2}:匹配两个双引号 ""。在Java字符串中," 需要被转义为 \",所以 "" 变成了 \"\"。
      • (.*?):第5捕获组,匹配任意字符(除了换行符)零次或多次,非贪婪模式。这捕获了双引号内的实际内容。
      • \"{2}:再次匹配两个双引号 ""。
    • (\S+): 第6捕获组,匹配简单值。\S+ 表示匹配一个或多个非空白字符。这是最通用的匹配模式,用于捕获那些既不是嵌套结构也不是双引号包裹的简单值。

通过这种组合,正则表达式能够优先匹配最复杂的结构(嵌套花括号),然后是双引号字符串,最后是简单的非空白字符序列,从而确保了值的准确提取。

Java实现

在Java中,我们使用 java.util.regex.Pattern 和 java.util.regex.Matcher 类来应用正则表达式。

import java.util.HashMap;
import java.util.Map;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class LogParser {

    public static void main(String[] args) {
        String logString = "DC696,\"/xi/ajax/remoting/call/plaincall/adhocReportBuilderControllerProxy.getRortList.dwr\",\"2222-11-10 08:32:22,351               PLV=REQ CIP=9.9.9.7 CMID=syairp CMN=\"\"Dub Airport Corporation Limited\"\" SN=sfv4_APM180885. DPN=dbPool66HFT01 UID=3862D04108 UN=91F6025D47F01D IUID=1931 LOC=en_GB EID=\"\"EVENT-UNKNOWN-UNKNOWN-ob55abe0118-201110083217-396080\"\" AGN=\"\"[Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/555.36 (KHTML, like Gecko) Chrome/107.0.0.0 Safari/537.36 Edg/107.0.1418.35]\"\" RID=REQ-[7274545]  MTD=POST URL=\"\"/xi/ajax/remoting/call/plaincall/adhocRrtBuilderCoollerProxy.getRtList.dwr\"\" RQT=2835 MID=ADIN PID=ADMIN PQ=ADIN_PAGE SUB=0 MEM=2331036 CPU=2410 UCPU=2300 SCPU=110 FRE=10 FWR=0 NRE=2281 NWR=218 SQLC=43 SQLT=142 RPS=200 SID=60826A3FAB005A8A9B930177C5******.pc6bc1029 GID=e262dde6d0e040070b58afd4c8 HSID=ddc665538db779508d3213c0bb63bcb1c49fe8236d5f0884ae975915728e61 CSL=CRITICAL CCON=0 CSUP=0 CLOC=0 CEXT=0 CREM=0 STK={\"\"n\"\":\"\"/xi/ajax/remoting/call/plaincall/adhocReportBuilderControllerProxy.getrtList.dwr\"\",\"\"i\"\":1,\"\"t\"\":2835,\"\"slft\"\":2679,\"\"sub\"\":[{\"\"n\"\":\"\"SQL:select * from sfv4_HOUA180885.REPORT_DEF WHERE REPORT_DEF_ID IN (SELECT REPORT_DEF_ID FROM sfv4_HA80885.REPORT_DTASET WHERE REPORT_ID=?) AND DELETED=? ORDER BY REPORT_DEF_ID asc NULLS LAST\"\",\"\"i\"\":17,\"\"t\"\":40,\"\"slft\"\":40,\"\"st\"\":337,\"\"m\"\":220958,\"\"nr\"\":154,\"\"rt\"\":0,\"\"rn\"\":22,\"\"fs\"\":0}]}   \",\"2022-11-09T21:32:22.351+0000\",p66cf1029,\"dc606_ss_application\",1,\"/app/tomcat/logs/pef.log\",\"perf_log_yxx\",swsskix13";

        // 注意:Java字符串中的反斜杠需要双重转义,所以 \\{ 变为 \\\\{
        // 原始正则表达式:(\w+)=((?=\\{)(?:(?=.*?\\{(?!.*?\\3)(.*\\}(?!.*\\4).*))(?=.*?\\}(?!.*\\4)(.*)).)+?.*?(?=\\3)[^{]*(?=\\4$)|\"{2}(.*?)\"{2}|(\\S+))
        String regex = "(\\w+)=((?=\\\\{)(?:(?=.*?\\\\{(?!.*?\\3)(.*\\\\}(?!.*\\4).*))(?=.*?\\\\}(?!.*\\4)(.*)).)+?.*?(?=\\3)[^{]*(?=\\4$)|\\\"{2}(.*?)\\\"{2}|(\\S+))";

        Pattern p = Pattern.compile(regex);
        Matcher m = p.matcher(logString);

        Map result = new HashMap<>();

        while (m.find()) {
            String key = m.group(1); // 键在第1捕获组
            String value;

            // 根据哪个捕获组匹配到了值来确定最终的值
            if (m.group(5) != null) { // 如果是双引号包裹的值
                value = m.group(5);
            } else if (m.group(6) != null) { // 如果是简单值
                value = m.group(6);
            } else { // 否则是嵌套花括号结构,其完整内容在第2捕获组
                value = m.group(2);
            }

            result.put(key, value);
            System.out.println(key + " => " + value);
            System.out.println("----");
        }

        // 打印最终的Map
        // System.out.println("\nExtracted Map: " + result);
    }
}

代码说明:

  1. Pattern.compile(regex): 编译正则表达式,提高匹配效率。
  2. Matcher m = p.matcher(logString): 创建 Matcher 对象,用于在目标字符串中执行匹配操作。
  3. while (m.find()): 循环查找所有匹配项。每次调用 find() 都会尝试在当前位置之后查找下一个匹配序列。
  4. m.group(1): 获取第1捕获组的内容,即键。
  5. m.group(5), m.group(6): 分别获取第5捕获组(双引号内的值)和第6捕获组(简单值)的内容。
  6. m.group(2): 获取第2捕获组的内容,即整个值(特别是针对嵌套花括号结构,因为其内部没有独立的子捕获组)。
  7. 值提取逻辑: 由于正则表达式中使用了 | 运算符,不同的值类型会被捕获到不同的组中。代码通过检查 m.group(5) 和 m.group(6) 是否为 null 来判断哪种类型的值被匹配到,并优先使用更具体的匹配(双引号或简单值),否则使用包含整个复杂值的第2组。

示例输出

运行上述Java代码,将得到以下键值对的输出:

PLV => REQ
----
CIP => 9.9.9.7
----
CMID => syairp
----
CMN => Dub Airport Corporation Limited
----
SN => sfv4_APM180885.
----
DPN => dbPool66HFT01
----
UID => 3862D04108
----
UN => 91F6025D47F01D
----
IUID => 1931
----
LOC => en_GB
----
EID => EVENT-UNKNOWN-UNKNOWN-ob55abe0118-201110083217-396080
----
AGN => [Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/555.36 (KHTML, like Gecko) Chrome/107.0.0.0 Safari/537.36 Edg/107.0.1418.35]
----
RID => REQ-[7274545]
----
MTD => POST
----
URL => /xi/ajax/remoting/call/plaincall/adhocRrtBuilderCoollerProxy.getRtList.dwr
----
RQT => 2835
----
MID => ADIN
----
PID => ADMIN
----
PQ => ADIN_PAGE
----
SUB => 0
----
MEM => 2331036
----
CPU => 2410
----
UCPU => 2300
----
SCPU => 110
----
FRE => 10
----
FWR => 0
----
NRE => 2281
----
NWR => 218
----
SQLC => 43
----
SQLT => 142
----
RPS => 200
----
SID => 60826A3FAB005A8A9B930177C5******.pc6bc1029
----
GID => e262dde6d0e040070b58afd4c8
----
HSID => ddc665538db779508d3213c0bb63bcb1c49fe8236d5f0884ae975915728e61
----
CSL => CRITICAL
----
CCON => 0
----
CSUP => 0
----
CLOC => 0
----
CEXT => 0
----
CREM => 0
----
STK => {""n"":""/xi/ajax/remoting/call/plaincall/adhocReportBuilderControllerProxy.getrtList.dwr"",""i"":1,""t"":2835,""slft"":2679,""sub"":[{""n"":""SQL:select * from sfv4_HOUA180885.REPORT_DEF WHERE REPORT_DEF_ID IN (SELECT REPORT_DEF_ID FROM sfv4_HA80885.REPORT_DTASET WHERE REPORT_ID=?) AND DELETED=? ORDER BY REPORT_DEF_ID asc NULLS LAST"",""i"":17,""t"":40,""slft"":40,""st"":"337,""m"":220958,""nr"":154,""rt"":0,""rn"":22,""fs"":0}]}
----

注意事项与总结

  1. 正则表达式的复杂性与可读性:用于匹配嵌套结构的正则表达式非常复杂,难以理解和维护。在实际项目中,如果日志格式频繁变化或嵌套深度不确定,可能需要考虑其他解析策略,例如使用专门的日志解析库,或者在日志生成时就采用更结构化的格式(如JSON)。
  2. 性能考量:复杂的正则表达式在处理超大日志文件时可能会有性能开销。对于性能敏感的应用,应进行基准测试,并考虑是否需要优化正则表达式或采用流式处理、分块读取等方式。
  3. 日志格式的稳定性:此解决方案高度依赖于日志字符串的特定格式。如果日志格式发生微小变化(例如,键值对之间使用不同的分隔符,或嵌套结构使用其他类型的括号),则正则表达式需要相应调整。
  4. 转义字符处理:在Java字符串中定义正则表达式时,所有反斜杠 \ 都需要双重转义(例如 \ 变为 \\)。同时,对于双引号 ",在正则表达式中也需要转义。
  5. 值的进一步处理:提取出的值(特别是嵌套的JSON-like字符串)通常还需要进一步解析。例如,对于 STK 的值,可以将其视为一个JSON字符串,然后使用 ObjectMapper 等工具进行反序列化。

通过本教程,我们展示了如何在Java中利用一个强大的正则表达式,从复杂的日志字符串中准确、高效地提取 KEY=VALUE 对。虽然正则表达式本身较为复杂,但其在处理特定模式匹配问题上的强大能力是毋庸置疑的。理解其工作原理并正确应用,将大大提高日志解析的效率和准确性。

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

651

2023.06.15

java流程控制语句有哪些
java流程控制语句有哪些

java流程控制语句:1、if语句;2、if-else语句;3、switch语句;4、while循环;5、do-while循环;6、for循环;7、foreach循环;8、break语句;9、continue语句;10、return语句。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

453

2024.02.23

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

722

2023.07.05

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

725

2023.07.31

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

394

2023.08.01

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

398

2023.08.02

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

441

2023.08.02

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

427

2023.08.02

苹果官网入口直接访问
苹果官网入口直接访问

苹果官网直接访问入口是https://www.apple.com/cn/,该页面具备0.8秒首屏渲染、HTTP/3与Brotli加速、WebP+AVIF双格式图片、免登录浏览全参数等特性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

10

2025.12.24

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kotlin 教程
Kotlin 教程

共23课时 | 2万人学习

C# 教程
C# 教程

共94课时 | 5.3万人学习

Java 教程
Java 教程

共578课时 | 37.4万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号