0

0

正则表达式的由来_正则表达式的历史起源与发展历程

星降

星降

发布时间:2026-01-08 16:23:31

|

222人浏览过

|

来源于php中文网

原创

正则表达式源于1943年McCulloch-Pitts神经元模型,经Kleene 1951年形式化为正则集合理论;1960年代末Thompson将其实现为QED/grep文本搜索工具;1980年代POSIX标准化BRE/ERE;1987年Perl引入高级特性;1990年代PCRE库推动跨语言统一。

正则表达式的由来_正则表达式的历史起源与发展历程

正则表达式不是程序员凭空发明的工具,它的根扎在数学和神经科学里。

从神经元到数学符号

1943年,神经生理学家Warren McCulloch和Walter Pitts发表论文《A logical calculus of the ideas immanent in nervous activity》,首次用逻辑与数学建模神经元行为,把大脑活动抽象成“自动控制元”的组合。这为形式化描述“可识别模式”埋下伏笔。

1951年(部分文献记为1956年),数学家Stephen Kleene在他们工作的基础上,提出“正则集合(Regular Sets)”理论,用一套代数符号刻画一类可被有限状态机识别的语言。他称这套符号系统为“正则表达式”,目的不是处理文本,而是研究计算的边界——哪些问题能被简单机器解决。

从理论走向终端命令

正则表达式真正进入工程师日常,要等到1960年代末。Ken Thompson——Unix之父——将Kleene的理论转化为可运行的搜索算法,并率先实现在QED编辑器中。这是它第一次被用于交互式文本匹配。

随后,它被移植进Unix的ed编辑器,再通过grep(global regular expression print)工具引爆普及。grep让普通用户只需一行命令,就能在成千上万行日志里揪出含特定格式的记录,比如^\d{4}-\d{2}-\d{2}匹配日期。

UNIX技术手册 Unix in a Nutshell, 4th Edition 英文PDF文字版
UNIX技术手册 Unix in a Nutshell, 4th Edition 英文PDF文字版

Unix in a Nutshell同时涵盖了许多重要的、业界标准的开放源码工具 本书还完整地讨论了常用的shell(bash、ksh及tcsh)和重要元素如正则表达式,乃至旧式工具如sed、awk与vi。 Unix不是一个庞大的物体:它是一个综合体,而《Unix技术手册》则是将这一切合并在一起的一本书。 到底unix是什么?原始的unix源码是由sco拥有,unix注册商标是由open group拥有,而领先的仿unix系统则是gnu/linux、mac os x及solaris。这些版本所附的命令与选

下载
  • 1970年代:egrep、sed、awk陆续增强支持,但各工具语法不统一
  • 1980年代:POSIX标准化,明确BRE(基本)与ERE(扩展)两类语法,成为Unix/Linux工具的通用底座
  • 1987年:Perl发布,把正则从“查找工具”升级为“编程语言级能力”,支持捕获组、回溯、懒惰匹配等高级特性

从Perl兼容到现代通用

Perl的强大正则能力很快成为事实标准。1990年代,PCRE(Perl Compatible Regular Expressions)库诞生,让C、PHP、Python、Java等语言都能调用一致、强大且易用的正则引擎。

今天你写的[a-z]+@[a-z]+\.[a-z]{2,},背后是Kleene的代数、Thompson的算法、Perl的设计哲学和PCRE的工程实现三层叠加的结果。它早已超越“文本查找”,活跃在表单验证、日志解析、代码重构、甚至大模型预处理的数据清洗环节。

两个派系仍在并存

不是所有正则都一样。实际使用中需注意底层差异:

  • POSIX派系:grep、sed默认使用BRE;加-E用ERE。括号()、花括号{}需转义才具特殊含义
  • PCRE派系:Python的re模块、JavaScript的RegExp、Java的java.util.regex均属此类。语法更直觉,功能更丰富

选哪一种,取决于你用的工具或语言,而不是哪个“更高级”。理解差异,才能避免写完正则却在不同环境里表现不一。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

738

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

634

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

755

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

617

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1259

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

547

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

705

2023.08.11

Golang 分布式缓存与高可用架构
Golang 分布式缓存与高可用架构

本专题系统讲解 Golang 在分布式缓存与高可用系统中的应用,涵盖缓存设计原理、Redis/Etcd集成、数据一致性与过期策略、分布式锁、缓存穿透/雪崩/击穿解决方案,以及高可用架构设计。通过实战案例,帮助开发者掌握 如何使用 Go 构建稳定、高性能的分布式缓存系统,提升大型系统的响应速度与可靠性。

58

2026.01.09

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PHP课程
PHP课程

共137课时 | 8.4万人学习

JavaScript ES5基础线上课程教学
JavaScript ES5基础线上课程教学

共6课时 | 6.9万人学习

PHP新手语法线上课程教学
PHP新手语法线上课程教学

共13课时 | 0.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号