0

0

Pandas中基于条件和行间依赖创建新列

心靈之曲

心靈之曲

发布时间:2025-08-11 22:26:25

|

948人浏览过

|

来源于php中文网

原创

Pandas中基于条件和行间依赖创建新列

本文详细介绍了如何在Pandas DataFrame中高效创建依赖于其他行值的条件列。通过结合使用Series.where()进行条件赋值和Series.bfill()或Series.ffill()进行缺失值填充,可以灵活地根据当前行或相邻行的特定条件来确定新列的值,从而避免低效的循环操作,提升数据处理效率。

引言

在数据处理过程中,我们经常需要根据dataframe中某一列或多列的条件来生成新的列。更复杂的情况是,新列的值不仅取决于当前行的条件,还可能依赖于其上方或下方的行的值。例如,当某一行的特定条件不满足时,我们可能希望新列继承其上方或下方最近一个满足条件的行的值。传统的循环方法在处理大型数据集时效率低下,而pandas提供了更高效的向量化操作来实现这一目标。

核心方法:Series.where()结合Series.bfill()或Series.ffill()

Pandas中的Series.where()方法允许我们根据布尔条件选择性地替换Series中的值。当条件为False时,对应位置的值将被替换为NaN(默认行为),而当条件为True时,原值保持不变。结合使用Series.bfill()(backward fill,向后填充)或Series.ffill()(forward fill,向前填充)可以巧妙地处理行间依赖关系。

假设我们有一个DataFrame df,包含 Colonne 1 和 Dimension 1 两列。我们的目标是创建一个新列 new,其规则如下:

  • 如果 Dimension 1 的值为 'Organisation',则 new 列取 Colonne 1 列的当前行的值。
  • 如果 Dimension 1 的值不是 'Organisation',则 new 列取其下方(或上方,取决于需求)最近一个 Dimension 1 为 'Organisation' 的行的 Colonne 1 值。

以下是示例DataFrame:

import pandas as pd
import numpy as np

data = {
    'Colonne 1': ['MTN_LI2', 'MTN_IRU', 'MTN_ACE', 'MTN_IME', 'RIPP7', 'CA_SOT', 'CA_OTI', 'CNW00', 'BSNTF', 'RIPNJ'],
    'Dimension 1': ['Indicator', 'Indicator', 'Indicator', 'Indicator', 'Organisation', 'Indicator', 'Indicator', 'Organisation', 'Organisation', 'Organisation']
}
df = pd.DataFrame(data)
print("原始DataFrame:")
print(df)

原始DataFrame:

  Colonne 1   Dimension 1
0  MTN_LI2      Indicator
1  MTN_IRU      Indicator
2  MTN_ACE      Indicator
3  MTN_IME      Indicator
4     RIPP7  Organisation
5    CA_SOT     Indicator
6    CA_OTI     Indicator
7     CNW00  Organisation
8     BSNTF  Organisation
9     RIPNJ  Organisation

场景一:向后填充(bfill)——取下方最近的有效值

如果需求是当 Dimension 1 不是 'Organisation' 时,新列的值应取其下方最近一个 Dimension 1 为 'Organisation' 的行的 Colonne 1 值,我们可以使用 Series.bfill()。

df['new_bfill'] = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')).bfill()
print("\n使用 bfill() 的结果:")
print(df)

解释:

  1. df['Dimension 1'].eq('Organisation') 生成一个布尔Series,指示哪些行 Dimension 1 等于 'Organisation'。
  2. df['Colonne 1'].where(...):当布尔条件为True时(即 Dimension 1 为 'Organisation'),保留 Colonne 1 的原始值;当条件为False时,将 Colonne 1 的值替换为 NaN。 此时,new_bfill 列将变为:[NaN, NaN, NaN, NaN, 'RIPP7', NaN, NaN, 'CNW00', 'BSNTF', 'RIPNJ']。
  3. .bfill():对这个包含 NaN 的Series进行向后填充。这意味着每个 NaN 值都会被其下方的第一个非 NaN 值填充。
    • 索引0-3的NaN会被索引4的'RIPP7'填充。
    • 索引5-6的NaN会被索引7的'CNW00'填充。
    • 索引7-9的'CNW00', 'BSNTF', 'RIPNJ'保持不变,因为它们不是NaN。

输出结果:

GForge5.7.1
GForge5.7.1

GForge是一个基于Web的协同开发平台。它提供一组帮助你的团队进行协同开发的工具,如论坛,邮件列表等。用于创建和控制访问源代码管理库(如CVS,Subversion)的工具。GForge将自动创建一个源代码库并依据项目的角色设置进行访问控制。其它工具还包括:管理文件发布,文档管理,新闻公告,缺陷跟踪,任务管理等。

下载
  Colonne 1   Dimension 1 new_bfill
0  MTN_LI2      Indicator     RIPP7
1  MTN_IRU      Indicator     RIPP7
2  MTN_ACE      Indicator     RIPP7
3  MTN_IME      Indicator     RIPP7
4     RIPP7  Organisation     RIPP7
5    CA_SOT     Indicator     CNW00
6    CA_OTI     Indicator     CNW00
7     CNW00  Organisation     CNW00
8     BSNTF  Organisation     BSNTF
9     RIPNJ  Organisation     RIPNJ

场景二:向前填充(ffill)——取上方最近的有效值

如果需求是当 Dimension 1 不是 'Organisation' 时,新列的值应取其上方最近一个 Dimension 1 为 'Organisation' 的行的 Colonne 1 值,我们可以使用 Series.ffill()。

df['new_ffill'] = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')).ffill()
print("\n使用 ffill() 的结果:")
print(df)

解释:

  1. df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')) 步骤与 bfill() 相同,生成包含 NaN 的Series。
  2. .ffill():对这个包含 NaN 的Series进行向前填充。这意味着每个 NaN 值都会被其上方的第一个非 NaN 值填充。
    • 索引0-3的NaN在它们上方没有非NaN值,所以它们将保持为NaN。
    • 索引5-6的NaN会被索引4的'RIPP7'填充。
    • 索引7-9的'CNW00', 'BSNTF', 'RIPNJ'保持不变。

输出结果:

  Colonne 1   Dimension 1 new_bfill new_ffill
0  MTN_LI2      Indicator     RIPP7       NaN
1  MTN_IRU      Indicator     RIPP7       NaN
2  MTN_ACE      Indicator     RIPP7       NaN
3  MTN_IME      Indicator     RIPP7       NaN
4     RIPP7  Organisation     RIPP7     RIPP7
5    CA_SOT     Indicator     CNW00     RIPP7
6    CA_OTI     Indicator     CNW00     RIPP7
7     CNW00  Organisation     CNW00     CNW00
8     BSNTF  Organisation     BSNTF     BSNTF
9     RIPNJ  Organisation     RIPNJ     RIPNJ

注意事项:

  • 初始NaN值: 使用 ffill() 时,如果Series的开头部分是 NaN 且其上方没有有效值,这些 NaN 将会保留。同理,使用 bfill() 时,如果Series的末尾部分是 NaN 且其下方没有有效值,这些 NaN 也会保留。根据实际需求,可能需要对这些初始或末尾的 NaN 进行额外的处理(例如,填充一个默认值)。
  • 性能: 这种组合方法是Pandas中处理此类问题的向量化、高效方式,尤其适用于大型数据集,远优于使用Python循环或 apply 方法。
  • 灵活性: where() 方法可以接受更复杂的布尔条件,而 bfill() 和 ffill() 也可以配合 limit 参数来限制填充的范围。

总结

通过巧妙地结合 Series.where() 和 Series.bfill() / Series.ffill(),我们可以在Pandas中高效地创建依赖于行间关系的条件列。这种方法不仅代码简洁,而且在处理大规模数据时表现出卓越的性能,是Pandas数据操作中非常实用的技巧。理解其工作原理,可以帮助我们解决各种复杂的条件赋值和数据填充问题。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

717

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

627

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

743

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

617

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1236

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

547

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

575

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

699

2023.08.11

php源码安装教程大全
php源码安装教程大全

本专题整合了php源码安装教程,阅读专题下面的文章了解更多详细内容。

74

2025.12.31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

相关下载

更多

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 0.6万人学习

Django 教程
Django 教程

共28课时 | 2.6万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.0万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号