首页

API市场

OPC社区

产品矩阵

数据服务
- API Market Place
- JUHE MCP & SKILL Hub
- Customized Data
- Data Block
数据产品
- APIMaster
- DataArts
- QuickBot
开发者服务
- Jenius
- 开发者社区
- BayArea
- AI创作

投资者关系

关于

关于聚合
聚合动态
合作伙伴
API百科

热门搜索

短信发送 5G基站身份证 AI新闻简报银行卡天气快递航班订票实名认证

掌握聚合最新动态了解行业最新趋势

API接口，开发服务，免费咨询服务

行业资讯 / 用Python做数据分析：Pandas常用数据查询语法

用Python做数据分析：Pandas常用数据查询语法

来源： SDK.cn 类型：技术文章发布：2017-08-16 17:10:14

在使用Pandas之前，大多数数据分析师已经掌握了Excel和SQL，并且在刚上手Pandas时会经常习惯性想到“老办法”。"如果谁能把常用的数据查询语法做个对比就好了 "，我也曾不止一次地想享受前人的成果，无奈发现网上的文章侧重不同且深浅不一，还涉及到一些Pandas新老版本的问题，于是决定自己动手。

一、举例的数据

假设我有个六列的dataframe：一列是销售员，一列是所属团队，其它四列分别是四个季度的销售额。

1新增列-基于原有列的全年销售额

首先df['Total ']确保了你在该df内新增了一个column，然后累加便可。

df['Total'] = df['Q1']+df['Q2']+df['Q3']+df['Q4']

191-0.jpg.png

你可能想使用诸如sum()的函数进行这步，很可惜，sum()方法只能对列进行求和，幸好它可以帮我们求出某季度的总销售额。df['Q1'].sum()，你就能得到一个Q1的总销售额，除此之外，其他的聚合函数，max,min,mean都是可行的。

2分组统计 - 团队竞赛

那么按团队进行统计呢？在mysql里是group by，Pandas里也不例外，你只需要df.groupby('Team').sum()就能看到期望的答案了。

未命名1502875315.png

4排序 - 谁是销售冠军

如果你关心谁的全年销售额最多，那么就要求助于sort_values方法了，在excel内是右键筛选，SQL内是一个orderby。默认是顺序排列的，所以要人为设定为False，如果你只想看第一名，只需要在该语句末尾添加.head(1) 。

192-0.jpg.png

未命名1502875442.png

5切片-只给我看我关心的行

接下来就是涉及一些条件值的问题，例如我只关心Team为A的数据，在Excel里是筛选框操作，在SQL里写个where就能搞定，在Pandas里需要做切片。

查看Pandas文档时，你可能已经见过各种切片的函数了，有loc,iloc,ix,iy，这里不会像教科书一样所有都讲一通让读者搞混。这种根据列值选取行数据的查询操作，推荐使用loc方法。

df.loc[df['Team']== 'A',['Salesman', 'Team','Year']]，这里用SQL语法理解更方便，loc内部逗号前面可以理解为where，逗号后可以理解为select的字段。

193-0.jpg.png

如果想全选出，那么只需将逗号连带后面的东西删除作为缺省，即可达到select *的效果。

193-0.jpg.png

6切片 - 多条件筛选

在Pandas中多条件切片的写法会有些繁琐，df.loc[ (df['Team']== 'A' ) & (df['Total'] > 15000 ) ]，添加括号与条件符。

未命名1502875579.png

这里有一个有意思的小应用，如果你想给符合某些条件的员工打上优秀的标签，你就可以结合上述新增列和切片两点，进行条件赋值操作。

df.loc[ (df['Team']== 'A' ) & (df['Total'] > 15000 ) , 'Tag'] = 'Good'

194-0.jpg.png

7删除列 - 和查询无关，但是很有用

当然这里只是个举例，这时候我想删除Tag列，可以del df['Tag']，又回到了之前。

二、连接

接下来要讲join了，现在有每小时销售员的职位对应表pos，分为Junior和Senior，要将他们按对应关系查到df中。

这里需要认识一下新朋友，merge方法，将两张表作为前两个输入，再定义连接方式和对应键。对应到Excel中是Vlookup，SQL中就是join。在pandas里的连接十分简单。

df = pd.merge(df, pos, how='inner', on='Salesman')

注意，这个时候其实我们是得到了新的df，如果不想覆盖掉原有的df，你可以在等号左边对结果重新命名。

这时候有了两组标签列（对应数值列），就可以进行多重groupby了。

当然这样的结果并不能公平地反应出哪一组更好，因为每组的组员人数不同，可能有平均数的参与会显得更合理，并且我们只想依据全年综合来评价。

这里的数据是捏造的，不过也一目了然了。

三、合并操作

最后以最简单的一个合并操作收尾。

如果我又有一批数据df2，需要将两部分数据合并。只需要使用concat方法，然后传一个列表作为参数即可。不过前提是必须要保证他们具有相同类型的列，即使他们结构可能不同（df2的Team列在末尾，也不会影响concat结果，因为pandas具有自动对齐的功能）。

pd.concat([df,df2])

199-0.jpg.png

尾声

以上就是一些基础的Pandas数据查询操作了。作为Pandas初学者，如果能善用类比迁移的方法进行学习并进行总结是大有裨益的。如果看完本文还没有能了解到你关心的查询方法，可以留言联系，或许还可以有续集。

作者

大毛岂安科技业务风险分析师，多年订单业务反欺诈经验，负责岂安科技多款产品运营工作。

原文来自:岂安科技

声明：所有来源为“聚合数据”的内容信息，未经本网许可，不得转载！如对内容有异议或投诉，请与我们联系。邮箱：marketing@think-land.com

生活服务企业工商金融科技接口大全电子商务

API资讯

相关API

手机三个月停机次数

通过手机号码查询近3个月总停机次数标签信息，统计近3个月内停机的次数。
通过手机号码查询近3个月总停机次数标签信息，统计近3个月内停机的次数。
手机用户年龄评分

通过手机号查询判断该号码实名用户年龄区间标签信息。
通过手机号查询判断该号码实名用户年龄区间标签信息。
手机近三个月话费评分

通过三网运营商手机号码和指定月份，查询号码近3个月话费消费区间标签详情及评分。
通过三网运营商手机号码和指定月份，查询号码近3个月话费消费区间标签详情及评分。
营运车辆判定查询

通过车架号或车牌号查询车辆是否为营运车辆
通过车架号或车牌号查询车辆是否为营运车辆
VIN查车辆信息-精准版

通过车架号查询车辆的如品牌名称、车系名称、车型、排量、排放标准、外形尺寸、轮胎规格、变速器类型、公告号、轴距等等详细信息
通过车架号查询车辆的如品牌名称、车系名称、车型、排量、排放标准、外形尺寸、轮胎规格、变速器类型、公告号、轴距等等详细信息

0512-88869195

客服微信二维码

微信扫码，咨询客服

数据驱动未来

Data Drives The Future

立即注册