R语言实战读书笔记(四)基本数据管理
4.2 创建新变量
几个运算符:
^或**:求幂
x%%y:求余
x%/%y:整数除
4.3 变量的重编码
with():
within():可以修改数据框
4.4 变量重命名
包reshape中有个函数rename,可以改名 rename(df,c(manage='managerID',date='testDate'))
或
names(df)[2]<-'newname'
4.5 缺失值
is.na():检查缺失值,是返回TRUE,否返回FALSE
na.rm=TRUE选项可以用,比如
y<-sum(x,na.rm=TRUE)
移除缺失值
newdf<-na.omit(df)
4.6 日期值
as.Date():其中参数input_format的取值,真难记,默认日期是yyyy-mm-dd
%d:数字日期
%a:缩写的星期名
%A:非缩写的星期名
%m:00~12
%b:缩写的月份
%B:非缩写的月份
%y:两位年份
%Y:四位年份
Sys.Date():当前日期
date():返回当前日期和时间,为什么不好好起名字呢,非要叫Date和date
可以用format提取一些东西
today <- Sys.Date()
format(today, format = "%B %d %Y")
format(today, format = "%A")
日期可以相减
startdate <- as.Date("2004-02-13")
enddate <- as.Date("2009-06-22")
days <- enddate - startdate
也可以
today <- Sys.Date()
format(today, format = "%B %d %Y")
dob <- as.Date("1956-10-10")
format(dob, format = "%A")
4.6.1 将日期转换为字符型变量
as.character
4.7 类型转换
is.numeric --> as.numeric
is.character
is.vector
is.data.frame
is.factor
is.logical
4.8 数据排序
order()
newdata <- leadership[order(leadership$age), ] 这是升序,前面加个减号就是降序
newdata <- leadership[order(gender, -age), ] 这是按性别升序,年龄降序排序
4.9 数据集的合并
4.9.1 添加列
横向合并两个数据框,用merge()
newdf<-merge(dfA,dfB,by="ID")
newdf<-merge(dfA,dfB,by=c("ID","Country"))
如果不需要连接,用cbind就可以
4.9.2 添加行
rbind
4.10 数据集取子集
4.10.1 选入变量
选列
data<-df[,c(6:10)]
或按名称选择
myvars <- c("q1", "q2", "q3", "q4", "q5")
newdata <- leadership[myvars]
4.10.2 剔除变量
myvars <- names(leadership) %in% c("q3", "q4") 得到交集
newdata <- leadership[!myvars] 取反,结果等于去除了q3,q4
或者
newdata <- leadership[c(-7, -8)]
4.10.3 选入观测
which函数
4.10.4 subset
newdata <- subset(leadership, age >= 35 | age < 24, select = c(q1, q2, q3, q4))
newdata <- subset(leadership, gender == "M" & age > 25, select = gender:q4)
4.10.5 随机抽样
sample
sample<-df[sample(1:nrow*(df),3,replace=FALSE] 不放回抽样
4.11 使用SQL操作数据框
library(sqldf)
newdf <- sqldf("select * from mtcars where carb=1 order by mpg", row.names = TRUE)
newdf <- sqldf("select avg(mpg) as avg_mpg, avg(disp) as avg_disp,gear from mtcars where cyl in (4, 6) group by gear")
R语言实战读书笔记(四)基本数据管理的更多相关文章
- R语言实战读书笔记(五)高级数据管理
5.2.1 数据函数 abs: sqrt: ceiling:求不小于x的最小整数 floor:求不大于x的最大整数 trunc:向0的方向截取x中的整数部分 round:将x舍入为指定位的小数 sig ...
- R语言实战读书笔记(三)图形初阶
这篇简直是白写了,写到后面发现ggplot明显更好用 3.1 使用图形 attach(mtcars)plot(wt, mpg) #x轴wt,y轴pgabline(lm(mpg ~ wt)) #画线拟合 ...
- R语言实战读书笔记(二)创建数据集
2.2.2 矩阵 matrix(vector,nrow,ncol,byrow,dimnames,char_vector_rownames,char_vector_colnames) 其中: byrow ...
- R语言实战读书笔记1—语言介绍
第一章 语言介绍 1.1 典型的数据分析步骤 1.2 获取帮助 help.start() help("which") help.search("which") ...
- R语言实战读书笔记2—创建数据集(上)
第二章 创建数据集 2.1 数据集的概念 不同的行业对于数据集的行和列叫法不同.统计学家称它们为观测(observation)和变量(variable) ,数据库分析师则称其为记录(record)和字 ...
- R语言实战读书笔记(八)回归
简单线性:用一个量化验的解释变量预测一个量化的响应变量 多项式:用一个量化的解决变量预测一个量化的响应变量,模型的关系是n阶多项式 多元线性:用两个或多个量化的解释变量预测一个量化的响应变量 多变量: ...
- R语言实战读书笔记(六)基本图形
#安装vcd包,数据集在vcd包中 library(vcd) counts <- table(Arthritis$Improved)counts # 垂直barplot(counts, main ...
- R语言实战读书笔记(一)R语言介绍
1.3.3 工作空间 getwd():显示当前工作目录 setwd():设置当前工作目录 ls():列出当前工作空间中的对象 rm():删除对象 1.3.4 输入与输出 source():执行脚本
- R语言实战读书笔记(十三)广义线性模型
# 婚外情数据集 data(Affairs, package = "AER") summary(Affairs) table(Affairs$affairs) # 用二值变量,是或 ...
随机推荐
- ios frame、bound和center定义及使用场景总结
frame:指的是视图在父视图的坐标系统中的大小和位置. bound:指的是视图在视图本身的坐标系统中的大小(位置起点是原点). center:指的是视图在父视图坐标系统中的中心点. frame和bo ...
- C++时间标准库时间time和系统时间的使用
#include <iostream> #include <time.h> #include <stdio.h> #include <windows.h> ...
- 用 VIPER 构建 iOS 应用架构(2)
[编者按]本篇文章由 Jeff Gilbert 和 Conrad Stoll 共同编写,通过构建一个基础示例应用,深入了解 VIPER,并从视图.交互器等多个部件理清 VIPER 的整体布局及思路.通 ...
- Python中编码问题?
一.键盘输入 raw_input('请输入:'.decode('utf-8').encode('gbk'))raw_input(unicode('请输入:','utf-8').encode('gbk' ...
- 使用tomcat7创建异步servlet
该篇文章翻译自:http://developerlife.com/tutorials/?p=1437 一.简介 Servlet API 3.0 之前,需要使用类似Comet的方式来实现创建异步的Ser ...
- HDU 1403 Longest Common Substring(后缀数组,最长公共子串)
hdu题目 poj题目 参考了 罗穗骞的论文<后缀数组——处理字符串的有力工具> 题意:求两个序列的最长公共子串 思路:后缀数组经典题目之一(模版题) //后缀数组sa:将s的n个后缀从小 ...
- SGU101
Dominoes – game played with small, rectangular blocks of wood or other material, each identified by ...
- 【linux】打印字符串中指定行
只打印第10行 关键在于当行数小于10时不输出. 用 head tail的关键问题是当行数小于10的时候用 head -n 10 只会打出前面的行,再用tail就错了. 所以要知道源文件一共有多少行. ...
- linux kill命令详解
1.命令格式: kill[参数][进程号] 2.命令功能: 发送指定的信号到相应进程.不指定型号将发送SIGTERM(15)终止指定进程.如果任无法终止该程序可用“-KILL” 参数,其发送的信号为S ...
- win7系统中任务计划程序的使用与查询
任务计划程序是电脑中的一个好工具,用好了,会让我们使用电脑变的很便捷,具体经验教程如下所示: 工具/原料 装有win7系统的电脑 方法/步骤 在桌面找到“我的电脑”,右击,弹出窗口,找到“管理”,如下 ...