All work and no play makes Jack a dull boy
Mostrando postagens com marcador csv. Mostrar todas as postagens
Mostrando postagens com marcador csv. Mostrar todas as postagens

quarta-feira, 16 de setembro de 2015

extraindo colunas de csv e excel usando pandas

(ou criando subsets de dados usando pandas)



Já mostrei como é fácil ler e exportar dados de arquivo csv ou xls usando pandas, mas digamos que diante de um dataset com várias colunas, você precise isolar algumas.

Dado o seguinte:
In [1]:
import pandas as pd
In [3]:
dados = pd.read_csv('file.csv')
In [4]:
dados
Out[4]:
abcd
01234
15678

Caso você queira um range de colunas você pode:
In [5]:
dados.ix[:,1:3]
Out[5]:
bc
023
167


Caso queira separar pelo header:
In [6]:
dados[['b','d']]
Out[6]:
bd
024
168


Após isso, em ambos, caso queira os dados de uma coluna, basta usar:
In [7]:
novo = dados[['b', 'd']]
In [8]:
novo['b']
Out[8]:
0    2
1    6

=]

ps: usei o https://try.jupyter.org/ para construir esses exemplos e, lá, sempre são impressos à esquerda o número das colunas.

terça-feira, 1 de setembro de 2015

de excel para csv com pandas em 3 linhas


Veja como é ridiculamente fácil transformar um arquivo do Excel em csv usando pandas do python
import pandas as pd
data = pd.read_excel("arquivo.xls")
data.to_csv("arquivo.csv")
simples assim.

ainda há outros parâmetros em cada um desses métodos usados, você pode:
- indicar qual 'sheet' do xls e mais
- indicar encoding, colunas, header do csv e muito mais.

Só lembre-se que, para essa operação, é necessário instalar o pacote xlrd.


terça-feira, 25 de agosto de 2015

juntar arquivos CSV usando pandas



pandas ou Python Data Analysis Library é um biblioteca open-source que provê ferramentas de alta performance para estrutura e análise de dados para python.

É uma biblioteca bem poderosa e aqui um exemplo bem simples de como usá-la.

Considere:

primeiro.csv
coluna1,coluna2
1,a
2,b
3,c

segundo.csv
coluna3,coluna4
z,m
x,n
c,h

Para mesclar esses dois csv:

import pandas as pd
primeiro = pd.read_csv('primeiro.csv')
segundo = pd.read_csv('segundo.csv')
mesclado = pd.concat([primeiro, segundo], axis=1)

A saída será algo como:

coluna1coluna2coluna3coluna4
01azm
12bxn
23cch

A documentação cobre, obviamente, muito mais - corre lá.