Erros de dados na importação CSV: porque acontecem e como resolver

Preços duplicados. «café» transformado em «café». Três cópias de cada produto. Quando uma importação corre mal, o instinto é culpar o ficheiro, mas um «ficheiro mau» quase nunca é a causa: dois sistemas discordaram, silenciosamente, sobre o que uma vírgula, uma aspa ou um número significavam, e nada assinalou a discordância até os dados errados já estarem à sua frente.

Sete formas de um ficheiro com bom aspeto mentir

Todos estes casos chegam com o número de linhas certo e sem mensagem de erro.

Incompatibilidades de codificação — um ficheiro escrito em Windows-1252 e lido como UTF-8 (ou o contrário) transforma «café» em «café» e um travessão em três caracteres ilegíveis. Nada rebenta; os valores estão simplesmente errados, nas colunas que calhar não percorrer.

O delimitador não é mesmo uma vírgula — grande parte da Europa continental guarda o CSV com ponto e vírgula, porque essas localizações usam a vírgula para decimais. Presuma o errado e obtém uma única coluna gigante por dividir — ou a vírgula decimal de um preço dividida em colunas que não existem.

A «ajuda» da folha de cálculo antes de exportar — o Excel guarda um código postal escrito como 01234 como o número 1234, e apresenta um código de barras de 16 dígitos em notação científica, arredondado a partir do 15.º dígito. Quando o CSV é escrito, o valor original já não existe em lado nenhum.

Números que significam duas coisas diferentes1.234,56 e 1,234.56 são o mesmo valor em duas convenções regionais diferentes. Leia um pela regra do outro e ele é interpretado sem erro — como 1.23, ou como 1234560.

Cabeçalhos que mudam — uma exportação acrescenta ou reordena uma coluna, «postcode» passa a «postal_code», e um importador que faz a correspondência por posição escreve descrições em campos de preço sem avisar. Nada num CSV garante que a coluna 4 significa a mesma coisa duas vezes.

Reimportar sem uma chave estável — corrija três linhas, reenvie 2000, e um importador sem uma identidade estável por registo cria 2000 duplicados em vez de atualizar três. Os nomes mudam; uma referência externa, um SKU ou um número de encomenda não.

Caracteres que não se veem — um espaço inseparável colado de uma página web, ou "Azul " com um espaço no final, mostra-se de forma idêntica ao valor limpo e falha em qualquer correspondência exata — por isso a mesma categoria é criada duas vezes, e as verificações de duplicados nunca disparam.

Antes de carregar: a verificação que apanha a maior parte disto

1

Abra-o uma vez como texto simples

Antes de confiar na pré-visualização de qualquer ferramenta, abra o ficheiro num editor de texto simples, não numa folha de cálculo: uma folha de cálculo reinterpreta o ficheiro no momento em que o abre, o que esconde precisamente os problemas que está a procurar. Observe o início em bruto da primeira linha, à procura de algo colocado antes do primeiro nome de coluna.

2

Confirme que o delimitador é o que julga ser

Conte os delimitadores a olho em algumas linhas diferentes. Um ficheiro que está na verdade delimitado por ponto e vírgula mas que se assume delimitado por vírgulas não mostra uma única vírgula fora dos próprios valores — uma verificação de cinco segundos que apanha toda uma classe de falhas antes de começar.

3

Teste uma linha com uma vírgula, aspas e uma quebra de linha

Encontre, ou crie de propósito, uma linha de teste com uma vírgula dentro de um campo de texto, uma aspa e uma nota com várias linhas, e confirme que o importador mantém cada um como um único campo em vez de o dividir. Esta única linha põe à prova exatamente o mecanismo que, mal tratado, desloca silenciosamente todas as colunas seguintes.

4

Experimente um lote pequeno antes do ficheiro completo

Dez ou vinte linhas primeiro, revistas uma a uma, apanham um erro sistemático de mapeamento — uma coluna trocada, uma moeda errada, um formato de data errado — enquanto ainda são dez linhas a corrigir e não dez mil.

5

Decida o que significa «concluído» por linha, não por ficheiro

Um único aprovado ou reprovado para o ficheiro inteiro não lhe diz nada sobre que linhas corrigir. Exija um resultado por linha — criada, atualizada, ignorada, falhada, e porquê — antes de confiar algo importante a um importador.

Como a Olmira trata disto

O conector de importação de ficheiros da Olmira é construído exatamente contra esta lista: um leitor RFC 4180 rigoroso que trata vírgulas entre aspas e quebras de linha incorporadas, remoção automática de um BOM UTF-8 inicial, e ficheiros demasiado grandes rejeitados de imediato em vez de truncados silenciosamente. Uma linha cuja contagem de colunas não corresponde ao cabeçalho falha sozinha sem abortar o resto, e uma chave de deduplicação faz com que correr o mesmo ficheiro duas vezes atualize ou ignore os registos existentes — conforme a política que escolheu — em vez de os duplicar.

Para catálogos de produtos e serviços, importar por CSV acrescenta uma pré-visualização linha a linha — incluindo quaisquer campos que a IA tenha preenchido, claramente assinalados — antes de qualquer linha ser guardada. A plataforma de conectores completa, com recolhas agendadas e webhooks assinados a par da importação de ficheiros, está em Integrações.

Importe uma vez, corretamente

Período experimental gratuito de 30 dias. Traga os seus dados consigo quando estiver pronto.