In partnership with

Setup Memorável   Setup Memorável
ED 111

100% escolheram DJI Mic 2. Sai em 16/09.

{{subiu_orn | }} {{subiu_num | }} {{subiu_orn | }}

{{subiu_caps | }}

{{subiu_linha | }}

Descript: apagar a palavra no texto corta o vídeo junto

A transcrição vira a linha do tempo do corte, com limpeza de vícios de fala, som tratado e legenda saindo do mesmo texto.

Descript

A palavra apagada e o corte que vem junto

▼

Uma prensa de alumínio de 12 centímetros, com uma lâmina de aço presa no centro e dois pinos de encaixe para a perfuração da película. O aparelho se chama emendadora (splicer, a prensa que cola dois pedaços de filme cortado), e ele prova uma afirmação que atravessou oitenta anos de ofício: cortar imagem sempre foi um trabalho de achar o ponto exato dentro do material bruto, com a mão.

O computador trocou a lâmina pelo cursor e manteve a busca. Quem grava vídeo falado, uma aula, um episódio de podcast filmado, um vídeo de canal, um treinamento interno, passa a maior parte do tempo de edição fazendo uma tarefa só: varrer a onda de áudio para descobrir onde a frase começa, onde ela termina e onde o "ééé" entrou.

Sessenta minutos de gravação bruta escondem material aproveitável em pedaços irregulares. A fala boa está no minuto 3, a repetição do mesmo parágrafo está no minuto 11, a melhor tomada da abertura saiu na quarta tentativa, no minuto 38. Nenhum desses pontos tem marcação visível, e a onda de áudio na tela mostra picos de volume, nunca conteúdo.

Existe uma categoria de programa que ataca a busca pela raiz: a edição baseada em texto (text-based editing, o corte feito por cima da transcrição em lugar da linha do tempo). O programa transcreve a fala, mostra o resultado como um documento comum, e amarra cada palavra escrita ao trecho de vídeo que a produziu.

O Descript nasceu dentro dessa categoria e levou a ideia ao limite: apagar uma palavra no texto apaga o pedaço de vídeo correspondente, recolar um parágrafo em outro lugar reordena as cenas, e a legenda sai do mesmo documento que você acabou de editar.

A primeira seção desmonta o gargalo que aparece antes de qualquer programa, e mostra por que uma hora de gravação falada custa tantas horas de bancada.

Continue lendo ↓

 
 
 

I  O Problema

A hora de gravação que come quatro de bancada

 
‌

Pegue a última gravação falada que você editou. O tempo entre o fim da gravação e o arquivo pronto passou de três para um, muitas vezes de quatro para um, e quase nada desse tempo foi decisão criativa. Foi procura.

O primeiro gargalo é a cegueira da onda de áudio. O desenho na tela mostra volume, e volume não diz o que foi dito. Achar o trecho em que você explicou o segundo argumento exige tocar, parar, voltar cinco segundos, tocar de novo. Cada busca dessas custa entre trinta e noventa segundos, e uma edição comum tem dezenas delas.

O segundo gargalo é o vício de fala. "Ééé", "então", "tipo", "né" aparecem às dezenas numa gravação de trinta minutos de fala espontânea. Cortar cada um pede localizar a hesitação, marcar dois pontos, apagar e conferir se a emenda ficou natural. O trabalho é mecânico, repetitivo e ocupa uma tarde inteira.

O terceiro gargalo são as tomadas repetidas. Quem grava sozinho erra a frase e recomeça na hora, o que gera três ou quatro versões do mesmo parágrafo coladas uma na outra. Escolher a melhor exige ouvir as quatro em sequência, comparar de ouvido e lembrar qual estava melhor, com a memória perdendo a primeira quando chega na quarta.

O quarto gargalo é a reordenação. Perceber, no meio da edição, que o terceiro bloco funciona melhor como abertura significa recortar um intervalo da linha do tempo, arrastar o pedaço para o começo, reconferir as bordas e torcer para nada ter saído de sincronia. A operação dá tanto trabalho que a maioria desiste e publica a ordem errada.

O quinto gargalo é a duplicação de esforço na legenda e no texto de apoio. A descrição do vídeo, o resumo do episódio, o artigo derivado e a legenda queimada na tela saem todos da mesma fala, e cada um costuma ser digitado do zero por uma pessoa que já ouviu aquele áudio quatro vezes.

O sexto gargalo aparece na revisão com outra pessoa. Mandar o corte para um sócio, um cliente ou um editor gera comentários por mensagem no formato "no minuto 12 e 40 você repetiu", e voltar ao programa para achar o minuto 12 e 40 reinicia o ciclo de procura que já tinha sido pago uma vez.

Some os seis e o retrato aparece. O custo da edição falada mora na localização do trecho, nunca na decisão sobre ele. Um programa que mostre o conteúdo em palavras legíveis derruba a maior fatia desse custo antes de qualquer recurso sofisticado entrar na conversa.

‌
‌
‌
‌

II  A Descoberta

O documento que funciona como linha do tempo

 
‌

O Descript é um editor de áudio e vídeo lançado em 2017 pela empresa do mesmo nome, em São Francisco, dirigida pelo fundador Andrew Mason, e foi construído em torno da transcrição, não em torno da linha do tempo. A tela de estreia mostra um documento de texto com o vídeo numa janela ao lado.

O texto como material de corte: o programa transcreve a gravação e exibe a fala em parágrafos comuns. Apagar uma palavra apaga o pedaço de vídeo em que ela foi dita, selecionar três frases e deletar remove o trecho inteiro, e recortar um parágrafo e colar em outro ponto do documento reordena as cenas com a mesma facilidade de mexer num texto.

A limpeza dos vícios de fala: um comando único varre a transcrição e marca todas as hesitações e repetições de apoio, que somem juntas com um clique. O trabalho de tarde inteira vira um passo de trinta segundos, com a opção de revisar a lista antes de confirmar.

O corte dos silêncios: o programa localiza as pausas longas entre frases e encurta todas de uma vez, com você definindo quanto de respiro fica. Uma gravação de fala espontânea perde vários minutos de vazio sem ninguém tocar na linha do tempo.

O tratamento do áudio: o Studio Sound processa a voz gravada e reduz reverberação de sala e chiado de fundo, entregando um som mais próximo de microfone tratado. Gravação feita em quarto comum, sem espuma na parede, melhora de forma audível nessa passagem.

A voz clonada para remendo: o Overdub cria um modelo da sua própria voz, com consentimento gravado, e digita uma correção que sai falada no timbre certo. Trocar um número errado numa frase deixa de exigir regravação da tomada inteira.

A gravação de tela e a legenda: o programa grava tela, câmera e microfone dentro dele mesmo, e a legenda sai da transcrição que você acabou de editar, queimada no vídeo ou exportada como arquivo à parte. O texto de descrição e o resumo do episódio saem do mesmo documento.

O plano gratuito: o Free cobre 1 hora de transcrição por mês, edição e exportação em 720p com marca d'água nas exportações em alta, gravação de tela ilimitada e projetos ilimitados. Testar o método com um vídeo curto cabe nesse limite; publicar toda semana não cabe.

O plano pago: o Hobbyist custa US$ 19 por mês no pagamento mensal e US$ 12 por mês no anual, com 10 horas de transcrição; o Creator custa US$ 35 por mês no mensal e US$ 24 por mês no anual, com 30 horas, exportação em 4K e sem marca d'água. Os valores são de tabela publicada pela empresa no site em setembro de 2026.

A citação que explica o método: "O corte é uma ideia sobre o que vem a seguir", escreveu Walter Murch em In the Blink of an Eye, publicado em 1995. A edição por texto entrega essa decisão limpa, porque a pergunta sobre qual pedaço fica aparece escrita na tela em lugar de ficar escondida num desenho de volume.

Onde ele não é a escolha certa: vídeo de narrativa visual, com trilha sincronizada, correção de cor pesada e camadas de efeito, continua pedindo um programa de linha do tempo completo. Fala em português com sotaque carregado ou muito termo técnico gera transcrição com erro, e transcrição errada gera corte errado. O trabalho também mora na nuvem, com projeto pesado dependendo de conexão firme.

Selo HC: Aprovado. Ele resolve o gargalo real de quem publica vídeo falado toda semana, corta a etapa de procura quase inteira e entrega legenda, descrição e corte final saindo do mesmo documento.

Conhecer o Descript →

 
 

Quem banca a edição de hoje

Is Your Training Data Actually Model-Ready?

If you're fine-tuning a speech model, you've probably hit this wall: DNSMOS gives you a score, but it doesn't tell you whether the data behind that score is actually right for your model. 

Treat it as a pass/fail gate and you'll end up training on audio that looks clean on paper but drags down real-world performance—while good source data gets tossed for no reason.

Voices' CTO DJ Jalali (with the team's senior audio and voice data engineers) just published a free white paper that breaks down the four-step calibration framework they use internally to set model-specific quality thresholds instead of trusting the raw DNSMOS number. It also covers where DNSMOS breaks down and how Voices validates audio for custom datasets at scale.

Patrocinadores mantêm a edição gratuita

 
‌
‌
‌
‌

III  O Setup

Três passos até o primeiro corte por texto

 
‌

Vai testar hoje? Faça estes três passos na estreia, porque editor de texto com vídeo embutido engana pela facilidade e produz corte apressado quando ninguém combina uma ordem de trabalho antes.

Passo 01: leve uma gravação já existente, curta, com fala espontânea. Escolha um arquivo de cinco a dez minutos que você gravou e nunca editou, e suba no programa antes de aprender qualquer recurso. A transcrição fica pronta em poucos minutos, e a leitura do texto já revela quanto material sobra: parágrafo repetido, explicação que ficou confusa, começo que demora a entrar no assunto.

O teste da estreia leva quinze minutos: leia a transcrição uma vez e apague só o que você não leria em voz alta para outra pessoa. Toque o resultado. Se o vídeo ficou mais curto e mais firme sem você ter tocado na onda de áudio, o método funciona para o seu tipo de gravação e o resto do processo vem por consequência.

Passo 02: rode a limpeza automática antes de qualquer corte manual. A ordem importa. Primeiro a remoção de hesitações, depois o encurtamento de silêncios, depois o Studio Sound, e só então a leitura do texto para decidir o que entra e o que sai. Invertendo a ordem, você gasta atenção editando trechos que a limpeza automática removeria de graça, e ainda precisa revisar tudo de novo.

Passo 03: feche o corte no texto antes de abrir qualquer recurso visual. Marque o ponto em que o documento está do jeito que você publicaria, e só depois entre em transição, cartela, zoom e legenda no vídeo. Quem mistura as duas etapas acaba aplicando efeito num trecho que sai da versão final dez minutos depois, jogando fora o trabalho visual junto com o texto cortado.

Nos primeiros dias, a meta não é migrar o processo inteiro de edição para dentro do programa. É provar uma afirmação única: a fala escrita na tela deixa a escolha do que fica mais rápida e mais honesta do que a mesma escolha feita por cima de um desenho de volume.

"Quantas horas do seu mês somem procurando, na gravação, o trecho que você sabe que existe?"

A conta desta edição fecha em R$ 0 por mês no plano gratuito, com 1 hora de transcrição mensal, gravação de tela ilimitada, projetos ilimitados e exportação em 720p já incluídos (cotação de 13/09/2026). O degrau seguinte, o Hobbyist a US$ 12 por mês no anual, só entra na conta quando a hora mensal de transcrição acabar antes do fim do mês.

 
 
 

Ebook + app · 8 dias

Capa do ebook
+
O app no celular
1
2
3
4
5
6
7
8

o plano de 8 dias, dentro do app

Em 8 dias, 1 esconderijo por dia. O ebook ensina, o app cobra.

📖O ebook ensina: A auditoria de 30 minutos que acha os apps pagos que você esqueceu de cancelar.
📱O app treina: 1 esconderijo por dia no celular, marcado e anotado. Atrasou, o plano espera.
 
Quero o ebook + app →
 
Quiz da edição

Segundo a edição, quantas horas de transcrição o plano gratuito do Descript cobre por mês?

A3 horas
B30 minutos
C1 hora
D5 horas

Resultado da última edição: 100% acertaram.

Veja o ranking de quem mais acerta →

 
Sua avaliação

Como foi a edição de hoje?

🖥️🖥️🖥️🖥️🖥️  ótima 🖥️🖥️🖥️🖥️  boa 🖥️🖥️🖥️  ok 🖥️🖥️  ruim 🖥️  péssima
 
Escolha a próxima edição

Qual edição você quer ver?

1 toque vota. A pauta vencedora vira uma próxima edição.

Voto aberto até 16/09, 15h30

A ScreenZen →
B Descript →
C Rode PodMic →
D Raycast →

100% escolheram DJI Mic 2 na ed 109

 
Recomendação de Newsletter
Mestre do VR

Mestre do VR

O jogo de hoje, quanto custa em reais e quanto tempo ele dura de verdade, em três minutos. No seu email todo dia às 16:16.

Quero receber →

 
Indique e destrave

Chame mais um produtivo pra escrivaninha

Cada leitor confirmado pelo seu link sobe um degrau da escada de prêmios.

  
você1

{{indicacoes_confirmadas | 0}} confirmadas · faltam {{indicacoes_falta | 1}} pra próxima recompensa

● 1
Pack de wallpapers
Pack de wallpapers
■ 3
EDIÇÃO
Colecionador
 
DO MÊS
🥇
Edição de Colecionador do mês
▲ 5
ebook Assinatura Fantasma
ebook Assinatura Fantasma

Pegar meu link de indicação →

 
Sua jornada
🔥 {{streak_atual | 0}} recorde
{{streak_recorde | 0}}

{{streak_titulo | Comece sua ofensiva hoje}}

sua patente

{{rank_simbolo | ◆}} {{rank_nome | Aprendiz}}

 

faltam {{xp_falta | 5}} de ouro pra {{rank_prox | próxima patente}}

{{edicoes_lidas | 1}}
edições
{{cliques | 0}}
cliques
{{avaliacoes_feitas | 0}}
avaliações
{{moedas | 0}} de ouro na carteira 🏪 loja e missões no hub
{{streak_cta | Começar minha ofensiva}}
 
Amanhã nesta news

ED 113 · amanhã às 08:08

Fifine AM8

Mostrar um microfone barato que, num teste lado a lado, soou melhor que um modelo famoso e bem mais caro, e…

 

Bom setup. Parati semper.

SETUP MEMORÁVEL

Menos apps. Mais resultado

💬 WhatsApp·📣 Anuncie·✍️ Newsletter
📚 Artigos