Fish Audio levanta US$ 52 milhões para desenvolver modelos de voz em IA

Por Autor Redação TNRedação TN

Fish Audio levanta US$ 52 milhões para desenvolver modelos de voz em IA

A Fish Audio, uma startup baseada em Palo Alto, acaba de anunciar que levantou US$ 52 milhões em uma rodada de investimento seed, liderada pela Coreline Ventures e Capital Today. Este financiamento é um passo significativo para a empresa, que visa desenvolver modelos de voz gerados por inteligência artificial (IA) voltados tanto para criadores quanto para empresas. Desde seu lançamento no ano passado, a Fish Audio já conquistou mais de 8 milhões de usuários que utilizam suas versões open-source ou hospedadas, gerando uma receita recorrente anual de US$ 21 milhões.

O mercado para modelos de voz gerados por IA é vasto e apresenta diversas aplicações criativas. A Fish Audio busca atender a essas demandas com uma biblioteca que conta com mais de 15. 000 controles de linguagem natural.

A startup foi fundada por Shijia Liao, um ex-pesquisador da Nvidia, que se sentiu frustrado com a falta de vozes sintéticas expressivas disponíveis no mercado. Ele começou a treinar um modelo de geração de voz em uma única GPU, que posteriormente foi open-sourced. A biblioteca Fish Speech no GitHub já acumula mais de 31.

000 estrelas e é utilizada por desenvolvedores independentes, designers de jogos e criadores de conteúdo. Nos últimos doze meses, a empresa lançou cinco modelos, incluindo quatro de geração de fala e um modelo de conversão de fala para texto. Enquanto três dos modelos de geração de fala são open-source, o mais recente, o S2.

1 Pro, está disponível apenas através de uma API paga. A Fish Audio oferece planos mensais pagos que são adequados para criadores e equipes, permitindo acesso a um número específico de minutos de geração de voz, além de recursos de clonagem de voz. A empresa também disponibiliza uma versão enterprise de suas APIs e plataforma, com organizações como HeyGen e Sanas já utilizando seus serviços.

Rissa Cao, CEO e cofundadora da Fish Audio, destacou que cada empresa possui diferentes casos de uso e preferências. Por exemplo, empresas como a HeyGen, que utilizam as vozes para alimentar avatares de IA, buscam realismo nas vozes, enquanto estúdios de jogos preferem vozes mais expressivas para seus personagens. Além disso, empresas de agentes de voz, como a LiveKit, necessitam de vozes naturais e de baixa latência, adequadas para chamadas.

Um dos métodos que a startup utilizou para expandir sua biblioteca de vozes foi solicitar aos usuários que enviassem suas próprias vozes para treinar os modelos, oferecendo compensação caso suas vozes fossem utilizadas. No entanto, essa abordagem gerou algumas controvérsias, pois alguns criadores alegaram que suas vozes foram carregadas na plataforma sem consentimento. Para lidar com essas preocupações, a Fish Audio implementou um processo de remoção que agora é automatizado, permitindo que criadores enviem uma amostra de voz ou um contrato para comprovar a propriedade de uma voz carregada, e a remoção ocorre em menos de três minutos.

Apesar disso, ainda existe o risco de que vozes de artistas sejam carregadas sem seu conhecimento, e até que o artista descubra, suas vozes podem continuar a ser utilizadas na plataforma. Os investidores, como Osuke Honda da Coreline Ventures, enfatizam que um modelo centrado na comunidade só funcionará se os criadores confiarem na plataforma. Isso implica que consentimento, transparência e atribuição devem ser incorporados ao produto desde o início, e não tratados como um pensamento posterior.

Cao mencionou que, quando a startup oferecia apenas seu produto como um projeto open-source, funcionava de maneira eficiente e não precisava de capital externo. No entanto, com o aumento do interesse dos investidores e a necessidade de desenvolver modelos mais avançados, a empresa decidiu buscar financiamento. Para o futuro, a Fish Audio planeja lançar um modelo de compreensão de áudio ainda este ano, além de um modelo de fala para fala.

O mercado de geração de fala é competitivo, com empresas como ElevenLabs, WellSaid, Cartesia, Speechify, Async e Krisp disputando o orçamento de criadores e empresas. Segundo Rico Mallozzi, da 359 Capital, controles detalhados para desenvolvedores e um treinamento de modelo mais econômico ajudarão a Fish Audio a competir melhor com grandes laboratórios de IA. Mallozzi elogiou a capacidade da equipe da Fish Audio de construir modelos de ponta que se aproximam da naturalidade das vozes humanas, destacando sua competência técnica em fechar a lacuna entre vozes artificiais e humanas.

Tags: Fish Audio, modelos de voz, Inteligência Artificial, Startup, Financiamento Fonte: techcrunch.com