For the complete documentation index, see llms.txt. This page is also available as Markdown.

Audio

Conecta proveedores especializados en procesar audio a texto y viceversa

Normalmente, los servicios de audio de IA pura no admiten capacidades agénticas completas como herramientas y conversación. Por lo tanto, puedes usar estos componentes como servicios independientes en un flujo de trabajo agéntico, o usarlos dentro de un agente, ya que implementan la AIProviderInterface interfaz. En este caso puedes beneficiarte de funciones del flujo de trabajo agéntico como middleware y guardrails.

Estos componentes pueden ser útiles para crear asistentes de voz locales para una interacción manos libres con los modelos. El flujo típico implica capturar audio, transcribirlo a texto con un servicio separado de Speech-To-Text (STT), enviar ese texto a un agente para su procesamiento y luego usar Text-to-Speech (TTS) para leer la respuesta.

Como proveedor de agente

namespace App\Neuron;

use NeuronAI\Agent\Agent;
use NeuronAI\Chat\Messages\UserMessage;
use NeuronAI\Providers\AIProviderInterface;
use NeuronAI\Providers\OpenAI\Audio\OpenAITextToSpeech;

class MyAgent extends Agent
{
    protected function provider(): AIProviderInterface
    {
        return new OpenAITextToSpeech(
            key: 'OPENAI_API_KEY',
            model: 'gpt-4o-mini-tts',
            voice: 'alloy',
        );
    }
}

// Ejecutar el agente
$message = MyAgent::make()
    ->chat(new UserMessage("¡Hola!"))
    ->getMessage();

// Recuperar la parte de audio del mensaje (está en formato base64)
$audioBase64 = $message->getAudio()->getContent();

// Guardar el archivo de audio
file_put_contents(__DIR__.'/assets/speech.mp3', base64_decode($audioBase64));

Uso directo

Audio de OpenAI

Texto a voz

Voz a texto

ElevenLabs

Texto a voz

Voz a texto

ZAI

Voz a texto

Última actualización