La investigación detrás de Qelly

Inteligencia que fundamenta cada decisión.

Entrenamos agentes financieros para investigar una empresa, descubrir alternativas factibles y defender una decisión con evidencia.

Lee la tesis de investigación
Búsqueda conceptual de decisiones: muchas propuestas convergen en alternativas factibles verificadas
Propuestas candidatasVerificación financieraAlternativas factibles
Una vista conceptual de la búsqueda de decisiones. Solo las propuestas que cumplen con la evidencia y las restricciones establecidas se convierten en alternativas.

Nuestra tesis

Las mejores respuestas empiezan con mejores decisiones.

Un agente financiero útil debe saber qué investigar, qué herramientas usar y cuándo la evidencia debe cambiar su recomendación.

Estamos desarrollando un agente especializado basado en Qwen en torno a un modelo explícito de la empresa: efectivo, fechas, obligaciones, acciones disponibles y restricciones. Los registros financieros y los resultados calculados siguen siendo la base de las conclusiones.

Las representaciones aprendidas podrían ayudar a descubrir combinaciones útiles. Cada propuesta debe decodificarse en una acción que podamos verificar, calcular y explicar. Una respuesta fluida por sí sola no establece factibilidad.

Conoce el ejemplo del producto

De la evidencia a una decisión revisable.

Cada parte del sistema tiene una función específica.

  1. 1

    Fundamentar el estado

    Documentos, cuentas y marcas de tiempo se convierten en hechos financieros estructurados, con su procedencia y sus faltantes relevantes.

  2. 2

    Proponer e investigar

    El agente hace preguntas dirigidas y propone acciones tipadas. La búsqueda explora combinaciones y escenarios de estrés.

  3. 3

    Calcular y verificar

    Herramientas independientes calculan los resultados de efectivo y verifican evidencia, permisos, obligaciones y restricciones duras.

  4. 4

    Explicar y revisar

    Un informe de decisión conserva las alternativas y la incertidumbre para la revisión humana. Los casos aceptados pueden mejorar el entrenamiento.

Un producto, un programa de investigación independiente

Aprender de la evidencia.
Mejorar el mismo flujo de trabajo.

Qelly se lanzará a través de interfaces de asistentes ya conocidas. Más adelante, modelos especializados podrán mejorar herramientas seleccionadas de Qelly sin pedir a los clientes que cambien su forma de trabajar.

Nuestro proceso de entrenamiento excluye de forma predeterminada las solicitudes recibidas a través de la plataforma anfitriona y las respuestas que esta genera. El material de investigación sigue un procedimiento aparte de procedencia y derechos: casos originales verificados, datos públicos elegibles, registros con autorización recabados de manera independiente y anotaciones de expertos.

La aprobación de un revisor es retroalimentación, no prueba de que algo sea correcto. Los resultados reales alimentan el registro, pero no revelan cómo habrían resultado las alternativas que nunca se tomaron.

El despliegue requiere mejor calidad en flujos de trabajo definidos, o una calidad comparable a un costo sustancialmente menor, con un manejo confiable de restricciones e incertidumbre. Los métodos cuánticos se evalúan donde resultan útiles; no son un requisito previo para el lanzamiento.

Programa de entrenamiento

Enseñar el procedimiento. Medir el juicio.

Empezar con el modelo sin modificar, usando las mismas herramientas y evidencia. Después, cambiar el objetivo de entrenamiento solo cuando los datos y la evaluación lo respalden.

Ajuste fino supervisado

Experimentos iniciales

Los adaptadores LoRA sobre una base Qwen cuantizada aprenden de demostraciones verificadas: solicitar información, llamar a una herramienta, comparar acciones factibles y producir una conclusión respaldada. El contenido del usuario y las observaciones de las herramientas son contexto, no objetivos de salida fabricados.

Aprendizaje por refuerzo multiturno

Planeado

GRPO comparará trayectorias nuevas en un entorno financiero controlado. Verificaciones independientes califican la corrección numérica, los faltantes relevantes, el cumplimiento de restricciones y la utilidad de la decisión.

Aprendizaje por preferencias de expertos

Condicional

DPO se reserva para ejemplos confiables de tipo preferido/rechazado, como explicar con claridad la condición de un covenant. Una calificación del modelo sin verificar no basta para establecer la respuesta preferida.

Qué contaría como progreso

Una decisión financiera tiene que superar la prueba.

Evaluamos flujos de trabajo completos, con la misma evidencia disponible, las mismas herramientas y el mismo presupuesto de inferencia. Los modelos generales y Qwen sin modificar siguen siendo comparaciones activas.

Compromisos de evaluación
Pregunta Evidencia que exigimos
¿Los números son correctos? Cálculos ejecutables con montos, unidades y fechas verificados.
¿Es factible la recomendación? Las restricciones duras se respetan. El financiamiento o el consentimiento sin confirmar se mantienen como condicionales.
¿Preguntó lo que importa? Se identifican los datos faltantes relevantes; las preguntas irrelevantes no suman puntos en la evaluación.
¿Generaliza? Conjuntos reservados por empresa, documento fuente, periodo y familia de escenarios; los ejemplos relacionados se mantienen juntos.
¿Ayudó el entrenamiento? Modelos base, con prompts y entrenados, comparados en casos congelados, con registro de costo y latencia.

Búsqueda clásica y con asistencia cuántica

¿Una mejor búsqueda puede revelar un mejor siguiente paso?

Estamos investigando si las representaciones aprendidas y el recocido cuántico de D-Wave pueden descubrir combinaciones de acciones útiles o escenarios de estrés que otros métodos pasan por alto.

El recocido cuántico directo requiere una formulación cuadrática binaria adecuada. Los solucionadores híbridos se evalúan por separado. Cada candidato devuelto se somete a las mismas verificaciones financieras independientes.

La prueba: mejores decisiones factibles, una cobertura más amplia de escenarios útiles o un aprendizaje más eficiente frente a una búsqueda clásica sólida a un costo total comparable.

Hipótesis de investigación · ventaja no establecida

Registro de investigación

La evidencia va primero.

Nuestro primer ciclo de entrenamiento es un piloto local acotado. No se han demostrado mejoras en benchmarks públicos, resultados con clientes ni ventaja cuántica. Los resultados medidos solo tienen cabida aquí cuando la ejecución, la división de datos y la evaluación puedan rastrearse.

FundamentosEjemplo determinista de decisión de efectivoRevisa el cálculo
En desarrolloEntrenamiento del agente CFO y evaluación comparativa

Línea base → adaptador supervisado → conjunto de prueba reservado y congelado. Verificaciones numéricas independientes acompañan la revisión cualitativa del modelo.

Siguiente evidenciaFlujos de trabajo con empresas colaboradoras

Entradas autorizadas y conclusiones revisadas por asesores, seguidas de retroalimentación operativa real.

Fundamentos técnicos

Nuestra investigación se basa en métodos de entrenamiento establecidos y en tareas financieras verificables de forma independiente.

Para investigadores, socios e inversionistas

Ayuda a construir inteligencia financiera que podamos poner a prueba.

Inicia una conversación