Las bases de datos relacionales jamás se diseñaron para esta pregunta. Pídele a un almacén SQL que encuentre cada cuenta que comparte huella de dispositivo con una cuenta que comparte IP con una cuenta que comparte número de ruta bancaria, y estás escribiendo un self-JOIN de seis vías que escanea la tabla entera en cada paso. Nuestro equipo levantó exactamente esa línea base antes de tocar un solo motor de grafos, y la consulta o bien agonizaba o bien devolvía después de minutos eternos. Una base de datos de grafos responde lo mismo caminando por las aristas en lugar de unir filas, y ese paseo sigue siendo barato por muy profundo que llegue el anillo.
Cuatro semanas en las trincheras. Nuestro equipo se encerró con los ocho motores durante un mes. Cargamos un conjunto sintético idéntico de dos millones de cuentas sembrado con anillos de fraude conocidos, los conectamos por dispositivos compartidos, direcciones compartidas y transferencias de cuentas mula, y luego lanzamos la misma batería de recorridos y pasadas de detección de comunidades sobre cada uno. Cronometramos las consultas de seis saltos, puntuamos clústeres allí donde el motor lo permitía y empujamos un flujo de transacciones en vivo por los dos motores que presumen de ingesta en tiempo real. Donde un motor nos obligaba a escribir a mano la lógica de recorrido que un rival empaquetaba como algoritmo, tomamos nota. Aquí aterrizó cada uno.
De un vistazo
Compara las mejores herramientas lado a lado
Qué hace a las mejores bases de datos de grafos
Cómo evaluamos y probamos las aplicaciones
Una base de datos de grafos guarda los datos como nodos y las relaciones entre ellos, y almacena esas relaciones como objetos de primera clase en lugar de deducirlas en tiempo de consulta a partir de claves foráneas. Para la detección de fraude esto lo cambia todo, porque el fraude es un problema de relaciones. Una tarjeta robada suelta parece limpia. Lo que la delata es el clúster: las cuatro cuentas que hay detrás, el dispositivo desde el que todas entraron, la dirección de envío reciclada en una docena de pedidos. Recorrer esas conexiones es lo que un motor de grafos hace de forma nativa y lo que un motor relacional hace despacio.
La categoría es más ancha de lo que parece. Algunos motores de aquí son almacenes nativos de grafo de propiedades, construidos solo para recorrer. Otros son sistemas multimodelo que añadieron grafo encima de documentos, motores distribuidos pensados para escalas de billones de aristas, o capas de grafo atornilladas sobre un almacenamiento que ya operas. Todos responden preguntas sobre datos conectados. Difieren de manera brutal en cuán profundo, cuán rápido y cuánto trabajo operativo exigen.
Profundidad de recorrido sin desplomarse. La prueba de fondo es si la latencia se mantiene plana según se hace más profundo el anillo. Lanzamos el mismo patrón de anillo de fraude a dos, cuatro y seis saltos en cada motor y vigilamos dónde se doblaba la curva hacia arriba. Los motores construidos para análisis de enlaces profundos aguantaron la latencia; los optimizados para lo superficial se degradaron pasando los cuatro saltos.
Algoritmos de grafo empaquetados para puntuar. Detectar un anillo es una cosa; puntuar cuán sospechoso es, otra bien distinta. Comprobamos si cada motor traía detección de comunidades, centralidad y búsqueda de caminos como una librería que nuestros analistas pudieran invocar, o si esa lógica había que escribirla desde cero. Una librería de ciencia de datos incluida es la diferencia entre una herramienta de consulta y una plataforma de puntuación de fraude.
¿Puede el grafo seguir el ritmo de los eventos en vivo, o solo el del lote de anoche? Parte del fraude hay que cazarlo mientras el pago aún se está autorizando. Medimos si cada motor era capaz de ingerir un flujo de transacciones de forma continua y reflejarlo en los recorridos en milisegundos, o si daba por hecho cargas masivas periódicas.
Carga operativa y modelo de despliegue. Un servicio gestionado elimina el ajuste del clúster; un stack de código abierto ensamblado a mano lo exige. Pesamos cuánto trabajo de infraestructura imponía cada motor, desde el arranque en un solo nodo hasta fragmentar un clúster distribuido, y a quién le encaja de verdad cada modelo.
Lenguaje de consulta y realidad de contratación. Cypher, GSQL, Gremlin, AQL y DQL no son intercambiables, y el lenguaje que elijas decide cuán rápido entrega tu equipo y cuánto cuesta contratar. Valoramos la legibilidad de las consultas de patrones de fraude en cada uno y cuánta gente del mercado ya conoce la sintaxis.
Nuestro equipo lanzó la misma carga de anillos de fraude de punta a punta en cada motor. Cargamos el conjunto de dos millones de cuentas y luego ejecutamos una pasada de detección de comunidades para aislar las cuentas que compartían huella de dispositivo, cronometrando cuánto tardaba cada uno en sacar a la luz los anillos sembrados. En los dos motores de streaming abrimos un feed de Kafka en vivo con transacciones simuladas y vigilamos si una cuenta mula nueva aparecía en los resultados de recorrido a los pocos milisegundos de llegar. En los motores distribuidos añadimos un nodo a mitad de prueba para confirmar que el clúster reequilibraba sin recargar. Los motores que se llevaron los primeros puestos convirtieron datos conectados en anillos de fraude con nombre y apellidos usando el mínimo de código de recorrido escrito a mano.
La mejor base de datos de grafos para ciencia de datos de anillos de fraude
Neo4j
Pros
- La librería Graph Data Science trae detección de comunidades, centralidad y búsqueda de caminos como algoritmos invocables
- Cypher es tan legible que un patrón de anillo de fraude parece el diagrama que dibujaste en la pizarra
- El mayor ecosistema, documentación y cantera de talento de cualquier base de datos de grafos
- AuraDB elimina casi toda la operación del clúster para equipos en la nube
Cons
- Las gamas Enterprise y Graph Data Science se encarecen enseguida
- Escalar escrituras en un clúster muy grande cuesta más que con rivales shared-nothing
- La Community Edition no trae clustering, copias en caliente ni control de acceso por roles
El rey de la categoría. La función que sienta a Neo4j en el trono de esta lista es la librería Graph Data Science, y para el trabajo antifraude fue lo más útil que probó nuestro equipo entre los ocho motores. En vez de escribir a mano la lógica de recorrido para hallar clústeres sospechosos, nuestros analistas invocaron un algoritmo de detección de comunidades directamente sobre el grafo cargado, y aisló en una sola pasada los anillos sembrados de cuentas que compartían huella de dispositivo. La puntuación de centralidad ordenó después qué cuentas se sentaban en el centro de cada anillo. Eso convierte la detección de fraude en una tubería de puntuación, que es justo lo que quiere un equipo de ciencia de datos.
Cypher es la otra razón de su puesto. Es un lenguaje declarativo de coincidencia de patrones, y el patrón que escribes en pantalla imita la forma del fraude que persigues: unas líneas describen cuentas ligadas a un dispositivo compartido ligado a una dirección compartida. Cuando cargamos el conjunto de dos millones de cuentas y pedimos cada cuenta a seis saltos de una mula conocida, la consulta se leía como una frase, no como un bucle anidado. Neo4j creó Cypher, hoy es un estándar abierto, y esa legibilidad explica por qué la cantera de talento es la mayor de la categoría. Contratar aquí a un ingeniero de grafos que ya conoce el lenguaje es de verdad más sencillo que en cualquier otro sitio de esta lista.
Alrededor del núcleo, el ecosistema trabaja de lo lindo. AuraDB, el servicio gestionado en la nube, eliminó la operación del clúster por completo durante las pruebas: levantamos una instancia alojada y estábamos consultando en minutos, sin infraestructura que afinar. La documentación es la más profunda del campo y la comunidad es tan grande que casi cualquier duda de modelado de fraude ya tiene respuesta en algún rincón.
Los costes son concretos y toca decirlos claros. Las licencias Enterprise y las gamas Graph Data Science suben rápido en cuanto abandonas la edición gratuita, y en un despliegue grande la factura se convierte en una partida seria. La Community Edition es de verdad limitada: sin clustering, sin copias en caliente, sin control de acceso por roles, lo que la descarta para casi cualquier sistema antifraude en producción. Y el escalado de escrituras es su debilidad estructural. Si tu grafo de transacciones se dispara a los billones de aristas con mucha escritura, un motor shared-nothing pensado para esa escala lo adelantará. Para los equipos de ciencia de datos de fraude y riesgo a los que apunta, nada de eso cambia la recomendación. Es la opción por defecto, y se la gana con creces.
La mejor base de datos de grafos para puntuación en tiempo real de enlaces profundos
TigerGraph
Pros
- Aguanta recorridos de más de seis saltos donde los motores superficiales se arrastran
- El procesamiento masivamente paralelo mantiene baja la latencia según crecen la profundidad y el grafo
- GSQL es Turing-completo, así que la lógica de puntuación vive dentro de la base, no en un servicio aparte
Cons
- GSQL es potente pero desconocido y lleva su tiempo aprenderlo
- Ecosistema y comunidad más pequeños que los de Neo4j
- Operar y afinar un clúster distribuido exige experiencia real de infraestructura
Profundidad contra librería. Donde Neo4j te da una librería de ciencia de datos, TigerGraph te da profundidad de recorrido en bruto, y ese es el marco de toda esta reseña. La fuerza de Neo4j es puntuar clústeres que un analista ya ha sacado a la luz. La fuerza de TigerGraph es responder la pregunta profunda lo bastante rápido para que la respuesta llegue antes de que el pago se liquide. En nuestra prueba la diferencia asomó pasado el cuarto salto. Cuando empujamos el mismo patrón de anillo de fraude de cuatro a seis saltos, los motores superficiales doblaron la latencia hacia arriba mientras TigerGraph se mantuvo casi plano. No es un eslogan: es lo que el motor de procesamiento masivamente paralelo está construido para hacer, repartiendo un único recorrido por la capa de almacenamiento y de cómputo para que la profundidad deje de ser el enemigo.
Para una red de tarjetas que puntúa una transacción mientras se autoriza, esa planitud es toda la propuesta de valor. Recorrimos usuarios, tarjetas, dispositivos y comercios para marcar si una transacción en vuelo conectaba con un anillo de fraude conocido, y la consulta volvió dentro de la ventana que da un pago real. La misma arquitectura sirve al trabajo antiblanqueo, donde un investigador mapea flujos de fondos por muchas cuentas intermediarias para destapar patrones de estratificación, y los recorridos superficiales sencillamente no llegan tan lejos.
GSQL es el segundo diferenciador de TigerGraph y su coste más empinado. Es un lenguaje de consulta y procedimientos Turing-completo, lo que significa que la analítica de puntuación basada en acumuladores corre dentro de la base y no en un servicio externo que trasiega datos de un lado a otro. Durante las pruebas codificamos una rutina de puntuación de fraude directamente en GSQL y la ejecutamos in situ. El pero es la curva de aprendizaje. GSQL no se parece en nada a Cypher, y nuestro equipo dedicó tiempo de verdad a soltarse antes de que la potencia rindiera. Sumado a una comunidad más pequeña y a la pericia de infraestructura que exige un clúster distribuido, TigerGraph le encaja mal a un equipo chico que quiere estar consultando el viernes. Para una gran entidad financiera que puntúa transacciones a volumen, es el motor más rápido de aquí a las profundidades que importan.
La mejor base de datos de grafos para grafos de fraude gestionados en AWS
Amazon Neptune
Pros
- Totalmente gestionado: copias automáticas a S3, réplicas de lectura y replicación multi-AZ
- Soporta Gremlin, openCypher y SPARQL, así el equipo elige la sintaxis que domina
- La integración nativa con IAM y VPC simplifica la seguridad dentro de AWS
- El soporte de openCypher y Gremlin facilita migrar desde otros motores de grafo de propiedades
Cons
- Atado a AWS, sin opción de despliegue portable ni on-premise
- Sin librería de algoritmos de ciencia de datos de grafos como la de Neo4j
- El rendimiento de escritura queda ligado a una única instancia primaria
Para los que ya viven en AWS. Si tu equipo de ingeniería ya habita dentro de AWS, Neptune es el camino de menor resistencia, y esa es la lente de toda esta reseña. Para un marketplace que enlaza cuentas, métodos de pago y direcciones de envío para detectar vínculos con fraude conocido, el atractivo no es un algoritmo estrella: es que no hay clúster que operar. Durante las pruebas aprovisionamos una instancia, dejamos que IAM gestionara la autenticación, mantuvimos el tráfico dentro de la VPC y no tocamos ni un script de copia porque Neptune las vuelca a S3 de forma automática. Para una casa centrada en AWS, esa eliminación del trabajo operativo es la razón entera para elegirlo.
El soporte de tres lenguajes ayuda de verdad a migrar. Neptune habla Gremlin, openCypher y SPARQL, de modo que un equipo que llega desde un motor de grafo de propiedades puede traer sus consultas openCypher con reescritura mínima, y un equipo orientado a RDF puede usar SPARQL contra el mismo almacén. Lanzamos nuestros recorridos de anillos de fraude en openCypher y volvieron con latencia de milisegundos en los patrones de profundidad baja a media que suelen necesitar los grafos de identidad y de fraude de marketplace. El escalado de lecturas con réplicas y la disponibilidad multi-AZ estuvieron sólidos en toda la prueba.
Dos limitaciones deciden si Neptune encaja. La primera: corre solo dentro de AWS. Si la portabilidad entre nubes o un requisito on-premise asoma en tu futuro, Neptune es la elección equivocada, sin matices. La segunda: no trae librería de ciencia de datos de grafos, así que la detección de comunidades y la puntuación de centralidad que venían gratis en Neo4j hay que construirlas o ejecutarlas en otra parte para Neptune. Añade el techo de escritura de una sola primaria, que limita el escalado con mucha escritura, y el perfil queda claro: Neptune es excelente para equipos de AWS que quieren grafos de identidad y fraude gestionados con lenguajes familiares, y encaja mal con quien necesite portabilidad o puntuación de fraude dentro de la base.
La mejor base de datos de grafos para detección en memoria por streaming
Memgraph
Pros
- Recorridos sub-milisegundo sobre datos calientes alojados en RAM
- Consumidores nativos de Kafka, Pulsar y Redpanda actualizan el grafo sin código pegamento
- Compatible con Cypher, así que los equipos con experiencia en Neo4j se suben rápido
Cons
- El coste de RAM escala directo con el tamaño del grafo, al revés que los motores en disco
- Ecosistema y herramientas más pequeños que los del líder del mercado
- Los grafos que superan la memoria necesitan configuración de nivel de almacenamiento y pierden la ventaja de velocidad
El evento que apareció al instante. Cuando abrimos un feed de Kafka en vivo con transacciones simuladas hacia Memgraph, una cuenta mula nueva asomó en los resultados del recorrido casi en el mismo instante en que el evento aterrizó. Esa sola prueba resume por qué existe Memgraph. Sus conectores de streaming nativos consumen Kafka, Pulsar o Redpanda de forma directa, de modo que el grafo nunca es una foto del lote de anoche: refleja el pago que se liquidó hace cuatro segundos. Para la detección de fraude que debe actuar sobre los eventos según ocurren y no en un barrido nocturno, esa actualización continua es la clave.
La velocidad nace de mantener el grafo de trabajo en RAM. El motor de almacenamiento en C++ de Memgraph guarda los datos calientes en memoria y entregó recorridos sub-milisegundo en nuestras consultas de detección de anillos, con holgura más rápido que los motores en disco sobre los mismos patrones. Y como habla Cypher, el mismo lenguaje que usa Neo4j, nuestro equipo reutilizó el conocimiento de consultas directamente y fue productivo sin aprender una sintaxis nueva. Una plataforma de pagos que ingiere transacciones en streaming y puntúa patrones de anillo con cada evento es el encaje de manual.
La memoria es también la restricción que define el techo de Memgraph. El coste de RAM escala en línea con el tamaño del grafo, así que un grafo que crece a las decenas de miles de millones de aristas convierte la memoria en la partida presupuestaria que ata, algo que un motor en disco evita. Pasa de la memoria disponible y entras en configuración de nivel de almacenamiento que te devuelve la ventaja de velocidad en memoria por la que compraste el producto. El ecosistema y las herramientas también son más delgados que los de Neo4j. Para un equipo antifraude que vive del streaming, necesita detección en vivo y puede dimensionar su grafo caliente para que quepa en RAM, Memgraph es el mejor motor en tiempo real de esta lista. Para un grafo persistente muy grande con presupuesto fijo, es la herramienta equivocada.
La mejor base de datos de grafos para datos de investigación multimodelo
ArangoDB
Pros
- Un solo motor cubre grafo, documento JSON y clave-valor
- Una única consulta AQL abarca recorridos de grafo y filtros de documento, sin joins entre sistemas
- Buen encaje para esquemas que evolucionan y datos de investigación híbridos
Cons
- La amplitud multimodelo cambia rendimiento pico de grafo por flexibilidad
- El sharding avanzado SmartGraphs vive tras la gama enterprise de pago
- Los recorridos muy profundos van por detrás de los motores dedicados solo a grafos
Todo en un mismo sitio. La función que define a ArangoDB es su núcleo multimodelo, y para la investigación de fraude resuelve un problema concreto y molesto: las relaciones y los atributos ricos suelen vivir en dos bases de datos distintas. ArangoDB guarda grafo, documento JSON y clave-valor en un solo motor, y una única consulta AQL puede recorrer las relaciones entre cuentas mientras filtra por los campos de documento que se sientan en esos mismos registros. Durante las pruebas nuestros analistas caminaron un clúster sospechoso y lo filtraron por antigüedad de la cuenta e importe de la transacción en una sola consulta, sin un viaje de ida y vuelta a un almacén de documentos aparte para enriquecer los resultados.
AQL es lo que hace que eso funcione. Es un lenguaje al estilo SQL que expresa juntos los recorridos de grafo y los filtros de documento, así que una investigación que necesita contexto de relaciones y detalle de atributos no se abre en abanico entre sistemas. Para un equipo con un esquema que cambia rápido, mantener grafo y documento en el mismo motor también significa que el modelo puede moverse sin migrar entre dos almacenes. En el frente operativo, ArangoGraph ofrece una opción gestionada en la nube, y el sharding SmartGraphs coloca juntos los vértices relacionados para recorridos distribuidos más rápidos.
ArangoDB paga su flexibilidad en velocidad de recorrido pico. Un motor de grafo nativo y dedicado le pasará por encima en consultas muy profundas y de muchos saltos, y en nuestra prueba de anillo a seis saltos quedó por detrás de los especialistas. El potente sharding SmartGraphs vive tras la gama enterprise de pago, así que la historia de rendimiento distribuido exige licencia. No es el motor para un equipo cuyo único trabajo es la puntuación de fraude por enlace profundo. Es la elección pragmática para un equipo antifraude que quiere relaciones y atributos en un mismo sistema y valora no operar dos bases de datos por encima del último incremento de velocidad de recorrido.
La mejor base de datos de grafos para grafos de transacciones de billones de aristas
NebulaGraph
Pros
- Escala a grafos enormes con crecimiento lineal de capacidad
- El sharding automático reparte vértices y aristas sin colocación manual de datos
- Código abierto con un motor nativo en C++ sobre RocksDB para alta escritura
Cons
- Operar un clúster distribuido añade complejidad operativa real
- Ecosistema, herramientas y comunidad más pequeños que los de los líderes
- El valor solo aparece a gran escala; los despliegues pequeños cargan con el peaje del clúster para poco
Cuando el grafo ya no cabe. Si tu grafo de transacciones ha desbordado lo que aguanta un solo servidor, NebulaGraph está hecho justo para tu problema. Este es el motor para organizaciones cuyos grafos de fraude o sociales se van a los miles de millones de vértices y billones de aristas, donde la pregunta ya no es cuán profundo llega un recorrido sino si el grafo cabe siquiera. Su arquitectura shared-nothing significa que añadir un nodo aumenta capacidad y rendimiento a la vez sin reescribir el diseño de almacenamiento ni el código de la aplicación. Cuando añadimos un nodo a mitad de prueba, el clúster reequilibró y siguió sirviendo consultas sin recargar, que es el comportamiento que un grafo a esta escala exige.
El sharding automático es lo que hace manejable esa escala. El motor particiona vértices y aristas por el clúster por su cuenta, así que los operadores no van colocando datos a mano según crece el grafo. Por debajo, un motor nativo en C++ sobre RocksDB entrega la alta escritura que necesita un grafo de transacciones masivo mientras sostiene recorridos de saltos múltiples eficientes. Para una gran plataforma que guarda un grafo de fraude enorme y lo recorre en busca de clústeres sospechosos a escala, NebulaGraph mantiene una latencia predecible allí donde los motores de un solo servidor sencillamente se quedan sin sitio.
El peaje es el reverso de esa escala. Operar un clúster distribuido es de verdad más complejo que levantar una base de un solo nodo, y las herramientas y la comunidad son más delgadas que las de Neo4j o Neptune. Para un grafo modesto la carga operativa supera cualquier beneficio; estarías pagando peaje de clúster por una capacidad que nunca usas. NebulaGraph se gana su sitio solo en el extremo de los billones de aristas. Para los operadores de muy gran escala a los que apunta, el escalado lineal merece la operación que exige.
La mejor base de datos de grafos para equipos de aplicaciones nativas de GraphQL
Dgraph
Pros
- El endpoint GraphQL nativo elimina el código pegamento entre la capa de aplicación y el grafo
- El diseño distribuido fragmenta predicados y escala en horizontal
- Las transacciones ACID dan consistencia en todo el clúster
Cons
- Menos algoritmos de grafo integrados que los motores centrados en analítica
- Los cambios de propiedad y de hoja de ruta han añadido incertidumbre
- Encaje más flojo para recorridos analíticos profundos que los motores de ciencia de datos
Aplicación contra analítica. Pon a Dgraph al lado de Neo4j y el reparto es limpio: Neo4j está hecho para analistas que puntúan anillos de fraude, Dgraph está hecho para equipos de aplicaciones que sirven datos conectados a través de una API. Donde Neo4j te pide aprender Cypher, Dgraph sirve una API GraphQL de fábrica, así que los ingenieros de front-end y de aplicación consultan el grafo en el lenguaje que su app ya habla. Durante las pruebas apuntamos un cliente GraphQL directo a Dgraph y sacamos datos de cuentas conectadas sin capa de traducción en medio. Para un equipo de producto ya estandarizado en GraphQL, esa eliminación del código pegamento es el atractivo entero.
El motor respalda esa interfaz con fundamentos de producción. DQL, un lenguaje derivado de GraphQL, añade las operaciones específicas de grafo que la especificación base de GraphQL no trae, y la capa de almacenamiento fragmenta predicados por los nodos mientras ofrece transacciones ACID para lecturas y escrituras consistentes. Un servicio que guarda usuarios, productos y relaciones y los consulta bajo carga obtiene latencia baja y escala horizontal, que es un encaje real para backends de aplicaciones de datos conectados en tiempo real.
Donde Dgraph se queda corto para el propósito de este artículo es en la analítica de fraude en concreto. Trae muchos menos algoritmos de grafo integrados que Neo4j o TigerGraph, así que la detección de comunidades y la puntuación de centralidad que anclan una tubería de detección de fraude no están de forma nativa; esa lógica la construirías tú. Los recorridos analíticos profundos tampoco son su fuerte frente a los motores orientados a ciencia de datos. El gobierno y la hoja de ruta se han movido con los cambios de propiedad, lo que suma una capa de incertidumbre que un equipo de riesgo debe sopesar. Dgraph es un excelente backend de grafo para un equipo de aplicaciones que va primero con GraphQL. Como motor dedicado a la puntuación de fraude, no es la herramienta.
La mejor base de datos de grafos para despliegues distribuidos de código abierto
JanusGraph
Pros
- Totalmente de código abierto bajo una licencia Apache 2.0 permisiva
- Reutiliza backends de almacenamiento Cassandra, HBase o Bigtable existentes
- Compatibilidad estándar con Gremlin y TinkerPop
Cons
- Operar el stack ensamblado es complejo y en gran parte a mano
- El rendimiento depende mucho del backend elegido y de su ajuste
- Sin oferta gestionada oficial en la nube, toda la operación cae en tu equipo
Empecemos por el defecto. Arranquemos por la pega, porque decide todo en JanusGraph: no hay servicio gestionado, y ensamblas la base de datos tú mismo. Levantarla significa cablear un backend de almacenamiento, un índice externo y la capa de grafo en un conjunto que funcione, y cada pieza de eso es de tu equipo para operar y afinar. Para un equipo antifraude que quiere estar consultando un grafo la semana que viene, este es el punto de partida equivocado, y no vamos a fingir lo contrario.
Lo que recibes a cambio es control y coste de licencia cero. JanusGraph es totalmente de código abierto bajo Apache 2.0, y superpone el ampliamente soportado lenguaje de recorrido Gremlin sobre backends de almacenamiento enchufables: Cassandra, HBase, Bigtable o BerkeleyDB. Para un equipo que ya opera uno de esos almacenes de big data, esa reutilización es el atractivo de verdad. Durante las pruebas corrimos un grafo de propiedades grande sobre un backend de Cassandra y lo consultamos con Gremlin para análisis de relaciones, y funcionó como se anuncia una vez configurado el stack. La integración con índices externos como Elasticsearch, Solr o Lucene añade indexación de texto completo y geográfica junto a los recorridos.
El rendimiento es solo tan bueno como el backend que elijas y lo bien que lo afines, así que los resultados varían mucho más que con un motor autocontenido. Esta es la elección para equipos de plataforma de big data que ya operan un stack de almacenamiento distribuido, quieren esquivar las licencias comerciales de bases de datos de grafos y tienen la pericia de infraestructura para ensamblar y operar el conjunto entero. Para quien quiera detección de fraude llave en mano, mira más arriba en esta lista.
Empareja el motor con la restricción que de verdad te ata
No vayas de compras buscando la base de datos de grafos más rápida. Ve a por la que elimina tu cuello de botella concreto. Si tu equipo antifraude está poblado de científicos de datos que quieren puntuar clústeres en lugar de escribir recorridos a mano, los motores con librerías de algoritmos empaquetadas se pagan solos en semanas. Si necesitas bloquear un pago fraudulento antes de que se complete la autorización, solo los motores de enlace profundo y de streaming en memoria merecen entrar en tu lista corta. Si tu organización ya vive dentro de una nube o ya opera un stack de almacenamiento de big data, las opciones gestionadas y de backend enchufable te dejan saltarte casi todo el peaje operativo.
Casi todos estos motores ofrecen una capa gratuita, una edición community o un núcleo totalmente de código abierto. Carga un trozo de tu propio grafo de transacciones en dos finalistas, siémbralo con un patrón de fraude que ya entiendas y lanza la consulta de seis saltos con la que tu base relacional se atraganta. El motor que te entregue el anillo más rápido, en un lenguaje que tu equipo pueda mantener de verdad, es sobre el que hay que estandarizar. Y punto.

