Morphik
Morphik
Active

Morphik

Morphik est une plateforme d’ingestion et de recherche documentaire multimodale pour applications IA. L’analyse sépare Developer Cloud, Morphik Core sous BSL et la nouvelle activité santé.

76

Views

0

Likes

Jan 2026

Added

morphik.ai

Lien du projet

Tags

MorphikRAG multimodalrecherche documentaireRAG source-availableColPalibase de données IA

Product Preview

A quick visual look at Morphik before you visit the official site.

Published 1/21/2026
Morphik screenshot

Editorial Review

About Morphik

Morphik désigne ici dev.morphik.ai et morphik-org/morphik-core : un document store pour fichiers non structurés, recherche textuelle/visuelle et applications IA. Le site corporate vend désormais des AI workers pour établissements de soins, tout en redirigeant explicitement les développeurs vers une plateforme distincte.

Les chiffres d’établissements, de NOI et d’automatisation du produit santé ne constituent pas des benchmarks de retrieval. Cette analyse porte sur ingestion, recherche multimodale, permissions, déploiement, licence, prix, confidentialité et validation privée.

Évaluation de production Morphik du corpus à la validation
Schéma éditorial original AIDreamHub : test d’acceptation, pas benchmark fournisseur.

Périmètres : entreprise, Cloud et Core

CoucheVérifiéLimite
EntrepriseAI workers pour établissements de soins en 2026Centres/NOI ne sont pas un benchmark retrieval
Developer CloudIngestion, requêtes, Research Agent, collaborationQuotas, backup, VPC et support selon offre
Morphik CoreRepo Python, retrieval multimodal, SDK/API, Console, MCPSource-available BSL 1.1, pas open source OSI
MaintenanceNon archivé, 822 commits, push 23-07-2026Actif, mais APIs Releases/tags vides
LicenceLICENSE racine : Morphik 0.1.0, passage Apache-2.0 le 18-06-2029Grant production sous $2 000/mois attribuables ; au-delà licence commerciale

La terminologie officielle varie : description GitHub et pricing parlent parfois d’open source, README et LICENSE racine de source-available. La BSL précise ne pas être une licence open source. La mention MIT au bas de DOCKER.md contredit la racine et ne suffit pas à classer le projet MIT. Le juridique examine la licence du commit réellement déployé.

Activité ne signifie pas release reproductible. À la date de revue, APIs Releases et tags ne renvoyaient rien. La production fige SHA complet, digests, parser, embedding, reranker et générateur, conserve une SBOM et assigne upgrade, rollback et patching.

Une adoption sérieuse exige la reproductibilité, pas seulement un score de recherche. Requête, filtres, meilleurs chunks, page d’origine, configuration des modèles et commit doivent former une même trace. Après reconstruction de l’index, on mesure l’écart. Une moyenne peut masquer les échecs graves sur tableaux, plans ou contrats scannés ; chaque classe documentaire mérite un seuil minimal.

Comparer cloud et auto-hébergement ne se limite pas au prix mensuel. File d’ingestion, réindexation, GPU, sauvegardes, supervision, astreinte, contrôle de licence et fournisseurs de modèles doivent figurer dans le même calcul. L’auto-hébergement augmente le contrôle, mais transfère authentification, capacité, restauration et patching à l’équipe.

La matrice de sécurité inclut les fichiers homonymes d’autres tenants, les métadonnées proches, les requêtes après suppression, les changements de rôle et les instructions malveillantes contenues dans les documents. Refuser de répondre peut être le seul résultat correct. Une citation ne vaut succès que si elle soutient réellement l’affirmation.

Le meilleur argument pour Morphik est l’interface unifiée entre images, cycle de vie documentaire et retrieval. Le principal argument contre est la gouvernance : BSL, absence de releases formelles et liens publics de confidentialité indisponibles exigent contrat, versions figées et contrôles internes. Les deux doivent apparaître dans la même note de décision.

Ce que fournit la plateforme développeur

ÉtapeCapacité documentéeTest interne
IngestionPDF, images, vidéo ; Google Suite, Slack, ConfluenceFormats, chiffrement/corruption, langue OCR, erreurs
ReprésentationChunks, metadata, images, ColPaliGraphiques, tableaux, layout, contexte page
RetrievalSémantique/multimodal, filtres, batch chunks/imagesRecall@k, classement, filtres, provenance
Génération/AgentCompletions, Research Agent, MCPSéparer retrieval/réponse, mesurer abstention
IsolationScopes user/folder, URI par appTests cross-tenant, IDs, suppressions
ExploitationCloud, Docker, inférence localeEndpoints, stockage, secrets, backup, upgrade

L’intérêt spécifique est une surface pour documents visuels : ingestion, retrieval de chunk ou image, filtre metadata et passage de preuves au modèle. Cela réduit le glue code par rapport à parser, embeddings, vector store, reranker, auth et outil agent assemblés séparément. L’intégration concentre aussi les échecs : changer parser ou modèle peut modifier chunks et classement.

Retrieval et réponse sont deux métriques. Même avec la bonne preuve en top-k, le générateur peut halluciner ; sans elle, il peut deviner. On conserve chunk ID, page/coordonnées, image, score, filtre et configuration. HotpotQA/RAGAS et science graphs montrent un chemin d’évaluation, pas un leaderboard pour scans, factures ou manuels privés multilingues.

Offres cloud et auto-hébergement

OptionPublic au 20-08-2026Usage
Free$0, 200 pages, 3 appels Research Agent/mois, file GPU partagéePrototype
Pro$59/mois, 2 000 pages, 30 appels, $0,03/page extra, backup 7 jours, 5 utilisateursPetite évaluation
Team$799/mois, 10 Go, requêtes illimitées, $2,50/GPU-h, VPC, SSO, audit, PITR 14 jours, SLA 99,9 %Équipe ; $0,03/page après 10 Go
EnterpriseCustom, BYO cloud/on-prem, BAA, eval/modèle/outil customContrat déterminant
Self-host CoreDocker recommande 8 Go+ RAM/10 Go disque, PostgreSQL/pgvector, Ollama optionnelPlus de contrôle et de responsabilité

Les prix évoluent et une page n’est pas une unité constante. Plan scanné, tableau financier dense et slides coûtent différemment. Il faut compter file, réingestion, stockage, GPU, requêtes et coût par réponse acceptée. Le tableau est un snapshot, pas un devis.

Auto-héberger ne garantit pas la localité. Ollama local est possible, mais des endpoints distants peuvent être configurés. Tout trafic sortant est inventorié. Aucun bypass auth de développement n’est exposé ; secrets, TLS, réseau, backup cohérent pgvector/objets et restauration sont testés.

Évaluation de production reproductible

  1. Figer SHA, digests, parsers et modèles.
  2. Créer un corpus de 30–100 PDF, scans, tableaux, graphiques, images, vidéos, langues, révisions et suppressions.
  3. Labelliser questions, pages/chunks/images, filtres, tenant et abstention.
  4. Mesurer succès, erreur, file, extraction, metadata, doublons et réingestion.
  5. Évaluer d’abord retrieval : Recall@k, MRR/nDCG, hit visuel, précision des filtres.
  6. Tester mauvais user, folder, app, tenant, ID deviné et document supprimé.
  7. Noter séparément citations, groundedness, complétude, abstention, injection et acceptation humaine.
  8. Tester update/delete, rotation, restore, rebuild et panne fournisseur.
  9. Comparer même corpus avec Docling/Unstructured et RAG managé.
  10. Décider par coût accepté, p50/p95, effort, incidents et licence.

Limites de précision, sécurité et exploitation

RisqueCauseContrôle
Transfert benchmarkDataset public ≠ documents privésPublier données/labels/SHA/modèles/résultats et répéter
Hallucination visuelleTexte, valeur ou relation inventésPage/coordonnées et revue humaine
Fuite de droitsChunk d’un autre tenantScope serveur, deny tests, audit, isolation
Prompt injectionDocument manipule agentDocument=data, outils isolés, allowlist
Dérive suppressionObjet/chunk/embedding/cache divergentVérifier update/delete partout
EgressCore local utilise modèles distantsInventaire, redaction, DPA, local
Licence/releaseBSL et pas de versions formellesJuridique, SHA, SBOM, fork/exit

Le test principal est le refus d’accès, pas la réponse la plus fluide. User/folder scoping est documenté, mais metadata, configuration ou code peuvent le briser. Canary documents et requêtes cross-tenant appartiennent à la CI ; les données sensibles peuvent justifier apps, clés ou infrastructures séparées.

Le lien privacy developer ne chargeait pas et privacy/terms corporate renvoyaient 404. Cela ne prouve pas l’absence de contrats, mais interdit d’affirmer retention ou training. Avant upload, obtenir notice, terms, DPA, sous-traitants, région, suppression et usage d’entraînement par écrit ; SOC 2/HIPAA/BAA se valide avec contrat et trust evidence.

L’audit distingue présence de la preuve en top-k, exactitude des filtres et soutien réel de chaque affirmation par sa citation.

Pour les scans, langue OCR et rotation sont des classes d’erreur ; pour tableaux, relations de cellules ; pour graphiques, axes et légendes.

Après mise à jour ou suppression, une vérification différée cherche les anciens chunks dans cache, index et chemins de sauvegarde.

Réponses du Research Agent et résultats bruts sont conservés séparément afin d’isoler l’effet d’un changement de générateur.

Avec MCP, outils de lecture et d’écriture sont séparés ; une injection dans un document ne doit déclencher aucune action externe.

SOC 2 et HIPAA/BAA d’Enterprise exigent la vérification du scope, des sous-traitants, de la région et des clauses d’incident.

Morphik face aux briques RAG voisines

OptionRôleCompromis
MorphikStore intégré, multimodal, cloud/self-host, MCPMoins d’assemblage ; BSL, écosystème réduit, eval privée
LlamaIndexFramework connecteurs/index/retrieversComposable ; parser/store/auth/modèles internes
UnstructuredPartitioning et ingestionPrétraitement, pas store complet
DoclingConversion locale et modèle documentaireParsing inspectable ; store/retrieval/tenant séparés
RAG managéIngest/index/retrieve cloudMoins d’ops ; lock-in, région, prix
CustomComposants choisisContrôle et coût maximaux

Jugement indépendant :Morphik convient lorsque retrieval visuel et API unifiée comptent plus que le libre choix de chaque composant. Il se situe entre framework et knowledge base opaque. Sa différence est de réunir images, preuve de layout et cycle documentaire.

Le gate est la gouvernance : BSL, versionnage formel faible et évaluation publique limitée imposent des contrôles internes. Un benchmark précoce est pertinent pour documents visuels. Régulation ou multi-tenant exigent confidentialité contractuelle, pins, denial tests, restauration et export.

Questions fréquentes

Est-ce open source ?

Public/source-available sous BSL 1.1, pas OSI open source.

Même produit santé ?

Même société, périmètre distinct ; développeurs sur dev.morphik.ai.

Exécution locale ?

Oui, Docker/local inference ; exploitation et sécurité restent internes.

Comprend les graphiques ?

Multimodal/ColPali documenté ; précision à mesurer.

Dernière release ?

Aucune Release/tag ; figer un SHA testé.

Prix ?

Free $0, Pro $59, Team $799, Enterprise custom à la date.

Training privé ?

Politique publique non vérifiée ; exiger des engagements écrits.

Face à Docling ?

Même corpus/modèles ; Docling convertit, Morphik stocke et recherche aussi.

Benchmark suffisant ?

Non ; domaine, langue, scan et droits exigent tests.

Pour qui ?

Équipes avec documents visuels et gouvernance solide.

Sources et preuves

Revue indépendante : 2026-08-20. Entité, licence, API de releases, documentation, prix et code d’évaluation vérifiés ; aucun claim commercial n’est assimilé à une précision.

Vérifier Morphik à la source officielle

Ouvre le dépôt, la documentation ou les ressources du modèle.

Ouvrir la source officielle

Quick Info

Lien du projet
morphik.ai
Added
1/21/2026
Published
1/21/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Perplexity

Perplexity

Perplexity est une plateforme de recherche IA avec citations. Cette analyse indépendante couvre vérification, offres, confidentialité, limites et alternatives.

Perplexityrecherche IArecherche approfondie
850
You.com

You.com

Skip the groundwork with our AI-ready API platform and ultra-specific vertical indexes, delivering advanced search capabilities to power your next product. - Outil IA intelligent pour améliorer votre productivité.

ai-searchfree
870
Firecrawl

Firecrawl

Une API conçue pour les agents IA qui transforme des sites web entiers en markdown ou en données structurées prêts pour les LLM.

web-scrapingIAmarkdown
760
ThoughtSpot

ThoughtSpot

ThoughtSpot est une plateforme enterprise de recherche, Liveboards et analyse conversationnelle gouvernée. La revue sépare Analytics, Spotter et Embedded et évalue prix, sémantique, sécurité et alternatives.

ThoughtSpotSpotterbusiness intelligence
730