Morphik
Morphik
Active

Morphik

Morphik 是面向 AI 应用的多模态文档摄取与检索平台。本评测严格区分开发者云、BSL 源码可见的 Morphik Core,以及公司现已转向的养老护理 AI worker 业务。

119

Views

0

Likes

Jan 2026

Added

morphik.ai

项目链接

Tags

Morphik多模态RAG文档检索源码可见RAGColPaliAI数据库

Product Preview

A quick visual look at Morphik before you visit the official site.

Published 1/21/2026
Morphik screenshot

Editorial Review

About Morphik

这里的 Morphikdev.morphik.ai 开发者平台与 morphik-org/morphik-core 仓库:它把 PDF、图片、视频等非结构化资料摄取为可供 AI 应用查询的文档库,并提供文本与视觉检索、元数据过滤、生成接口、Python SDK、REST API、控制台和 MCP。它不是单指公司现在主推的养老护理 AI worker。Morphik 主站在 2026 年已经改为熟练护理与老年生活机构的财务、账单、催收和护理流程自动化,但页面顶部明确把开发者引导到独立的 dev 平台。

这一消歧不是文字游戏。主站所写的设施数量、节省金额和后台工作消除比例都是医疗行业业务宣称,不能被移植为文档检索准确率。本文只评估开发者产品的摄取、视觉检索、权限范围、部署、许可、价格、隐私和可复现验证。真正需要回答的问题不是“官网是否自称最准”,而是它能否在你的资料中找对证据、不给错误用户返回内容,并在模型或索引变化后仍可维护。

Morphik 生产验收流程:语料、摄取、检索、证据化回答与发布门槛
AIDreamHub 原创编辑图。它把 Morphik 文档中的摄取—检索—生成边界转化为私有语料验收流程,不是厂商 benchmark。

先确认产品:公司、云平台与 Core 的边界

层级核实结果不要混写的边界
Morphik 公司主站2026 年主推养老护理行业 AI workers设施、NOI 与自动化比例不是检索 benchmark
开发者云dev.morphik.ai 提供摄取、查询、Research Agent 与协作计划配额、备份、VPC 和支持随套餐变化
Morphik Core公开 Python 仓库,含多模态检索、SDK/API、Console 与 MCPBSL 1.1 源码可见,不是 OSI 开源许可
维护状态未 archived;检查时 822 commits,最后 push 2026-07-23仍活跃,但 GitHub Releases 与 tags API 均为空
许可根 LICENSE:Morphik 0.1.0,2029-06-18 转 Apache-2.0归因于使用的总收入低于每月 2,000 美元才适用额外生产授权;更高需商业许可

Morphik 自己的不同页面用词不完全一致:GitHub 描述和价格页会写 open source,而 README 说 source-available,根 LICENSE 更明确写明 Business Source License 不是开源许可。评估 checked tree 时应以根 LICENSE 为主要证据。Docker 指南底部的 MIT 文案与它冲突,不能据此把整个项目标为 MIT。BSL 的 change date 和额外授权可能随版本分别计算,所以需要对实际部署 commit 的许可文本做法务复核。

仓库在更新并不等于有可复现 release。检查日期上,GitHub Release 和 tag 均为空,不能虚构一个“最新版”。生产环境应固定完整 commit SHA、容器 digest、模型与解析器版本,保存 SBOM,并写明升级负责人、回滚方法和安全补丁策略。

开发者平台实际提供什么

阶段文档能力必须验证
摄取PDF、图片、视频等非结构化资料;Google Suite、Slack、Confluence 集成格式矩阵、加密/损坏文件、OCR 语言、失败原因
表示chunk、元数据、图片以及 ColPali 等视觉检索路线图表、布局和页级语境是否保留
检索语义/多模态查询、元数据过滤、批量 chunk 与图片返回Recall@k、排序、过滤精度、引用来源
生成/AgentCompletion、Research Agent 与 MCP 可消费检索证据检索质量与回答质量分开测,必须允许拒答
隔离用户、文件夹和每 app 独立 URI跨租户、跨文件夹、被删用户与猜测 ID 的拒绝测试
运维云、Docker 自托管、本地推理配置模型出口、pgvector、对象文件、密钥、备份与升级

Morphik 的产品特色是把视觉丰富文档的一整条路径放在同一接口里。团队可以摄取文件,查询 chunk 或图片,使用元数据过滤,再让生成模型基于证据回答。相较于自行拼接解析器、embedding job、向量库、reranker、权限层和 agent tool,这会减少胶水代码;但垂直整合也会集中风险,一个解析器或模型更新就可能重排整个索引。

不要把检索成功与回答正确合并成一个模糊分数。top-k 已含正确页时,模型仍可能编造;检索漏掉证据时,模型也可能碰巧猜对。每次评测都应保留 chunk ID、页码/坐标、图片、分数、过滤器和模型配置。官方 evaluations 目录有 HotpotQA/RAGAS 脚本与 science graph/custom eval 材料,证明项目提供了评测路径,但不是一个持续维护的公开排行榜,也不能证明它在发票、工程图、扫描件或多语言私有语料上达到相同表现。

云方案、自托管与真实成本

选择2026-08-20 公开信息适用与注意
Free$0;200 页;每月 3 次 Research Agent;共享 GPU 队列仅适合概念验证,不代表生产吞吐
Pro$59/月;2,000 页;30 次 agent;超额 $0.03/页;7 天备份;5 人小规模评测;删除、存储、查询限制需书面确认
Team$799/月;10GB、无限查询;额外节点 $2.50/GPU 小时;隔离 VPC、SSO、审计、14 天 PITR、99.9% SLA团队生产候选;10GB 后写明 $0.03/页
Enterprise定制;BYO cloud/on-prem、BAA、定制 eval/模型/tool受监管场景以签署合同、DPA/BAA 与架构为准
自托管 CoreDocker 指南建议 8GB+ RAM 与 10GB 空间;API、PostgreSQL/pgvector、可选 Ollama控制更多,但认证、网络、模型、备份、容量和许可全由团队负责

价格是动态信息,“一页”也不是稳定的成本单位。一张扫描工程图、十页幻灯片和密集财务表的计算量完全不同。应该用真实文件测量摄取队列、重复索引、存储增长、GPU 小时、查询量和每个被接受回答的总成本。表中数字只是复核日快照,不是报价。

自托管也不天然等于数据不出网。默认 Docker 可以下载并使用本地 Ollama 模型,但配置也能连接远程 embedding、视觉或语言模型。必须画出所有出站调用。DOCKER 指南中的 bypass auth 和示例密钥只适合本地开发;对外暴露前要关闭绕过认证、轮换 JWT/数据库凭据、启用 TLS 与网段限制,并把 pgvector 与原始对象作为一致性备份一起恢复测试。

可执行的私有语料评测流程

  1. 固定候选。记录 Core commit SHA、容器 digest、模型注册表、parser、embedding、reranker 和云套餐假设。
  2. 建立代表性语料。选 30–100 份真实分布的原生 PDF、扫描件、表格、图表、幻灯片、图片、视频、多语言、大文件、修订版与待删除文件;首轮先脱敏。
  3. 标注问题和证据。每个问题写清可接受页/chunk/图片、必须生效的 metadata filter、允许访问的租户,以及正确结果是否应当拒答。
  4. 单测摄取。记录成功率、失败原因、处理/队列时间、图片抽取、元数据保留、重复文件和再摄取行为。
  5. 先测检索。根据任务计算 Recall@k、MRR 或 nDCG,并统计视觉证据命中率和过滤精度;分析具体 miss。
  6. 做权限负例。用错误用户、文件夹、app、租户和被删账户查询,尝试猜 document ID 与冲突过滤条件。
  7. 再测回答。独立评分引用正确性、可证实主张、完整度、拒答、文档 prompt injection 和人工接受率。没有证据的流畅回答判失败。
  8. 测生命周期。更新/删除文档、轮换密钥、恢复备份、重建索引并模拟模型服务故障,记录传播延迟。
  9. 同语料对比。用 Docling/Unstructured 加相同 embedding/reranker 做组合 baseline,再加入一个 managed RAG。
  10. 按工作负载决策。比较每个被接受回答的成本、p50/p95 延迟、工程时间、事故率和许可,而不是 demo 视觉效果。

准确率、安全、隐私与运维限制

风险原因控制
营销指标外推HotpotQA 或 science graph 与私有视觉资料不同公布数据、标注、commit、模型和原始结果;私有复测
视觉幻觉视觉模型可能虚构文字、关系或图表数值保留页图与坐标,高影响结果人工核对
权限泄露相关 chunk 可能来自错误客户/文件夹服务端 scoping、deny test、审计与硬隔离
文档注入资料内可能含针对回答 agent 的恶意指令文档只作数据,隔离工具,操作 allowlist,保留 provenance
删除漂移对象、chunk、embedding、cache 可能不同步逐层验证 update/delete 与备份策略
模型出口Core 本地运行仍可能请求远程模型枚举 endpoint、最小化/脱敏、DPA、本地模型
许可/版本BSL 收入条件与无 release/tag 增加不确定性法务复核、SHA 固定、SBOM、扫描、可维护 fork 与退出方案

最重要的生产测试往往不是“回答看起来不错”,而是权限拒绝。用户与文件夹 scoping 是有文档的能力,但错误配置、metadata 差异和应用层代码都可能破坏边界。CI 中应放入 canary 文档并持续做跨租户查询。高敏感场景应考虑独立 app、独立密钥甚至基础设施隔离,而不只依赖一个逻辑过滤器。

本次检查中,dev 价格页指向的 /privacy 无法加载,公司主页的 privacy 与 terms 链接返回 404。它不能证明服务没有合同条款,但意味着目录页不能负责任地声称完整的数据保留、训练或删除政策。上传私有数据前应取得当前隐私声明、条款、DPA、subprocessor、数据地域、删除时限与是否用于训练的书面承诺;Enterprise 的 SOC 2、HIPAA/BAA 也应以已签合同和 Trust Center 证据为准。

Morphik 与相邻 RAG 产品对比

方案定位相对 Morphik 的取舍
Morphik整合的源码可见文档库、多模态检索、云/自托管、MCP少拼装、视觉路线清晰;BSL、生态较小、必须私测
LlamaIndex丰富 connector/index/retriever 的应用框架更可组合、中立;parser、store、auth、model 都需选择运维
Unstructured文档 partition 与 ingestion 工具/平台预处理强、格式广;本身不是完整检索数据库/agent 服务
Docling本地文档转换、结构化表示与 RAG 集成解析可检查;还需 store、retrieval、tenant 层
托管 RAG(如 Bedrock KB)云厂商管理摄取、索引与检索运维少、企业集成多;云锁定、地域/定价与透明度取舍
自建组合自选 parser、embedding、向量/关键词库、reranker、policy控制最强、组件可测;集成与运维成本最高

独立判断:Morphik 最适合“视觉检索与统一 API 的价值高于逐个选择组件”的团队。它位于框架与完全黑盒托管知识库之间。真正差异并非泛化的 RAG,而是试图在一个开发者表面中保留图片、布局证据、文档操作与检索。

采用门槛是治理而非 demo。BSL 有真实商业条件,公开版本策略薄弱,公共评测材料也不等于你的准确率。视觉文档多的小团队值得尽早做基准;受监管或多租户团队只有在取得隐私合同、固定可复现制品、通过拒绝测试、完成备份恢复并保留导出路径之后才应推进。

常见问题

Morphik 是开源吗?

仓库公开且源码可见,但根 LICENSE 是 BSL 1.1,并明确不是开源许可;指定 work 在 change date 后转 Apache-2.0。

和养老护理 Morphik 是同一产品吗?

同公司与品牌,但主站现推医疗 AI workers,并把开发者引到 dev.morphik.ai。本页评测后者与 Core。

可以完全本地运行吗?

有 Docker 与 local inference 路线,但仍需确保所有模型 endpoint、存储、认证和日志均符合本地边界。

能理解图片和图表吗?

文档明确支持多模态摄取/查询和 ColPali 等技术;具体图表的数值与关系准确率必须标注评测。

最新 release 是什么?

2026-08-20 GitHub Releases 与 tags API 都为空,因此应固定测试过的 commit SHA,不能虚构语义版本。

价格是多少?

复核日为 Free $0、Pro $59、Team $799、Enterprise 定制;购买前重新核对配额和 overage。

私有数据会训练模型吗?

当前完整公开政策无法从失效链接核实。上传前必须拿到书面条款、DPA、保留/删除/训练说明。

如何和 Docling、Unstructured 比?

用同一语料与同一 embedding/reranker。后两者偏转换/partition,Morphik 还含 store/retrieval,应比较端到端工程量和接受率。

公共 benchmark 能证明效果吗?

不能。脚本说明评测方法,但扫描质量、领域词、权限、布局和语言必须在私有语料复测。

谁适合选 Morphik?

想减少 RAG 组件拼装、重视视觉文档,并愿意处理 BSL、安全和运维验收的开发团队。

依据与来源

独立复核日期 2026-08-20。已核对实体、许可、release API、文档、价格与 evaluation 代码;厂商宣称被明确标注,未编造私有准确率。

前往 Morphik 官方来源核查

打开官方仓库、文档或模型资源。

查看官方来源

Quick Info

项目链接
morphik.ai
Added
1/21/2026
Published
1/21/2026
Updated
9/10/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Perplexity

Perplexity

Perplexity 是一款带引用的 AI 搜索与研究平台,涵盖 Search、Research、Projects、Comet 及独立计费的 API。本独立评测重点分析核验流程、价格、隐私、局限与替代方案。

PerplexityAI 搜索深度研究
1230
You.com

You.com

Skip the groundwork with our AI-ready API platform and ultra-specific vertical indexes, delivering advanced search capabilities to power your next product. - 智能 AI 工具,助力您的工作效率。

ai-searchfree
1400
Firecrawl

Firecrawl

专为AI智能体设计的API,能将整个网站转化为大模型可直接读取的Markdown或结构化数据。

网页抓取人工智能Markdown
1260
ThoughtSpot

ThoughtSpot

ThoughtSpot 是企业搜索与治理型对话分析平台。本评测区分 Analytics、Spotter、Embedded,并核查语义建模、权限、查询正确性、数仓成本和价格。

ThoughtSpotSpotterbusiness intelligence
1180