Reka是什么?用多模态AI理解图像、视频与音频的使用方法与功能详解【2026年最新】
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
本文要点
Reka是一家专注于开发能够同时理解文本、图像、视频和音频的"多模态AI"的初创企业。"多模态"意指"能够同时处理多种类型的数据",Reka的AI不仅能理解文字,还能读取照片和视频的内容并回答相关问题。2026年6月,Reka与视频生成AI公司Moonvalley合并,进一步推进对物理世界有更深理解的AI(Physical AI)的研发。作为由前DeepMind和Google研究人员创立的企业,其前沿的技术实力备受关注。
Reka针对不同用途提供4种模型,从轻量级的Spark(10亿参数)到性能最强的Core(670亿参数)均可选择。Edge模型的特点是轻量,可嵌入机器人和摄像头中使用;Flash模型在拥有与GPT-3.5和Gemini Pro相当性能的同时,响应速度更快。Core模型是可与GPT-4V和Claude-3 Opus媲美的顶级模型,在深度理解视频内容方面表现出色。Reka能够从图像和视频中提取信息,回答音频与文本相结合的问题,胜任各类复杂任务。
Reka通过API(程序调用接口)提供服务。在官方网站注册账户并获取API Key(类似连接密码)后即可立即开始使用。收费采用按量付费制,无需初始费用。费用根据输入数据量(Token数)计算,Core模型约为每100万Token 3美元,轻量模型价格更低。视觉API(Vision API)支持视频分析,并提供3小时(180分钟)的免费试用,可先试用后再考虑正式部署。部署环境支持云端、本地部署、VPC等多种灵活选择。
优点在于,由于从一开始就将文本、图像、视频和音频进行联合训练,AI能够准确理解不同数据之间的关联。提供4种规格的模型,从嵌入智能手机或机器人的轻量场景,到企业的复杂分析需求,均可广泛覆盖。2026年3月发布的新Edge模型还支持嵌入物理设备并实时运行,这也是其一大优势。缺点是目前日语(中文)相关信息仍然较少,主要以英语使用为主。此外,Reka并不提供类似GPT-4或Claude那样面向普通用户的聊天服务,使用时需要具备一定的API技术知识。
Reka特别适合希望自动分析图像和视频内容的企业及开发者。例如,适用于通过AI监控安防摄像头画面,或让机器人判断周围环境并自主行动等场景。实际上,在2026年的Smart City Asia活动中,Reka的物理安全系统也得到了展示。此外,对于希望构建能同时处理多类型数据的应用程序的工程师,以及从事现有AI难以应对的高级多模态任务研究的研究人员来说,Reka同样是理想选择。由于采用按量付费、可从小规模开始,初创企业在尝试新服务时也会发现其易于上手。
本文转载自 AI Friends。