按住按钮,含糊地说你在犹豫什么,有菜单就拍一张。WDYT 帮你整理出真正的问题和选项,先给你看、让你改,确认之后才给答案——而且附上它有多确定的数字。
iPhone · 即将上架 App Store按住或点一下麦克风说话。英文走 Apple 识别,中文用手机上跑的 SenseVoice。语音永远不会离开设备。
生成模型读你的话和照片,写出问题、选项、还有「它看到了什么」——你从头到尾不用填表。
没看过之前什么都不会决定。改问题、删选项、加它漏掉的、修正它从照片读错的。然后才确认。
答案来自 TypeSafe 的 Jev——一个返回带校准概率的选择、而不是一段文字的模型,半秒内完成。
五五开就说五五开。你什么线索都没给,它也会说,并让你补一句再问一次。
两个纯文本文件——identity.md 和 soul.md——记你是谁、你怎么做决定。默认关闭;开启后每次回答完会修订,你随时可以改。
理解 → 确认 → 决定。决策模型只在你确认之后才被调用。
「我今天吃什么……」加一张菜单照片。最多三张,发送前先在手机上缩图。
一句话的问题、每个选项一行说明、还有从照片整理出的「我看到的」。有错就改。这时什么都还没决定。
一个选择、每个选项的概率、一个信心数字、一句为什么。漏了什么就补一句再问。
因为是两件事。Gemini(Google)负责读你的话和照片、写出问题——要一把 Google AI Studio 的 Gemini 密钥。Jev(TypeSafe)负责做决定——通过 OpenRouter 调用,所以要一把 OpenRouter 密钥。两边都是你自己账户按量计费,一题通常远低于一美分。WDYT 看不到任何一把密钥。
Jev 是 TypeSafe 的「System One」模型:它不生成文字,只返回有类型的答案——从你的清单选一个、一个是/否的概率、或量表上的一个位置——并附校准过的概率,大约 100–500 毫秒。信心数字之所以有意义、答案之所以瞬间出来,就是因为它。Gemini 负责 Jev 做不到的那半:听懂模糊的话、看照片。
看不到——Jev 只收文字。Gemini 会把它看到的全部写下来(菜单每一项和价格、衣服长什么样),Jev 判断的就是这段文字。这段文字在确认页面就叫「我看到的」,你可以改。
界面可选 English、繁體中文、简体中文,跟手机语言无关。语音:英文用 Apple;中文用 SenseVoice,第一次要下载约 230 MB。这个模型和你手机上其他 tautiu.dev 的 App 共用,下载一次就好。
identity.md 是你是谁——饮食、预算、习惯。soul.md 是你怎么做决定——在意什么、避免什么。每次提问都会一起发送,让答案贴近你。可以自己写,也可以开启「允许自动更新关于我的信息」让 Gemini 每次回答完帮你修订。默认关闭。
全部留在你手机上:密钥在 Keychain、两个文件、历史记录。仅有的网络连接是你自己发起的那两次,从你的手机直接到 Google 和 OpenRouter,受它们各自的隐私政策约束。