DSHПЛАГИНЫ
👁
КАТЕГОРИЯ

Зрение и мультимодальность

Мультимодальные мосты, OCR скриншотов, распознавание схем и анализ изображений.

77 плагинов5 770 звёзд230,6 тыс. загрузок/мес

Плагинов в категории: 77

👁

modlens

🔥 20k+

Vision Bridge для текстовых моделей: вставьте изображение, получите структурированные данные JSON (OCR, макет, семантика).

👁
🔥 20k+

Бесплатное зрение для текстовых агентов: встроенная цепочка машинного зрения без ключа плюс пиксельные инструменты (вопросы и ответы, заземление, обрезка, разница пикселей, цвета, оптическое распознавание текста, трассировка SVG, вырез, снимки экрана); вставьте изображение, чтобы использовать его.

👁
🔥 20k+

Vision для моделей, содержащих только текст: вставьте изображение, и модель переключится на вариант Vision Toolkit для вопросов и ответов по изображениям, сравнения нескольких изображений, оптического распознавания символов на длинных снимках экрана, воспроизведения снимков экрана в пользовательском интерфейсе, заземления элементов и сравнения пикселей. По умолчанию ключ API отсутствует — изображения обрабатываются бесплатным сервисом, размещенным автором, по 100 на машину в день; настраивается под вашего провайдера.

👁

«Чтение» изображений для моделей, содержащих только текст: уменьшение масштаба + уменьшение глубины цвета + отпечатки структуры/цвета в текстовые сетки, возвращаемые в диалог, что позволяет модели масштабировать, выполнять выборку и распознавание текста автономно, как в мультимодальной модели; полностью локальный, без зависимости от внешней модели, включает навыки методологии чтения изображений и дополнительный PaddleOCR.

👁

Генерация изображений AI для веб-интерфейса DSH: преобразование текста в изображение и изображение в изображение через настраиваемую конечную точку, совместимую с OpenAI (gpt-image-2 / gpt-image-1 / dall-e-3), с карточкой настроек api_url/api_key и студией создания разделенной панели боковой панели.

👁

Свободный мост видения и генерация изображений для текстовых моделей: считывание вставки изображений, аварийное переключение GLM-4V-Flash и двигателя Gemini, структурированные доказательства в стиле ModLens и маршрут модели свободного видения с засеиванием.

👁

Мозг DeepSeek + автоматическая транскрипция изображений: прикрепляйте изображения в графическом интерфейсе, и каждое из них по умолчанию расшифровывается с помощью официального deepseek-v4-flash-vision-exp (чистотекстовый мозг V4-Pro может видеть изображения), с использованием любого OpenAI-совместимого VLM или локального Ollama в качестве альтернативы.

👁

Добавляет настраиваемую модель видения к основным моделям, содержащим только текст: инструмент Vision_read_image, селектор модели видения на панели композитора и автоматическое преобразование изображения в текст для текстовых маршрутов.

👁

Обеспечивает видение только текстовых моделей: перенаправляет пользовательские изображения в модель машинного зрения, совместимую с OpenAI, и отображает описания на правой панели веб-интерфейса.

👁

dsh-vision

Плагин внешнего зрения для DeepSeek Harness: панель настройки с помощью кнопок-китов, распознавание изображений с автоответчиком и инструменты для создания снимков экрана/распознавания агента.

👁

Gemini-Eyes

Мост MCP к Gemini.google.com: визуальный анализ изображений и видео, создание изображений Imagen и видео Veo, а также управление диалогом с использованием сеанса браузера, вошедшего в систему, без ключа API.

👁

Автоматически генерирует и отображает изображения в чате DSH через каналы API или локальные CLI (mmx/codex/agy), а также может распознавать изображения с помощью соответствующего CLI.

Дает представление только текстовой модели изображения с помощью модели языка видения, представленной как инструмент describe_image.

👁

Маршрут поставщика шлюза визуального языка: вставленные изображения описываются настраиваемой моделью VL (по умолчанию Qwen-VL) перед подключением DeepSeek.

👁

Free Vision Bridge для текстовых моделей: распознавание изображений, распознавание текста, пользовательский интерфейс и анализ отладки через поставщиков бесплатного уровня (Qwen3-VL-Flash, Doubao, DeepSeek-OCR) с графическим интерфейсом настроек.

👁

dsh-windows-ocr

Локальное распознавание прикрепленных изображений с помощью встроенного механизма Windows (Windows.Media.Ocr): в модель отправляется только распознанный текст, а не байты изображения; Передача видения осуществляется по согласию.

👁

dsh-guide-dog

Мультимодальный плагин на базе MiniMax: режим голосового вызова в реальном времени (потоковая беседа, пользовательский интерфейс плавающей док-станции), голосовой режим и голосовой ввод с микрофона, а также инструменты создания изображений/видео/музыки/ речи и инструменты визуального контроля.

Пакет Vision MCP и DSH для DeepSeek только с текстом: инструменты анализ_изображения, анализ_буфер обмена, сравнение_изображений и видение_статус, страница визуальных настроек, бесплатный GLM-4.6V-Flash по умолчанию, кэширование результатов и допуск ограничения скорости; ключи остаются вне журналов.

👁

Связывает изображения сеанса с настраиваемыми поставщиками систем машинного зрения и возвращает текстовый анализ в подходящие маршруты модели DeepSeek Harness.

👁

dsh-vision-tools

Полный пакет возможностей машинного зрения для DeepSeek Harness: инструмент Vision_understand (OpenAI-совместимые API-интерфейсы машинного зрения, бесплатный Zhipu GLM-4V-Flash по умолчанию), а также точки входа вставки/перетаскивания/кнопок для распознавания изображений.

👁

Полностью локальное понимание изображений и распознавание текста с помощью macOS Vision Framework: `ocr_image` (текст, макет таблицы + координаты) и `view_image` (сцена, лица, QR) — вставьте несколько изображений в веб-поле ввода или передайте путь/URL/base64; изображения никогда не покидают ваш Mac.

👁

Рекламируйте вставку изображений на текстовых маршрутах DeepSeek, описывайте вложения с помощью боковой панели изображения и оставляйте собственные модели машинного зрения нетронутыми.

👁

Снимки приложений Codex для DSH: захватывайте самое переднее активное окно с помощью глобального ярлыка и легко монтируйте его в композитор для запросов агента.

Расширенный набор инструментов машинного зрения: 14 инструментов машинного зрения на уровне пикселей (описание, заземление, обнаружение, обрезка, пиксельная разница, оптическое распознавание текста, оптическое распознавание символов на длинном скриншоте, векторизация, цвета, вырезание, снимок экрана, представление, материализация, html-скриншот), управляемые одной конечной точкой, совместимой с OpenAI, с чистыми мостовыми маркерами \[图片: path], классификацией безопасности контента и автоматическим повтором ограничения скорости.

👁

Позволяет моделям, состоящим только из текста, обрабатывать вставленные изображения чата, с собственным визуальным интерфейсом, пакетным просмотром изображений и встроенным OpenAI-совместимым инструментом анализа_изображений; модели с возможностью видения не затрагиваются.

👁

Объедините API-интерфейсы для создания текста, видения и изображения в одну модель Mix с автоматической маршрутизацией: текстовые запросы передаются в модель чата, изображения пользователей и снимки экрана агентов передаются в модель видения, последующие действия продолжают использовать одно и то же изображение сеанса, а агенты могут создавать или редактировать изображения с историей вызовов на уровне сеанса.

👁

Vision Bridge для текстовых маршрутов DeepSeek, который анализирует прикрепленные и локальные изображения через настраиваемые конечные точки ответов OpenAI, завершения чата или антропных сообщений, оставляя при этом маршруты с поддержкой изображений собственными.

👁

dsh-image-gen

GPT Image 2 `image_gen` с подпиской Кодекса OAuth по умолчанию или явным режимом API-ключа: разработка карты, до трех действующих частей API, устойчивое воспроизведение вложений/лайтбокс/загрузка, вывод только текстовой модели и ограниченные запросы, безопасные для учетных данных.

👁

dsh-tesseract-ocr

Локальное распознавание текста для прикрепленных изображений через Tesseract: в модель отправляется только распознанный текст, а не байты изображения; Передача видения осуществляется по согласию.

👁

Автономный снимок экрана для DeepSeek Harness (dsh). Горячие клавиши браузера для мгновенного захвата, а также инструмент захвата и чтения для агента, который позволяет агенту видеть и анализировать любую область экрана.

👁

visual-review

Рендерит вставленные/загруженные изображения в веб-чате DSH и предоставляет только текстовые модели: инструмент Visual_review, вызываемый моделью, сначала вызывает любой OpenAI-совместимый мультимодальный API, обращаясь к локальному рабочему процессу Qwen3-VL.

👁

dsh-vision

Расширение возможностей встроенного видения с использованием Zhipu (бесплатно) или Qwen-VL (локально).

👁

dsh-draw-router

Унифицированный маршрутизатор создания изображений для DeepSeek Harness (DSH): автоматически обнаруживает модели изображений из любой конечной точки, совместимой с OpenAI, предоставляет инструменты draw_image и draw_list_sources, поддерживает SenseNova, StepFun, Agnes, Qwen, Flux, SD, Imagen и многое другое.

👁

dsh-vision-bridge

Изображения, прикрепленные к Composer, преобразуются в текст с помощью модели машинного зрения, совместимой с OpenAI, а затем достигаются только текстовые модели DeepSeek.

👁

Регистрирует маршрут провайдера deepseek-vision: веб-интерфейс принимает вставленные изображения и преобразует их в текст через бесплатный API-интерфейс Zhipu GLM Vision перед делегированием адаптеру DeepSeek.

👁

Инструмент «видения» для работы с моделями для DeepSeek Harness: описывайте и распознавайте файлы изображений путем прямого вызова бесплатного API видения Zhipu GLM (резервная цепочка glm-4v-flash), внешний интерфейс командной строки не требуется.

👁

dsh-deepseek-vision

Повторно использует встроенный веб-режим DeepSeek для текстовых моделей: инструмент deepseek_vision управляет локальной автоматизацией браузера deepseek-vision-cli (помощник при ручном входе в систему, включение глубокого мышления, автоматическое закрытие браузера) и возвращает описания изображений в виде текста.

👁

Локальное структурированное видение для текстовых агентов: изображения передаются в локальный OpenAI-совместимый VLM и возвращаются в виде доказательств JSON (сводка, дословное распознавание текста, области макета, сущности/отношения, цвета, явная неопределенность), с резервным вариантом защиты от галлюцинаций и дополнительным мостом вставки/загрузки; нулевая стоимость облака, изображения никогда не покидают машину.

👁

Маршрут провайдера Vision, который преобразует прикрепленные изображения в текст с помощью настраиваемой модели (более 15 поставщиков, совместимых с OpenAI и Anthropic), в то время как DeepSeek продолжает отвечать.

👁

dsh-eyes

Машинное зрение по требованию для текстовых моделей DeepSeek: загружайте изображения, и модель вызывает инструмент view_image, поддерживаемый любой конечной точкой машинного зрения, совместимой с OpenAI (по умолчанию Qwen/DashScope).

👁

Адаптер DeepSeek с дополненной системой машинного зрения: модель с поддержкой машинного зрения описывает ввод изображения, а модель DeepSeek, состоящая только из текста, анализирует описание.

👁

dsh-auto-vision

Мост машинного зрения с автоматическим обнаружением для текстовых агентов DeepSeek Harness: автоматически находит модель с поддержкой изображений у настроенных вами поставщиков и возвращает описания изображений в виде обычного текста с помощью инструмента машинного зрения.

👁

DSH-dseyes

Собственные вложения изображений для текстового DeepSeek в веб-интерфейсе: вставленные или удаленные изображения отображаются в сеансе в виде миниатюр, и перед отправкой хост считывает их с помощью бесплатного API видения Zhipu GLM-4V-Flash (резервная цепочка glm-4v-flash) и заменяет описание, поэтому DeepSeek отвечает об изображении, в то время как оригинал сохраняется в истории.

👁

dsh-design-qa

Контроль качества проектирования для текстовых моделей: инструмент deepseek_vision заимствует взгляд из любого OpenAI-совместимого маршрута видения, поэтому модель может судить, соответствует ли реализация ее макету - поставляется с эталоном, лежащим в основе этого решения (четыре прибора, 23 внедренных дефекта, необработанные стенограммы) и дисциплиной опроса, от которой он зависит.

👁

Вызываемый агентом инструмент машинного зрения, который описывает локальные изображения через любую настроенную вами конечную точку машинного зрения, совместимую с OpenAI, с дополнительной перекрестной проверкой нескольких моделей и без встроенных ключей.

👁

dsh-tool-vision

Инструмент image_describe (识图), ориентированный на модель, через DashScope OpenAI-совместимый API (qwen3.7-flash), а также мост вставки: в текстовых сеансах вставленные изображения автоматически преобразуются в пути к файлам во время отправки и отображаются обратно в расшифровке, поэтому они никогда не прерывают прием изображения. Принесите свой собственный DASHSCOPE_API_KEY; настраиваемая конечная точка/модель/бюджеты, защищенный от перенаправления HTTP-клиент, работает в каждой предустановке агента.

👁

mimo-vision

Инструмент `describe_image`: мост визуализации, который отправляет изображения в mimo-v2.5 через Zen API с открытым кодом (учетные данные `OPENCODE_GO_API_KEY`, сначала бесплатный маршрут с платным резервным вариантом) и возвращает текстовые описания для текстовых моделей со встроенной сквозной передачей и транскодированием ImageMagick форматов SVG/TIFF/HEIC.

👁

Мост для прикрепления изображений в чате с инструментом view_image для любого OpenAI-совместимого VLM (локального Ollama или облака): вставленные/переброшенные изображения становятся маркерами пути view_image перед достижением текстовых моделей DeepSeek.

👁

Дайте DSH видение только текстовых моделей: навык распознавания изображений/OCR/документов (группа гонок → пользовательские каналы → локальные) плюс идемпотентный патч хоста, чтобы сообщения с изображениями доходили до модели.

👁

aura-vision

Бесплатное оптическое распознавание текста с адаптивным распознаванием плиток для длинных документов и экспортом в Markdown/Word/PNG/Excel.

Ввод изображения в текст для веб-интерфейса: вставьте или перетащите изображение, и оно транскрибируется в структурированный текст и отправляется, что позволяет LLM взять на себя функции ввода изображений только для текста (OpenAI-совместимый Vision API).

👁

dsh-labnana

Генерация изображений Labnana для DeepSeek Harness: преобразование текста в изображение / изображения в изображение / точное редактирование с оценкой кредитов, балансом подписки и пользовательским интерфейсом веб-настроек.

👁

dsh-vision-guard

Прозрачная защита изображений для текстовых маршрутов: вставка изображений без взаимоблокировки сеанса 400, а также инструмент Vision_analyze для OCR/PDF/docx/pptx/video.

👁

Vision for DeepSeek Harness: инструмент `analyze_image` с 8 режимами (описание, оптическое распознавание символов, данные диаграммы, просмотр пользовательского интерфейса, обнаружение объектов, сравнение, создание кода, отладка), а также встроенный бесплатный анонимный источник изображений, мост изображений для текстовых моделей, автоматическое переключение при сбое между моделями с ограничением скорости и структурированный вывод JSON через любую конечную точку, совместимую с OpenAI или Anthropic.

👁

wechat-ocr

Локальный инструмент WeChat OCR для DSH: `wechat_ocr_recouncee` возвращает распознанный текст и структурированный результат механизма для локального пути к изображению.

👁

Локальный инструмент OneOCR для Windows 11 для DSH: `oneocr_recouncee` возвращает текст OCR и структурированные многоугольники строк/слов, достоверность, поворот и стиль рукописного ввода.

👁

dsh-quicksight

Двухуровневое чтение изображений для текстовых моделей: сначала быстрое локальное распознавание текста (RapidOCR, оффлайн), резервное копирование для модели машинного зрения (modlens).

👁

dsh-mmroute

Прозрачная мультимодальная маршрутизация для текстовых моделей: каждое изображение в каждом вызове модели полностью расшифровывается (дословное распознавание текста, данные, зоны неопределенности, усиленное внедрение) вашим собственным мультимодальным распознавателем с целенаправленным повторным просмотром через Vision_relook и автоматическим повтором при сбоях, связанных с изображением. Никаких связанных конечных точек и заимствованных логинов.

👁

dsh-autovision

Концепция для текстовых моделей dsh: вставьте изображение, и настроенная мультимодальная модель автоматически преобразует его в текст — прозрачная двойная маршрутизация, инструмент чтения изображения, вызываемый агентом, без встроенных ключей или реле.

👁

Дайте вашей текстовой модели глаза — вложения изображений в чате автоматически описываются с помощью модели визуального представления (подсказка по умолчанию) с итеративным повторным анализом с помощью подсказок, сгенерированных моделью, когда детали отсутствуют; режимы системы/пользовательской модели + панель конфигурации графического пользовательского интерфейса, обработка секретов с использованием ключей и небольшой патч хоста для DSH 0.1.0-rc.6 (см. README репозитория).

👁

Передаёт повторяющиеся текстовые и визуальные операции (распознавание текста, анализ изображений, сравнение) на локальный сервер KoboldCpp (llama.cpp) с помощью инструментов koboldcpp_run и koboldcpp_vision с управлением жизненным циклом сервера по требованию.

👁

Передаёт повторяющиеся текстовые и визуальные операции (распознавание текста, анализ изображений, сравнение) на локально работающий сервер Unsloth Desktop (Unsloth Studio) с помощью инструментов unsloth_run и unsloth_vision; чистый HTTP-клиент, никогда не порождает и не владеет процессами.

👁

Позволяет текстовому агенту DeepSeek читать изображения в одном сеансе, делегируя его субагенту с поддержкой машинного зрения и преобразуя изображение в путь во время отправки.

👁

Локальные глаза для текстовых моделей:eyes_render рисует текст/фигуры/Русалку на холсте в веб-интерфейсе,eyes_paste захватывает вставленные изображения,eyes_ocr считывает текст с помощью встроенного средства оптического распознавания символов Windows (в автономном режиме), аeyes_analyze проверяет пиксели как структурированные данные — модель зрения не требуется.

👁

Видение для любого маршрута DSH: вставляйте изображения в веб-композитор с автоматическим анализом с учетом намерений, делегируйте считывание изображений рабочей области субагенту визуализации Kimi/MiniMax и материализуйте вставленные оригиналы для редактирования.

👁

Предоставьте видение только текстовым моделям: инструмент описания_изображения, который делегирует изображения модели изображения из вашего списка моделей dsh через собственную среду выполнения LLM.

👁

Интегрированная цепочка инструментов визуального создания для DSH: быстрое обратное проектирование и оптимизация аудита, а также генерация изображений с участием нескольких поставщиков с асинхронным фоновым рендерингом.

👁

Понимание изображений для любой модели DSH: инструменты зрения, оптического распознавания символов, заземления и обрезки с предустановленными областями для гистопатологии, клеточной биологии, анатомии, клинических изображений и научных цифр.

👁

dsh-pdf-reader

Плагин для чтения PDF-файлов с учетом содержимого для моделей машинного зрения: профилирует каждую страницу на предмет рисунков (векторных и растровых), таблиц, рисков формул и двухколоночного макета, затем применяет гибридное извлечение с учетом содержимого, визуализируя страницы рисунков/таблиц/формул как обрезку областей с высоким разрешением. Обеспечивает предварительный просмотр с низким разрешением для понимания макета страницы и визуализирует указанную область с высоким разрешением. Упакованный как несколько инструментов для агентов.

👁

phone-eye

Позвольте вашему ИИ-агенту видеть и управлять настоящим телефоном Android: phone_look (видение + объединение деревьев пользовательского интерфейса), касание/пролистывание/ввод текста, снимок экрана — через adb, для любого клиента MCP.

👁

dsh-vision-bridge

Направляет изображения в модель видения по вашему выбору — с автоматической перезаписью, явными инструментами или гибридной — так что модель текстового чата не подведет ход, содержащий изображение.

👁

Генерация локального изображения, голоса, музыки и звуковых эффектов плюс транскрипция с закрепленной идентификацией: персонажи, животные, объекты и голоса актеров определяются один раз и повторно используются при каждом последующем вызове, вырожденный вывод (почти плоское изображение, тихий звук) отклоняется, а не возвращается как успешный, а сгенерированная строка может быть прочитана обратно как текст, поэтому клон, проглотивший ее окончание, становится видимым. Движки разгружаются во время простоя, а генерация и транскрипция изображений могут быть направлены на API-интерфейс в форме OpenAI, а не на локальный бэкэнд Vulkan.

Добавляет инструмент создания снимков экрана и две дополнительные точки автоматического захвата, помещая экран в разговор как блок изображения; требуется модель с поддержкой изображений.

👁

dsh-capture

Двухпроцессорный захват экрана для DSH: внутри оболочки рабочего стола SSiD глобальная горячая клавиша или панель задач открывает полноэкранное наложение с выбором поля (все мониторы, кадры с точностью до пикселя для каждого дисплея) с аннотациями в красном поле и панелью инструментов в стиле WeChat; в простом DSH (браузере) кнопка камеры композитора захватывает изображение через getDisplayMedia и повторно использует тот же однофазный выбор поля + наложение аннотаций на странице. Обрезанное изображение попадает в текущий диалог через официальный вход вложений.

👁

Зеркальное отображение экрана и управление телефоном HarmonyOS через веб-интерфейс DSH: зеркальное отображение H.264 в реальном времени, касание мыши, системные клавиши, потоковая передача hilog и распознавание экрана с помощью искусственного интеллекта для каждого кадра.

Превратите камеру телефона в видоискатель в реальном времени и ввод фотографий для сеанса DSH через локальную сеть или USB.