Files
hottub/src/providers/omgxxx.rs
2026-06-30 20:42:48 +00:00

1647 lines
59 KiB
Rust

use crate::DbPool;
use crate::api::ClientVersion;
use crate::providers::{
Provider, report_provider_error, report_provider_error_background, requester_or_default,
};
use crate::uploaders::{
UploaderChannelStat, UploaderLayoutRow, UploaderProfile, UploaderVideoRef,
iso_timestamp_from_unix,
};
use crate::util::cache::VideoCache;
use crate::util::parse_abbreviated_number;
use crate::util::time::parse_time_to_seconds;
use crate::videos::{ServerOptions, VideoItem};
use crate::{status::*, util};
use async_trait::async_trait;
use error_chain::error_chain;
use htmlentity::entity::{ICodedDataTrait, decode};
use percent_encoding::{NON_ALPHANUMERIC, percent_decode_str, utf8_percent_encode};
use regex::Regex;
use scraper::{Html, Selector};
use std::sync::{Arc, RwLock};
use std::thread;
use std::vec;
pub const CHANNEL_METADATA: crate::providers::ProviderChannelMetadata =
crate::providers::ProviderChannelMetadata {
group_id: "studio-network",
tags: &["studio", "networks", "models"],
};
error_chain! {
foreign_links {
Io(std::io::Error);
HttpRequest(wreq::Error);
}
}
#[derive(Debug, Clone)]
pub struct OmgxxxProvider {
url: String,
sites: Arc<RwLock<Vec<FilterOption>>>,
networks: Arc<RwLock<Vec<FilterOption>>>,
stars: Arc<RwLock<Vec<FilterOption>>>,
}
#[derive(Debug, Clone, PartialEq, Eq)]
enum OmgUploaderTargetKind {
Site,
Network,
}
#[derive(Debug, Clone)]
struct OmgUploaderTarget {
kind: OmgUploaderTargetKind,
id: String,
title: String,
}
impl OmgxxxProvider {
pub fn new() -> Self {
let provider = OmgxxxProvider {
url: "https://www.omg.xxx".to_string(),
sites: Arc::new(RwLock::new(vec![FilterOption {
id: "all".to_string(),
title: "All".to_string(),
}])),
networks: Arc::new(RwLock::new(vec![FilterOption {
id: "all".to_string(),
title: "All".to_string(),
}])),
stars: Arc::new(RwLock::new(vec![FilterOption {
id: "all".to_string(),
title: "All".to_string(),
}])),
};
// Kick off the background load but return immediately
provider.spawn_initial_load();
provider
}
fn spawn_initial_load(&self) {
let url = self.url.clone();
let sites = Arc::clone(&self.sites);
let networks = Arc::clone(&self.networks);
let stars = Arc::clone(&self.stars);
thread::spawn(move || {
// Create a tiny runtime just for these async tasks
let rt = match tokio::runtime::Builder::new_current_thread()
.enable_all()
.build()
{
Ok(rt) => rt,
Err(e) => {
report_provider_error_background(
"omgxxx",
"spawn_initial_load.runtime_build",
&e.to_string(),
);
return;
}
};
rt.block_on(async move {
// If you have a streaming sites loader, call it here too
if let Err(e) = Self::load_sites(&url, sites).await {
eprintln!("load_sites_into failed: {e}");
}
if let Err(e) = Self::load_networks(&url, networks).await {
eprintln!("load_networks failed: {e}");
}
if let Err(e) = Self::load_stars(&url, stars).await {
eprintln!("load_stars failed: {e}");
}
});
});
}
async fn load_stars(base_url: &str, stars: Arc<RwLock<Vec<FilterOption>>>) -> Result<()> {
let mut requester = util::requester::Requester::new();
for page in [1..10].into_iter().flatten() {
let text = match requester
.get(
format!("{}/models/total-videos/{}/?gender_id=0", &base_url, page).as_str(),
None,
)
.await
{
Ok(text) => text,
Err(e) => {
report_provider_error_background(
"omgxxx",
"load_stars.request",
&format!("url={base_url}; page={page}; error={e}"),
);
break;
}
};
if text.contains("404 Not Found") || text.is_empty() {
break;
}
let stars_div = text
.split("<div class=\"list-models\">")
.collect::<Vec<&str>>()
.last()
.copied()
.unwrap_or_default()
.split("custom_list_models_models_list_pagination")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
for stars_element in stars_div.split("<a ").collect::<Vec<&str>>()[1..].to_vec() {
let star_url = stars_element
.split("href=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
let star_id = star_url
.split("/")
.collect::<Vec<&str>>()
.get(4)
.copied()
.unwrap_or_default()
.to_string();
let star_name = stars_element
.split("<strong class=\"title\">")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("<")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
Self::push_unique(
&stars,
FilterOption {
id: star_id,
title: star_name,
},
);
}
}
return Ok(());
}
async fn load_sites(base_url: &str, sites: Arc<RwLock<Vec<FilterOption>>>) -> Result<()> {
let mut requester = util::requester::Requester::new();
let mut page = 0;
loop {
page += 1;
let text = requester
.get(format!("{}/sites/{}/", &base_url, page).as_str(), None)
.await;
let text = match text {
Ok(text) => text,
Err(e) => {
report_provider_error_background(
"omgxxx",
"load_sites.request",
&format!("url={base_url}; page={page}; error={e}"),
);
break;
}
};
if text.contains("404 Not Found") || text.is_empty() {
break;
}
let sites_div = text
.split("id=\"list_content_sources_sponsors_list_items\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("class=\"pagination\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
for sites_element in
sites_div.split("class=\"headline\"").collect::<Vec<&str>>()[1..].to_vec()
{
let site_url = sites_element
.split("href=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
let site_id = site_url
.split("/")
.collect::<Vec<&str>>()
.get(4)
.copied()
.unwrap_or_default()
.to_string();
let site_name = sites_element
.split("<h2>")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("<")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
Self::push_unique(
&sites,
FilterOption {
id: site_id,
title: site_name,
},
);
}
}
return Ok(());
}
async fn load_networks(base_url: &str, networks: Arc<RwLock<Vec<FilterOption>>>) -> Result<()> {
let mut requester = util::requester::Requester::new();
let text = match requester.get(&base_url, None).await {
Ok(text) => text,
Err(e) => {
report_provider_error_background(
"omgxxx",
"load_networks.request",
&format!("url={base_url}; error={e}"),
);
return Ok(());
}
};
let networks_div = text
.split("class=\"sites__list\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("</div>")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
for network_element in
networks_div.split("sites__item").collect::<Vec<&str>>()[1..].to_vec()
{
if network_element.contains("sites__all") {
continue;
}
let network_url = network_element
.split("href=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
let network_id = network_url
.split("/")
.collect::<Vec<&str>>()
.get(4)
.copied()
.unwrap_or_default()
.to_string();
let network_name = network_element
.split(">")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("<")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
Self::push_unique(
&networks,
FilterOption {
id: network_id,
title: network_name,
},
);
}
return Ok(());
}
// Push one item with minimal lock time and dedup by id
fn push_unique(target: &Arc<RwLock<Vec<FilterOption>>>, item: FilterOption) {
if let Ok(mut vec) = target.write() {
if !vec.iter().any(|x| x.id == item.id) {
vec.push(item);
// Optional: keep it sorted for nicer UX
// vec.sort_by(|a,b| a.title.cmp(&b.title));
}
}
}
fn build_channel(&self, clientversion: ClientVersion) -> Channel {
let _ = clientversion;
let sites: Vec<FilterOption> = self
.sites
.read()
.map(|g| g.clone()) // or: .map(|g| g.to_vec())
.unwrap_or_default(); // or: .unwrap_or_else(|_| Vec::new())
let networks: Vec<FilterOption> = self
.networks
.read()
.map(|g| g.clone()) // or: .map(|g| g.to_vec())
.unwrap_or_default(); // or: .unwrap_or_else(|_| Vec::new())
let stars: Vec<FilterOption> = self
.stars
.read()
.map(|g| g.clone()) // or: .map(|g| g.to_vec())
.unwrap_or_default(); // or: .unwrap_or_else(|_| Vec::new())
Channel {
id: "omgxxx".to_string(),
name: "OMG XXX".to_string(),
description: "OMG look at that Collection!".to_string(),
premium: false,
favicon: "https://www.google.com/s2/favicons?sz=64&domain=www.omg.xxx".to_string(),
status: "active".to_string(),
categories: vec![],
options: vec![
ChannelOption {
id: "sort".to_string(),
title: "Sort".to_string(),
description: "Sort the Videos".to_string(),
systemImage: "list.number".to_string(),
colorName: "blue".to_string(),
options: vec![
FilterOption {
id: "latest-updates".into(),
title: "Latest".into(),
},
FilterOption {
id: "most-popular".into(),
title: "Most Viewed".into(),
},
FilterOption {
id: "top-rated".into(),
title: "Top Rated".into(),
},
],
multiSelect: false,
},
ChannelOption {
id: "sites".to_string(),
title: "Sites".to_string(),
description: "Filter for different Sites".to_string(),
systemImage: "rectangle.stack".to_string(),
colorName: "green".to_string(),
options: sites,
multiSelect: false,
},
ChannelOption {
id: "networks".to_string(),
title: "Networks".to_string(),
description: "Filter for different Networks".to_string(),
systemImage: "list.dash".to_string(),
colorName: "purple".to_string(),
options: networks,
multiSelect: false,
},
ChannelOption {
id: "stars".to_string(),
title: "Stars".to_string(),
description: "Filter for different Pornstars".to_string(),
systemImage: "star.fill".to_string(),
colorName: "yellow".to_string(),
options: stars,
multiSelect: false,
},
],
nsfw: true,
cacheDuration: None,
}
}
fn canonical_uploader_id(kind: &OmgUploaderTargetKind, id: &str) -> String {
let kind = match kind {
OmgUploaderTargetKind::Site => "site",
OmgUploaderTargetKind::Network => "network",
};
format!(
"omgxxx:{kind}:{}",
utf8_percent_encode(id, NON_ALPHANUMERIC)
)
}
fn uploader_target_from_id(&self, uploader_id: &str) -> Option<OmgUploaderTarget> {
let parts = uploader_id.split(':').collect::<Vec<_>>();
if parts.is_empty() {
return None;
}
let (kind, raw_id) = match parts.as_slice() {
["omgxxx", kind, raw_id] => (*kind, *raw_id),
["omgxxx", raw_id] => ("site", *raw_id),
_ => return None,
};
let decoded_id = percent_decode_str(raw_id).decode_utf8().ok()?.to_string();
match kind {
"site" => self
.sites
.read()
.ok()?
.iter()
.find(|option| option.id == decoded_id)
.map(|option| OmgUploaderTarget {
kind: OmgUploaderTargetKind::Site,
id: option.id.clone(),
title: option.title.clone(),
})
.or_else(|| {
Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Site,
id: decoded_id.clone(),
title: decoded_id.clone(),
})
}),
"network" => self
.networks
.read()
.ok()?
.iter()
.find(|option| option.id == decoded_id)
.map(|option| OmgUploaderTarget {
kind: OmgUploaderTargetKind::Network,
id: option.id.clone(),
title: option.title.clone(),
})
.or_else(|| {
Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Network,
id: decoded_id.clone(),
title: decoded_id.clone(),
})
}),
_ => None,
}
}
fn uploader_target_from_name(&self, uploader_name: &str) -> Option<OmgUploaderTarget> {
let normalized = uploader_name.trim();
if normalized.is_empty() {
return None;
}
let lowered = normalized.to_ascii_lowercase();
if let Ok(sites) = self.sites.read() {
if let Some(option) = sites.iter().find(|option| {
option.title.eq_ignore_ascii_case(normalized)
|| option.id.eq_ignore_ascii_case(normalized)
|| option.title.to_ascii_lowercase() == lowered
}) {
return Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Site,
id: option.id.clone(),
title: option.title.clone(),
});
}
}
if let Ok(networks) = self.networks.read() {
if let Some(option) = networks.iter().find(|option| {
option.title.eq_ignore_ascii_case(normalized)
|| option.id.eq_ignore_ascii_case(normalized)
|| option.title.to_ascii_lowercase() == lowered
}) {
return Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Network,
id: option.id.clone(),
title: option.title.clone(),
});
}
}
None
}
fn resolve_uploader_target(
&self,
uploader_id: Option<&str>,
uploader_name: Option<&str>,
) -> Option<OmgUploaderTarget> {
uploader_id
.and_then(|value| self.uploader_target_from_id(value))
.or_else(|| uploader_name.and_then(|value| self.uploader_target_from_name(value)))
}
fn uploader_target_url(&self, target: &OmgUploaderTarget, page: u8) -> String {
let base = match target.kind {
OmgUploaderTargetKind::Site => "sites",
OmgUploaderTargetKind::Network => "networks",
};
format!("{}/{}/{}/{}/", self.url, base, target.id, page.max(1))
}
fn uploader_target_last_page(&self, html: &str, target: &OmgUploaderTarget) -> Option<u8> {
let base = match target.kind {
OmgUploaderTargetKind::Site => "sites",
OmgUploaderTargetKind::Network => "networks",
};
let pattern = format!(r#"/{}/{}/(?P<page>\d+)/"#, regex::escape(base), regex::escape(&target.id));
let regex = Regex::new(&pattern).ok()?;
regex
.captures_iter(html)
.filter_map(|captures| captures.name("page")?.as_str().parse::<u8>().ok())
.max()
}
fn display_name_for_uploader_target(
&self,
target: &OmgUploaderTarget,
html: &str,
first_page_items: &[VideoItem],
) -> String {
if !target.title.trim().is_empty() && target.title != target.id {
return target.title.clone();
}
if let Some(title) = html
.split("<title>")
.nth(1)
.and_then(|segment| segment.split("</title>").next())
.map(|title| decode(title.as_bytes()).to_string().unwrap_or_else(|_| title.to_string()))
.map(|title| title.replace(" Porn! 😮 - OMG.XXX", ""))
.map(|title| title.replace(" - OMG.XXX", ""))
.map(|title| title.trim().to_string())
.filter(|title| !title.is_empty())
{
return title;
}
if let Some(site_name) = first_page_items.iter().find_map(|item| {
item.title
.strip_prefix('[')
.and_then(|title| title.split(']').next())
.map(str::trim)
.filter(|value| !value.is_empty())
.map(ToOwned::to_owned)
}) {
return site_name;
}
target
.id
.split('-')
.map(|part| {
let mut chars = part.chars();
match chars.next() {
Some(first) => first.to_uppercase().collect::<String>() + chars.as_str(),
None => String::new(),
}
})
.collect::<Vec<_>>()
.join(" ")
}
fn rank_uploader_videos(
videos: &[UploaderVideoRef],
query: Option<&str>,
) -> Vec<UploaderVideoRef> {
let Some(query) = query.map(str::trim).filter(|value| !value.is_empty()) else {
return videos.to_vec();
};
let query = query.to_ascii_lowercase();
let mut ranked = videos.to_vec();
ranked.sort_by(|a, b| {
let score = |video: &UploaderVideoRef| {
let mut score = 0u8;
if video.title.to_ascii_lowercase().contains(&query) {
score += 2;
}
if video.uploader.to_ascii_lowercase().contains(&query) {
score += 1;
}
score
};
score(b)
.cmp(&score(a))
.then(b.views.cmp(&a.views))
.then_with(|| a.id.cmp(&b.id))
});
ranked
}
fn uploader_target_from_href_and_title(&self, href: &str, title: &str) -> Option<OmgUploaderTarget> {
if href.contains("/sites/") {
let id = href
.split("/sites/")
.nth(1)
.unwrap_or_default()
.split('/')
.next()
.unwrap_or_default()
.to_string();
if id.is_empty() {
return None;
}
return Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Site,
id,
title: title.to_string(),
});
}
if href.contains("/networks/") {
let id = href
.split("/networks/")
.nth(1)
.unwrap_or_default()
.split('/')
.next()
.unwrap_or_default()
.to_string();
if id.is_empty() {
return None;
}
return Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Network,
id,
title: title.to_string(),
});
}
None
}
async fn build_uploader_profile(
&self,
_cache: VideoCache,
target: &OmgUploaderTarget,
query: Option<&str>,
profile_content: bool,
options: &ServerOptions,
) -> Result<Option<UploaderProfile>> {
let first_page_url = self.uploader_target_url(target, 1);
let mut requester = requester_or_default(options, module_path!(), "missing_requester");
let first_page_html = match requester.get(&first_page_url, None).await {
Ok(html) => html,
Err(error) => {
return Err(Error::from(format!(
"uploader page request failed url={first_page_url}; error={error}"
)));
}
};
let first_page_items = self.get_video_items_from_html(first_page_html.clone());
if first_page_items.is_empty() {
return Ok(None);
}
let display_name =
self.display_name_for_uploader_target(target, &first_page_html, &first_page_items);
let last_page = self
.uploader_target_last_page(&first_page_html, target)
.unwrap_or(1);
let last_page_items = if last_page > 1 {
let mut requester = requester_or_default(options, module_path!(), "missing_requester");
let html = requester
.get(&self.uploader_target_url(target, last_page), None)
.await
.unwrap_or_default();
self.get_video_items_from_html(html)
} else {
Vec::new()
};
let uploader_id = Self::canonical_uploader_id(&target.kind, &target.id);
let mut video_refs = first_page_items
.iter()
.map(|item| {
let mut video =
UploaderVideoRef::from_video_item(item, &display_name, &uploader_id);
video.uploader = display_name.clone();
video.uploaderId = uploader_id.clone();
video
})
.collect::<Vec<_>>();
let ranked = Self::rank_uploader_videos(&video_refs, query);
let featured_ids = ranked
.iter()
.take(12)
.map(|video| video.id.clone())
.collect::<Vec<_>>();
let video_count = if last_page > 1 {
((last_page as u64 - 1) * first_page_items.len() as u64) + last_page_items.len() as u64
} else {
first_page_items.len() as u64
};
let total_views = first_page_items
.iter()
.chain(last_page_items.iter())
.filter_map(|item| item.views)
.map(u64::from)
.sum();
let newest = first_page_items.iter().filter_map(|item| item.uploadedAt).max();
let oldest = last_page_items
.iter()
.filter_map(|item| item.uploadedAt)
.min()
.or_else(|| first_page_items.iter().filter_map(|item| item.uploadedAt).min());
for video in &mut video_refs {
video.uploader = display_name.clone();
video.uploaderId = uploader_id.clone();
}
let layout = if featured_ids.is_empty() {
vec![UploaderLayoutRow::videos(None)]
} else {
vec![
UploaderLayoutRow::horizontal(Some("For You".to_string()), featured_ids),
UploaderLayoutRow::videos(None),
]
};
Ok(Some(UploaderProfile {
id: uploader_id,
name: display_name,
url: Some(first_page_url),
channel: Some("omgxxx".to_string()),
verified: false,
videoCount: video_count,
totalViews: total_views,
channels: Some(vec![UploaderChannelStat {
channel: "omgxxx".to_string(),
videoCount: video_count,
firstSeenAt: iso_timestamp_from_unix(oldest),
lastSeenAt: iso_timestamp_from_unix(newest),
}]),
avatar: None,
description: None,
bio: None,
videos: profile_content.then_some(video_refs),
tapes: profile_content.then_some(Vec::new()),
playlists: profile_content.then_some(Vec::new()),
layout: Some(layout),
}))
}
async fn get(
&self,
cache: VideoCache,
page: u8,
sort: &str,
options: ServerOptions,
) -> Result<Vec<VideoItem>> {
let mut sort_string: String = match sort {
"top-rated" => "top-rated".to_string(),
"most-popular" => "most-popular".to_string(),
_ => "latest-updates".to_string(),
};
let alt_sort_string: String = match sort {
"top-rated" => "/top-rated".to_string(),
"most-popular" => "/most-popular".to_string(),
_ => "".to_string(),
};
if let Some(network) = options.network.as_deref() {
if !network.is_empty() && network != "all" {
sort_string = format!("networks/{}{}", network, alt_sort_string);
}
}
if let Some(site) = options.sites.as_deref() {
if !site.is_empty() && site != "all" {
sort_string = format!("sites/{}{}", site, alt_sort_string);
}
}
if let Some(star) = options.stars.as_deref() {
if !star.is_empty() && star != "all" {
sort_string = format!("models/{}{}", star, alt_sort_string);
}
}
let video_url = format!("{}/{}/{}/", self.url, sort_string, page);
let old_items = match cache.get(&video_url) {
Some((time, items)) => {
if time.elapsed().unwrap_or_default().as_secs() < 60 * 5 {
return Ok(items.clone());
} else {
items.clone()
}
}
None => {
vec![]
}
};
let mut requester = requester_or_default(&options, module_path!(), "missing_requester");
let text = match requester.get(&video_url, None).await {
Ok(text) => text,
Err(e) => {
report_provider_error(
"omgxxx",
"get.request",
&format!("url={video_url}; error={e}"),
)
.await;
return Ok(old_items);
}
};
let video_items: Vec<VideoItem> = self.get_video_items_from_html(text.clone());
if !video_items.is_empty() {
cache.remove(&video_url);
cache.insert(video_url.clone(), video_items.clone());
} else {
return Ok(old_items);
}
Ok(video_items)
}
async fn query(
&self,
cache: VideoCache,
page: u8,
query: &str,
options: ServerOptions,
) -> Result<Vec<VideoItem>> {
let mut search_type = "search";
let mut search_string = query.to_string().to_ascii_lowercase().trim().to_string();
let trimmed = query.trim().trim_start_matches('@').to_ascii_lowercase();
if let Some((kind, raw)) = trimmed.split_once(':') {
let candidate = raw.trim().replace(' ', "-");
if !candidate.is_empty() {
match kind.trim() {
"models" | "model" | "stars" => {
search_type = "models";
search_string = candidate;
}
"sites" | "site" => {
search_type = "sites";
search_string = candidate;
}
"networks" | "network" => {
search_type = "networks";
search_string = candidate;
}
_ => {}
}
}
}
match self.stars.read() {
Ok(stars) => {
if let Some(star) = stars
.iter()
.find(|s| {
s.title.eq_ignore_ascii_case(&search_string)
|| s.id.eq_ignore_ascii_case(&search_string)
})
{
search_type = "models";
search_string = star.id.clone();
}
}
Err(e) => {
report_provider_error_background("omgxxx", "query.stars_read", &e.to_string());
}
}
match self.sites.read() {
Ok(sites) => {
if let Some(site) = sites
.iter()
.find(|s| {
s.title.eq_ignore_ascii_case(&search_string)
|| s.id.eq_ignore_ascii_case(&search_string)
})
{
search_type = "sites";
search_string = site.id.clone();
}
}
Err(e) => {
report_provider_error_background("omgxxx", "query.sites_read", &e.to_string());
}
}
match self.networks.read() {
Ok(networks) => {
if let Some(network) = networks
.iter()
.find(|n| {
n.title.eq_ignore_ascii_case(&search_string)
|| n.id.eq_ignore_ascii_case(&search_string)
})
{
search_type = "networks";
search_string = network.id.clone();
}
}
Err(e) => {
report_provider_error_background("omgxxx", "query.networks_read", &e.to_string());
}
}
let mut video_url = format!("{}/{}/{}/{}/", self.url, search_type, search_string, page);
video_url = video_url.replace(" ", "+");
// Check our Video Cache. If the result is younger than 1 hour, we return it.
let old_items = match cache.get(&video_url) {
Some((time, items)) => {
if time.elapsed().unwrap_or_default().as_secs() < 60 * 5 {
return Ok(items.clone());
} else {
let _ = cache.check().await;
return Ok(items.clone());
}
}
None => {
vec![]
}
};
let mut requester = requester_or_default(&options, module_path!(), "missing_requester");
let text = match requester.get(&video_url, None).await {
Ok(text) => text,
Err(e) => {
report_provider_error(
"omgxxx",
"query.request",
&format!("url={video_url}; error={e}"),
)
.await;
return Ok(old_items);
}
};
let video_items: Vec<VideoItem> = self.get_video_items_from_html(text.clone());
if !video_items.is_empty() {
cache.remove(&video_url);
cache.insert(video_url.clone(), video_items.clone());
} else {
return Ok(old_items);
}
Ok(video_items)
}
fn get_site_id_from_name(&self, site_name: &str) -> Option<String> {
// site_name.to_lowercase().replace(" ", "")
let sites_guard = match self.sites.read() {
Ok(guard) => guard,
Err(e) => {
report_provider_error_background(
"omgxxx",
"get_site_id_from_name.sites_read",
&e.to_string(),
);
return None;
}
};
for site in sites_guard.iter() {
if site
.title
.to_lowercase()
.replace(" ", "")
.replace(".com", "")
== site_name.to_lowercase().replace(" ", "")
{
return Some(site.id.clone());
}
}
return None;
}
fn extract_tag_entries(&self, video_segment: &str) -> Vec<(String, String)> {
let fragment = Html::parse_fragment(video_segment);
let selector = Selector::parse("div.models a").expect("valid omgxxx models selector");
fragment
.select(&selector)
.filter_map(|anchor| {
let href = anchor.value().attr("href")?.to_string();
let title = anchor
.text()
.collect::<Vec<_>>()
.join(" ")
.split_whitespace()
.collect::<Vec<_>>()
.join(" ");
if title.is_empty() {
return None;
}
Some((href, title))
})
.collect()
}
fn get_video_items_from_html(&self, html: String) -> Vec<VideoItem> {
if html.is_empty() {
println!("HTML is empty");
return vec![];
}
let mut items: Vec<VideoItem> = Vec::new();
if !html.contains("class=\"item\"") {
return items;
}
let raw_videos = html
.split("videos_list_pagination")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.split(" class=\"pagination\" ")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.split("class=\"list-videos\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("class=\"item\"")
.collect::<Vec<&str>>()[1..]
.to_vec();
for video_segment in &raw_videos {
// let vid = video_segment.split("\n").collect::<Vec<&str>>();
// for (index, line) in vid.iter().enumerate() {
// println!("Line {}: {}", index, line);
// }
let video_url: String = video_segment
.split("<a href=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
let mut title = video_segment
.split(" title=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
// html decode
title = decode(title.as_bytes()).to_string().unwrap_or(title);
let id = video_url
.split("/")
.collect::<Vec<&str>>()
.get(4)
.copied()
.unwrap_or_default()
.to_string();
// Skip advertisement cards. They reuse class="item" but link to an
// external ad network instead of an omg.xxx video (and embed an
// <iframe> rather than a real <img> thumbnail), so they have no
// numeric video id under /videos/.
if !video_url.contains("/videos/")
|| id.is_empty()
|| !id.chars().all(|c| c.is_ascii_digit())
{
continue;
}
// Thumbnail: the site lazy-loads most cards, putting the real image
// in data-src with a 1x1 base64 placeholder in src. Eager (high
// priority) cards carry the real image directly in src. Prefer
// data-src, fall back to src, and reject "data:" placeholders.
let img_tag = video_segment
.split("<img")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split('>')
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default();
let extract_attr = |attr: &str| -> String {
img_tag
.split(attr)
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split('"')
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string()
};
let data_src = extract_attr("data-src=\"");
let src = extract_attr(" src=\"");
let thumb = if !data_src.is_empty() && !data_src.starts_with("data:") {
data_src
} else if !src.is_empty() && !src.starts_with("data:") {
src
} else {
String::new()
};
let raw_duration = video_segment
.split("<span class=\"duration\">")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("<")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.split(" ")
.collect::<Vec<&str>>()
.last()
.unwrap_or(&"")
.to_string();
let duration = parse_time_to_seconds(raw_duration.as_str()).unwrap_or(0) as u32;
let views = parse_abbreviated_number(
video_segment
.split("<div class=\"views\">")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("<")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string()
.as_str(),
)
.unwrap_or(0) as u32;
let preview = video_segment
.split("data-preview=\"")
.collect::<Vec<&str>>()
.get(1)
.copied()
.unwrap_or_default()
.split("\"")
.collect::<Vec<&str>>()
.get(0)
.copied()
.unwrap_or_default()
.to_string();
let site_name = title
.split("]")
.collect::<Vec<&str>>()
.first()
.unwrap_or(&"")
.trim_start_matches("[");
let site_id = self
.get_site_id_from_name(site_name)
.unwrap_or("".to_string());
let mut tags = Vec::new();
let mut site_uploader: Option<OmgUploaderTarget> = None;
let mut network_uploader: Option<OmgUploaderTarget> = None;
for (href, tag_title) in self.extract_tag_entries(video_segment) {
if href.contains("/models/") {
let model_id = href
.split("/models/")
.nth(1)
.unwrap_or_default()
.split('/')
.next()
.unwrap_or_default()
.to_string();
if !model_id.is_empty() {
Self::push_unique(
&self.stars,
FilterOption {
id: model_id,
title: tag_title.clone(),
},
);
}
}
if href.contains("/sites/") {
let site_id = href
.split("/sites/")
.nth(1)
.unwrap_or_default()
.split('/')
.next()
.unwrap_or_default()
.to_string();
if !site_id.is_empty() {
Self::push_unique(
&self.sites,
FilterOption {
id: site_id,
title: tag_title.clone(),
},
);
}
}
if let Some(target) = self.uploader_target_from_href_and_title(&href, &tag_title) {
match target.kind {
OmgUploaderTargetKind::Site => {
if site_uploader.is_none() {
site_uploader = Some(target.clone());
}
}
OmgUploaderTargetKind::Network => {
if network_uploader.is_none() {
network_uploader = Some(target.clone());
}
}
}
}
if !tags.iter().any(|existing| existing == &tag_title) {
tags.push(tag_title);
}
}
if !site_id.is_empty() {
Self::push_unique(
&self.sites,
FilterOption {
id: site_id.clone(),
title: site_name.to_string(),
},
);
if !tags.iter().any(|existing| existing == site_name) {
tags.push(site_name.to_string());
}
if site_uploader.is_none() {
site_uploader = Some(OmgUploaderTarget {
kind: OmgUploaderTargetKind::Site,
id: site_id.clone(),
title: site_name.to_string(),
});
}
}
let mut video_item = VideoItem::new(
id,
title,
video_url.to_string(),
"omgxxx".to_string(),
thumb,
duration,
)
.views(views)
.preview(preview);
let uploader_target = site_uploader.or(network_uploader);
if let Some(uploader_target) = uploader_target {
video_item.uploader = Some(uploader_target.title.clone());
video_item.uploaderUrl = Some(format!(
"{}/{}/{}/",
self.url,
match uploader_target.kind {
OmgUploaderTargetKind::Site => "sites",
OmgUploaderTargetKind::Network => "networks",
},
uploader_target.id
));
video_item.uploaderId = Some(Self::canonical_uploader_id(
&uploader_target.kind,
&uploader_target.id,
));
}
if !tags.is_empty() {
video_item.tags = Some(tags);
}
items.push(video_item);
}
return items;
}
}
#[cfg(test)]
mod tests {
use super::*;
fn test_provider() -> OmgxxxProvider {
OmgxxxProvider {
url: "https://www.omg.xxx".to_string(),
sites: Arc::new(RwLock::new(vec![FilterOption {
id: "clubsweethearts".to_string(),
title: "Club Sweethearts".to_string(),
}])),
networks: Arc::new(RwLock::new(vec![FilterOption {
id: "mofos".to_string(),
title: "Club Sweethearts".to_string(),
}])),
stars: Arc::new(RwLock::new(vec![])),
}
}
#[test]
fn uploader_name_prefers_site_before_network() {
let provider = test_provider();
let target = provider
.uploader_target_from_name("Club Sweethearts")
.expect("target should resolve");
assert!(matches!(target.kind, OmgUploaderTargetKind::Site));
assert_eq!(target.id, "clubsweethearts");
}
#[test]
fn uploader_id_round_trips_for_networks() {
let provider = test_provider();
let target = provider
.uploader_target_from_id("omgxxx:network:mofos")
.expect("target should resolve");
assert!(matches!(target.kind, OmgUploaderTargetKind::Network));
assert_eq!(target.id, "mofos");
assert_eq!(
OmgxxxProvider::canonical_uploader_id(&target.kind, &target.id),
"omgxxx:network:mofos"
);
}
#[test]
fn parses_model_and_site_tags_without_empty_strings() {
let provider = test_provider();
let html = r##"
<div class="list-videos">
<div class="item">
<a href="https://www.omg.xxx/videos/4290034/example-video/" title="[Club Sweethearts] Example Video"></a>
<img loading="lazy" data-src="https://cdn.example/thumb.jpg" />
<span class="duration">Duration 12:34</span>
<div class="views">1.2M</div>
<div class="thumb" data-preview="https://cdn.example/preview.mp4"></div>
<div class="models">
<a class="models__item thumb_cs" href="https://www.omg.xxx/sites/clubsweethearts/" style="order: 0;">
<svg class="icon icon-tv"><use xlink:href="#icon-tv"></use></svg>
<span>Club Sweethearts</span>
</a>
<a class="models__item thumb_model" href="https://www.omg.xxx/models/oliver-trunk/" style="order: 0;">
<svg class="icon icon-star"><use xlink:href="#icon-star"></use></svg>
<span>Oliver Trunk</span>
</a>
<a class="models__item thumb_model" href="https://www.omg.xxx/models/sara-bork/" style="order: 0;">
<svg class="icon icon-star"><use xlink:href="#icon-star"></use></svg>
<span>Sara Bork</span>
</a>
</div>
</div>
</div>
"##
.to_string();
let items = provider.get_video_items_from_html(html);
assert_eq!(items.len(), 1);
assert_eq!(
items[0].tags,
Some(vec![
"Club Sweethearts".to_string(),
"Oliver Trunk".to_string(),
"Sara Bork".to_string()
])
);
assert!(
items[0]
.tags
.as_ref()
.unwrap()
.iter()
.all(|tag| !tag.is_empty())
);
let stars = provider.stars.read().unwrap().clone();
assert!(
stars
.iter()
.any(|tag| tag.id == "oliver-trunk" && tag.title == "Oliver Trunk")
);
assert!(
stars
.iter()
.any(|tag| tag.id == "sara-bork" && tag.title == "Sara Bork")
);
assert_eq!(items[0].uploader.as_deref(), Some("Club Sweethearts"));
assert_eq!(
items[0].uploaderUrl.as_deref(),
Some("https://www.omg.xxx/sites/clubsweethearts/")
);
assert_eq!(
items[0].uploaderId.as_deref(),
Some("omgxxx:site:clubsweethearts")
);
}
#[test]
fn parses_live_item_shape_with_channel_and_pornstar_info() {
let provider = test_provider();
let html = r##"
<div class="list-videos">
<div class="item">
<a href="https://www.omg.xxx/videos/93763302/step-daughter-vol-2-scene-3/" target="_blank" title="Step Daughter Vol.2 Scene 3">
<div class="img thumb__img" data-preview="https://cast.omg.xxx/preview/93763302.mp4">
<img loading="lazy" class="thumb lazyloaded" src="https://img.omg.xxx/93763000/93763302/medium@2x/1.jpg" data-src="https://img.omg.xxx/93763000/93763302/medium@2x/1.jpg" alt="Step Daughter Vol.2 Scene 3" width="0" height="0">
<span class="duration"> Full Video 26:44 </span>
<span class="js-favourites thumb-favourites" data-action="add" data-type="video" data-object_id="93763302">
<svg class="icon icon-heart-plus"><use xlink:href="#icon-heart-plus"></use></svg>
<svg class="icon icon-trashcan"><use xlink:href="#icon-trashcan"></use></svg>
</span>
</div>
</a>
<div class="item-info">
<a href="https://www.omg.xxx/videos/93763302/step-daughter-vol-2-scene-3/" title="Step Daughter Vol.2 Scene 3">
<strong class="title"> Step Daughter Vol.2 Scene 3 </strong>
</a>
<div class="models is-truncated">
<a class="models__item thumb_cs" href="https://www.omg.xxx/sites/family-sinners/" style="order: 0;">
<svg class="icon icon-tv"><use xlink:href="#icon-tv"></use></svg>
<span>Family Sinners</span>
</a>
<a class="models__item" href="https://www.omg.xxx/models/vienna-rose/" style="order: 0;">
<svg class="icon icon-star"><use xlink:href="#icon-star"></use></svg>
<span>Vienna Rose</span>
</a>
<a class="models__item" href="https://www.omg.xxx/models/mark-wood/" style="order: 1;">
<svg class="icon icon-star"><use xlink:href="#icon-star"></use></svg>
<span>Mark Wood</span>
</a>
</div>
<div class="wrap">
<div class="rating positive "> 100% </div>
<div class="views">4.8K</div>
</div>
</div>
</div>
</div>
"##
.to_string();
let items = provider.get_video_items_from_html(html);
assert_eq!(items.len(), 1);
assert_eq!(
items[0].tags,
Some(vec![
"Family Sinners".to_string(),
"Vienna Rose".to_string(),
"Mark Wood".to_string()
])
);
let sites = provider.sites.read().unwrap().clone();
assert!(
sites
.iter()
.any(|tag| tag.id == "family-sinners" && tag.title == "Family Sinners")
);
let stars = provider.stars.read().unwrap().clone();
assert!(
stars
.iter()
.any(|tag| tag.id == "vienna-rose" && tag.title == "Vienna Rose")
);
assert!(
stars
.iter()
.any(|tag| tag.id == "mark-wood" && tag.title == "Mark Wood")
);
}
#[test]
fn skips_ads_and_extracts_thumbs_from_current_markup() {
// Mirrors the live omg.xxx markup as of mid-2026: <img> tags no longer
// carry a `loading` attribute, eager cards put the real image in `src`,
// lazy cards put a base64 placeholder in `src` with the real image in
// `data-src`, and advertisement cards reuse class="item" but link off-site.
let provider = test_provider();
let html = r##"
<div class="list-videos">
<div class="item">
<a href="https://www.omg.xxx/videos/93816267/eager-video/" title="Eager Video">
<img class="thumb thumb_img " fetchpriority="high" src="https://img.omg.xxx/93816000/93816267/medium@2x/1.jpg" alt="Eager Video" width="744" height="420"/>
<span class="duration"> 12:00 </span>
</a>
</div>
<div class="item">
<a href="https://a.aivanta76.com/native_txt?creative=native_txt" target="_blank" title="Create and Fuck your AI Cum Slut" class="">
<iframe src="https://engine.ultraomelette.com/banner"></iframe>
</a>
</div>
<div class="item">
<a href="https://www.omg.xxx/videos/93816269/lazy-video/" title="Lazy Video">
<img loading="lazy" class="thumb thumb_img lazyload" fetchpriority="high" src="data:image/gif;base64,R0lGODlhAQABAIAAAAAAAP///yH5BAEAAAAALAAAAAABAAEAAAIBRAA7" data-src="https://img.omg.xxx/93816000/93816269/medium@2x/1.jpg" alt="Lazy Video" width="744" height="420"/>
<span class="duration"> 08:30 </span>
</a>
</div>
</div>
"##
.to_string();
let items = provider.get_video_items_from_html(html);
// The advertisement card must be filtered out.
assert_eq!(items.len(), 2);
assert!(items.iter().all(|item| item.url.contains("/videos/")));
assert!(
!items
.iter()
.any(|item| item.title.contains("AI Cum Slut"))
);
// Thumbnails must be real CDN URLs, never empty or base64 placeholders.
for item in &items {
assert!(
item.thumb.starts_with("https://img.omg.xxx/"),
"unexpected thumb: {:?}",
item.thumb
);
assert!(!item.thumb.starts_with("data:"));
}
assert_eq!(items[0].id, "93816267");
assert_eq!(
items[0].thumb,
"https://img.omg.xxx/93816000/93816267/medium@2x/1.jpg"
);
assert_eq!(items[1].id, "93816269");
assert_eq!(
items[1].thumb,
"https://img.omg.xxx/93816000/93816269/medium@2x/1.jpg"
);
}
}
#[async_trait]
impl Provider for OmgxxxProvider {
async fn get_videos(
&self,
cache: VideoCache,
pool: DbPool,
sort: String,
query: Option<String>,
page: String,
per_page: String,
options: ServerOptions,
) -> Vec<VideoItem> {
let _ = per_page;
let _ = pool;
let videos: std::result::Result<Vec<VideoItem>, Error> = match query {
Some(q) => {
self.query(cache, page.parse::<u8>().unwrap_or(1), &q, options)
.await
}
None => {
self.get(cache, page.parse::<u8>().unwrap_or(1), &sort, options)
.await
}
};
match videos {
Ok(v) => v,
Err(e) => {
println!("Error fetching videos: {}", e);
vec![]
}
}
}
fn get_channel(&self, clientversion: ClientVersion) -> Option<crate::status::Channel> {
Some(self.build_channel(clientversion))
}
async fn get_uploader(
&self,
cache: VideoCache,
pool: DbPool,
uploader_id: Option<String>,
uploader_name: Option<String>,
query: Option<String>,
profile_content: bool,
options: ServerOptions,
) -> std::result::Result<Option<UploaderProfile>, String> {
let _ = pool;
let Some(target) =
self.resolve_uploader_target(uploader_id.as_deref(), uploader_name.as_deref())
else {
return Ok(None);
};
self.build_uploader_profile(cache, &target, query.as_deref(), profile_content, &options)
.await
.map_err(|error| error.to_string())
}
}